📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 22 أغسطس — تحسين كفاءة LLMs

أسبوعي مكثّف 📅 2026-08-22
هلقيت هالأسبوع مجموعة أوراق بتسلّط الضوء على كيف بنقوّي الـLLMs من نواحي الكفاءة، التكلفة، والآمان. فريق Chen قدم Repo0 اللي بيوظّف Dual‑DAG لتوليد كود موجه وبنية مشروع مرنة. مقارنة الـLLMs مع الـembedding أظهرت إن الأداء قريب بس الـLLMs أغلى، فالمجتمع عم يدور حلول أرخص مثل IAR اللي بيدخّل ويوازن ويستعيد المعرفة بدون تدريب مستمر. كمان شفنا إطارات جديدة لتوسيع البيانات الإبداعية (Attribute‑Guided) وتوليد بيانات صناعية متعددة اللغات (HOTFIXR) لتقوية النماذج. اختبارات مثل MemTrapBench بتكشف فخاخ الذاكرة، وطرق مثل RGA‑Designer وSkillEvo بتحسّن تواصل الوكلاء وتطوّر مهاراتهم بأقل استهلاك للرموز. كل هالإنجازات بتقربنا من نماذج أكثر فاعلية وأماناً.
#1

Repo0: توليد كود من الصفر للكل بتصميم موجه

Repo0: Design-Driven Zero-to-All Code Generation
فريق Chen وزملاؤه قدموا Repo0، إطار بيشتغل على تطوير بنية المشروع بشكل مستمر من خلال Dual‑DAG اللي بيجمع متطلبات المستوى الأول ومكوّنات الكود وعلاقتها. النظام بيعدّل حدود المكوّنات بإجراءات هيكلية موجهة بمقاييس modularity لحد ما توصل لهندسة ثابتة، وبعدها بيولّد الكود بطريقة test‑driven. التقييم على ستة مستودعات حقيقية باستخدام GPT‑5 mini وDeepSeek V3.2 بيّن إن Repo0 حقق أعلى Functionality Coverage وPass Rate، وتفوّق على أقوى baseline اسمه RPG بفارق كبير.
ليش بتهمّك؟: الورقة بتخلّي توليد مشروع برمجي كامل من المتطلبات النصية يكون منظم وفعّال، وبتقلل وقت التطوير بشكل ملحوظ.
code generation software engineering architecture LLM AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

معضلة الـ Embedder: LLMs أقوى، بس بتكلفة إيه؟

The Embedder's Dilemma: LLMs Are Better, but at What Cost?
الباحثين عملوا مقارنة مدروسة بين عشر LLMs من ست عائلات و٢٦ نموذج embedding على ٣٧ مهمة متنوعة، من التصنيف للبحث والاسترجاع. لقوا إن الأداء العام للـ LLMs والـ embedding models تقريباً متساوي، بس الـ LLMs أغلى بكتير، ممكن توصل تكلفة تشغيلها لأكثر من ألف مرة من تكلفة الـ embedding model. كمان لاحظوا إن الـ LLMs تتفوق بالبحث اللي يحتاج تفكير، بينما نماذج الـ embedding تتفوق بالتصنيف، وبالمهام الثانية الأداء متقارب. النتيجة إنو بننصح نستخدم الـ embedding models للمهام اللي تعتمد على التشابه والتصنيف، ونخلي الـ LLMs للبحث اللي فيه استدلال معقّد.
ليش بتهمّك؟: هالنتائج بتساعد المطوّرين يختاروا الأدوات الصح حسب ميزانيتهم واحتياجاتهم من الدقة والسرعة.
LLM embeddings benchmark cost retrieval hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

إدخال، توجيه، استرجاع: IAR لتثبيت معرفة المستندات داخل LLM بدون استرجاع

Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
الفريق قدم طريقة IAR اللي بتنقسم لتلات مراحل بعد التدريب: Inject بيدخل محتوى المستندات للـmodel، Align بيوجه سلوك الإجابة على الأسئلة، وRecover بيرجع القدرات العامة للـmodel. الطريقة بتستبدل التدريب المستمر التقليدي وبتستغل أهداف إعادة بناء النصوص المشروطة. التجارب على موديلات Llama، Phi، Qwen، وSmolLM أظهرت تحسين واضح بدقة الأسئلة داخل المجال وبتقليل الانخفاض بالقدرات العامة.
ليش بتهمّك؟: هالطريقة بتخلّي الموديلات تجاوب على أسئلة عن مستندات محددة بدون ما تحتاج تسترجعها وقت السؤال، يعني أسرع وأقل تكلفة.
post-training retrieval-free language-models knowledge-internalization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

توسيع الكتابة الإبداعية مع Attribute‑Guided Genre Expansion

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion
الفريق بقيادة Hwan Chang ورفاقه بيقترح إطار Attribute‑Guided Genre Expansion لتوسيع بيانات الكتابة الإبداعية بعيداً عن القصص بس. الفكرة إننا بنفصل بين تنوع المواضيع والتحكم بنوع النص، وبنستغل أسئلة قصصية مكتوبة من البشر كـ seeds، وبنضيف سمات مخصصة لكل جنس عشان تفرض القواعد الهيكلية والستايل. النتيجة مجموعة Multi‑Genre Collection فيها 50 ألف مثال على 13 جنس إبداعي، من قصص وراب وأغاني وسيناريوهات وتصاميم ألعاب. التجارب بتبين إنو النماذج المدربة على هالإشي بتتفوق على النماذج الأساسية وعلى مجموعات بيانات كتابة تانية.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة تكتب بأشكال إبداعية متنوعة، مو بس قصص، فبتفتح فرص لتطبيقات أكتر.
creative-writing genre fine-tuning dataset LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

LLMs بتصير أذكى مع بيانات صناعية متعددة اللغات

LLMs Get Smarter from Targeted Synthetic Multilingual Data
الفريق قدم طريقة اسمها HOTFIXR، وهي إطار لتوليد بيانات صناعية تستهدف نقاط الضعف اللغوية للـ LLM. الفكرة إنو بيستخدموا نموذج يكتشف وين النموذج الأصلي بيفشل بعدين يولد جمل بعدة لغات لتقويه. التجارب أظهرت تحسين متوسط الأداء داخل التوزيع بـ 6.2% وتقليل النسيان الكارثي بـ 3.7% على مهام خارج التوزيع، وكمان رفع الأداء على لغات جديدة بـ 7.1%.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج تتعامل مع أسئلتك بأي لغة بدون ما يضلوا يخلطوا أو ينسوا.
multilingual data-centric LLM synthetic-data evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

MemTrapBench: اختبار الفخاخ الإدراكية في ذاكرة LLM

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
هالورقة قدمت MemTrapBench، بنشمارك بيقيس فخاخ الإدراك اللي ممكن الذاكرة تسببها للـLLM. بنغطي نوعين: Reasoning Fixation و Belief Distortion. التجارب على عيلتين من الموديلات وخمسة أطر للذاكرة بيّنوا إن كل الاستراتيجيات الذاكرة أقل أداءً من عدم استخدامها، وحتى أقوى طريقة خسرت أكتر من 10٪. بعدين اقترحوا AdaptiveMem، طريقة بسيطة وقت الاستدلال بتعلم الـLLM يتجنب هالفخاخ وبيحافظ أو حتى يحسن الأداء.
ليش بتهمّك؟: الفخاخ الإدراكية ممكن تخلي المساعدات الذكية تعطي إجابات مضللة، وAdaptiveMem بيقلل هالمشكلة.
LLM memory benchmark cognitive traps inference arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

تصميم شبكة تواصل بين الوكلاء بأقل استهلاك للرموز مع RGA-Designer

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design
الفريق قدم طريقة جديدة لتصميم طوبولوجيا التواصل بين الوكلاء باستخدام LLM، بس مع تركيز على تقليل استهلاك الرموز. الطريقة القديمة ARG-Designer كانت تولد الرسومات بطريقة أوتوريجريسيفية بس ما كان فيها حافز لتصميم شبكات نازلة. هالورقة قدمت RGA-Designer اللي بتستعمل نموذج مكافأة (reward model) مستوحى من RLHF لتوجيه مولد الرسومات ليطلع شبكات مضغوطة. النتيجة إنو حافظت على دقة المهمة متل ARG-Designer وقللت استهلاك الرموز بحوالي 20.5٪.
ليش بتهمّك؟: هالطريقة بتخلي أنظمة الوكلاء تشتغل أسرع وبمصروف رموز أقل، يعني بنوفر وقت وحوسبة.
graph generation multi-agent systems RLHF efficiency topology arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

SkillEvo: تطوّر مهارات الوكلاء عبر تغذية راجعة متعددة الجولات

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
الفريق قدم طريقة جديدة لتطوير مهارات الوكلاء بحيث ما يوقفوا عند أول فشل. بدل ما يعتمدوا على سؤال‑جواب مرة وحدة، بيستعملوا محاكاة حوارية متعددة الجولات لتوليد تغذية راجعة موثوقة، وكل جولة بتصقل المهارة وتولد تغذية جديدة. كمان أضافوا طبقة حوكمة مستقلة بتصّحّح الأخطاء الواقعية وتمنع تدهور البنية بدل ما تكتفي برفض النتيجة بس. التجربة على تسع مهارات سحابية أكدت إنّهم يرفعوا الدقة بكتير مقارنةً بالطرق السابقة.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يتعلموا من أخطائهم على مدار محادثات طويلة، فبيصيروا أدق وأكتر موثوقية بالمستقبل.
agent skill evolution feedback multi-turn governance hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

نهج وكيل لتجميع البيانات النشطة وتوقع الطلب المتأثر بالطقس

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
الباحثين قدموا نهج وكيل ثلاثي يدمج جمع بيانات محادثاتي، معالجة هيكلية، وتوقع سلوك السفر. استعملوا شات بوت مع صور للطقس لجمع اختيارات النقل من طلاب، وحللوا النتائج بنموذج multinomial logit مع مقارنات machine‑learning مثل logistic regression وrandom forest، وجربوا تسعة LLMs بأوضاع zero‑shot، persona، few‑shot، والرؤية. أحسن نموذج نص‑فقط وصل لـ 69.9% دقة، ولما ضفوا الصور وصل لـ 71.5%، وبيّنوا إن المعلومات عن العادات والسياق الوكّالي بتساعد كتير.
ليش بتهمّك؟: هالطريقة بتخلي تنبؤات طلب النقل أكتر دقة وبتقصر الوقت بين جمع البيانات والتحليل.
agents LLM multimodal travel behavior demand prediction arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

Mimir v1: نموذج لغة 1 بليون باراميتر مفتوح بأداء متقدّم

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data
الفريق اللي بقيادة Peter Schneider-Kamp قدم نموذج Mimir v1، وهو نموذج لغة 1‑بليون باراميتر مبني على بنية Hierarchical Reasoning Model (HRM) وتدرب من الصفر باستخدام بيانات ما بعد التدريب المسموح فيها فقط. استخدموا مزيج من 161 مجموعة بيانات، وحققوا أداء منافس للنماذج الكبيرة مثل Qwen 3.5 4B وGemma 4 E2B على 20 benchmark للإنجليزي والرياضيات والبرمجة والدنماركي. النموذج متاح على Hugging Face Hub بعد ما انتشر على Hugging Face Daily Papers وجمع 21 upvote، وهو أصلاً preprint على arXiv.
ليش بتهمّك؟: هالورقة بتعطي الباحثين ومطوّري التطبيقات مصدر مفتوح عالي الأداء ومبني على بيانات أخلاقية، يعني بيقلل الحواجز للابتكار.
language model open-source multilingual benchmark HRM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

HarmProfile: ملفّ خطر النماذج المتقدمة

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs
إحنا الباحثين قدمنا HarmProfile، مجموعة بيانات بتركّز على المحتوى الضار اللي بيطلع من النماذج الكبيرة المتقدمة. فيها أكتر من 80 ألف مثال من 23 نموذج عبر 13 عيلة نموذج، مصنّفة بـ15 فئة ضرر و57 فئة فرعية. من خلال التحليل شفنا إنه كل ما النموذج أقوى، بِصير الأخطاء الضارة أكتر وتنوعها كتير، يعني ممكن يبين آمن بس وراه مخاطر أكبر. الفكرة إنو من المحتوى اللي بيطلع بنقدر نحدّد ملفّ خطر كل نموذج.
ليش بتهمّك؟: هالورقة بتساعدنا نفهم وين الخطر الحقيقي للنماذج المتقدمة ونطوّر طرق أمان أدق.
LLM safety benchmark risk dataset hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

نموذج لغة كيميائي مدرك للمعقولية لتصميم التفاعلات خطوة بخطوة

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
الفريق جمع مجموعة ضخمة من حوالي 45.6 مليون تفاعل كيميائي موثّق وسماها CREED-CCV-2+USPTO-XL. استخدموا أسلوب Top‑K prompting لتدريب نموذج C3LM، وضفوا مكافآت مبنية على ChemCensor والابتكار، فصار يحقق أعلى دقة على benchmark URSA‑expert‑2026. التحليل بيّن إن النماذج اللغوية الكبيرة تكتشف مسارات تفاعلية مختلفة عن النماذج التقليدية، وهاد بيفتح الباب لتجميعهم بنظام ensemble أقوى.
ليش بتهمّك؟: هالطريقة بتعطي كيميائيين تنبؤات متعددة ومعقولة، فبيقللوا وقت التجارب الفاشلة وبيسرّعوا تطوير الأدوية.
retrosynthesis LLM chemistry dataset benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 15 أغسطس — نظام متعدد الوكلاء
📚 كل الأعداد