📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 28 أغسطس — تطور تدريب الوكلاء

أسبوعي مكثّف 📅 2026-08-28
غبنا أسبوعين — بس الموقع ما وقف: نزلت ست مقالات جديدة، وبنينا **عناقيد المصطلحات**، وهي طريقة جديدة تقرا فيها مجموعة مصطلحات مترابطة بترتيب تعليمي بدل ما تدوّر كلمة كلمة.

وهالأسبوع بالأبحاث، الخيط الواضح كان: **الوكلاء بيتعلّموا يتصرّفوا بالعالم الحقيقي مش بالمختبر.** ورقة UrbanGround حطّت وكلاء بمدينة كاملة وقاست إذا بيقدروا يفهموا ويتنقّلوا — والنتيجة كانت تواضع مفيد. وورقة تانية عملت تحرير فيديو متعدّد اللقطات بوكيل بدل تقطيع عشوائي.

بس أكتر وحدة وقفت عندها كانت سؤالاً بسيطاً ومزعج: **هل قدرات النموذج ثابتة لما تغيّر اللغة؟** الجواب: لأ. نفس النموذج بيعطي أداءً مختلفاً حسب اللغة اللي بتحكي فيها — وهاد بالضبط اللي بنحسّه كل يوم لما نستخدمه بالعربي.

وهو نفس السبب اللي خلّاني أكتب مقالة هالأسبوع عن **متصفّحات الذكاء الاصطناعي**: كل ما الوكيل صار ينفّذ بدالك، صار السؤال مش «قديش ذكي؟» — صار **«قديش مسموحله؟ وشو بيمرق بلا ما أشوفه؟»**
#1

TTPO: تحسين السياسة وقت الاختبار للـ LLM

TTPO: Test-Time Policy Optimization
الفريق Wang وزملاؤه قدموا طريقة جديدة اسمها Test-Time Policy Optimization (TTPO) لتدريب نماذج اللغة الكبيرة وقت ما بنستخدمها، من غير ما نحتاج لتسميات صحيحة. الفكرة إنه إذا كان في تصويت أغلبية للجواب، بنستغل الردود المتوافقة مع هالتصويت ونقويها عبر On-Policy Self-Distillation، وبنعاقب الردود المتعارضة باستخدام Grouped RL. كمان بيتم اختيار الكلمات على مستوى التوكن لتقليل الأخطاء وتخفيف العقاب على الأخطاء الواثقة. النتيجة إنه TTPO توصل لأداء يساوي الطرق المدربة بتسميات صحيحة على خمس Benchmarks وتزيد من دقة Qwen3-1.7B من 38% لـ45% بدون أي تسميات.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة تتعلم وتتحسّن مباشرةً على المهمات بدون ما نحتاج نجهّز بيانات معلمة، فبتقصر وقت التطوير وتقلّل التكاليف.
LLM test-time training reinforcement learning self-distillation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

PAWBench: قياس مدى توافق نماذج الفيديو مع التوزيع الاحتمالي

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
الفريق قدم PAWBench، معيار جديد بيفحص إذا كانت نماذج توليد الفيديو ما بتنتج بس مشهد مقنع، بل كمان بتعكس التوزيع الاحتمالي للسلوكيات الممكنة من نفس النقطة الابتدائية. حطوا بروتوكول اسمه PAWEval يحول مجموعة فيديوهات مكررة لتوزيعات فعلية، وجربوا 11 نظام على 50 سيناريو. النتائج ورجّت إن ولا نموذج قدر يطابق الاحتمالات المرجعية ولا يغطي كل السلوكيات الصحيحة. هالنتائج بتوضح الفجوة الكبيرة بين النماذج الحالية وفكرة النماذج العالمية المتوافقة احتماليًا.
ليش بتهمّك؟: المعرفة إذا النماذج ما بتعكس التوزيع الحقيقي بتخلينا نعيد تصميمها لتكون أكثر موثوقية في التطبيقات الواقعية.
video generation benchmark world modeling probabilistic alignment evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

UrbanGround: اختبار قدرة الوكلاء المتعددين على الفهم والحركة بالمدينة

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
الفريق قدم UrbanGround، sandbox أول بيوصلنا لنسخة مكوّنة من هونغ كونغ ثلاثية الأبعاد عشان نختبر إذا الوكلاء المتعددين يقدروا يحولوا الإدراك المحلي لإجراءات موثوقة بالمدينة. النظام بيدبـتفاعل حلقي من منظور الشخص الأول مع خريطة تفاعلية للتنقل، وبيطرح ثلاث أسئلة بحثية: هل الوكيل يقدر يفهم المشهد المحلي للإجابة على أسئلة فضائية بعد الملاحظة؟ وهل هالفهم بيدبـالتنقل للوجهات البعيدة؟ وأخيرًا، هل السلوك بيصمد قدام تغيّر الطرق وحركة المشاة. النتائج بتظهر إن الوكلاء عندهم قدرات بصرية وتفكير فضائي قصير المدى، لكن التوجيه والحركة مع مراعاة المشاة غير موثوقة، ومع الاستكشاف الطويل بتتراكم الأخطاء وما بيصير عندهم سلوك هدف موجه ثابت.
ليش بتهمّك؟: هالورقة بتوضح حدود الوكلاء الحاليين وتساعدنا نطوّر أنظمة تنقل ذكية قادرة تتعامل مع بيئات حضرية معقّدة.
MLLM urban navigation simulation agent evaluation spatial reasoning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

شو بيميز بيانات الوكلاء الفعّالة؟ نظرة ACE لتوليد البيانات للـ LLM Agents

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
الباحثين قدموا إطار ثنائي المستوى لتصنيف وتوليد بيانات الوكلاء للـ LLM Agents. بيعرّفوا البيانات ككائن (E,q,τ,v) بيجمع بين مواصفات البيئة، إشارة المهمة، التفاعل، ومُتحقق اختياري. بعدين بيستخدموا منظور ACE (Accuracy‑Complexity‑divErsity) لتصميم توزيعات البيانات بحيث تكون دقيقة، معقّدة على قدر المتعلم، ومتنوّعة لتغطي سلوكيات مختلفة. الدراسة بتستعرض كيف الأبحاث السابقة بتحقق الدقة، بتضبط الصعوبة، وبتوسّع التغطية، وبتقترح اتجاهات لتوليد بيانات أكثر فاعلية مع تطور الوكلاء والبيئات.
ليش بتهمّك؟: لأن توليد بيانات دقيقة ومتنوعّة بيساعد الوكلاء يتعلموا أسرع ويقللوا الجهد الضايع على بيانات غير مفيدة.
agentic data LLM ACE data generation evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

تدريب الوكلاء لتتطور مع الـ Harness: تقرير تقني من TaoLive

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
الفريق قدم طريقة جديدة اسمها Harness‑Aware Training (HAT) لتدريب موديلات صغيرة تتعامل مع الـ Harness المتغيّر. الطريقة بتضيف Harness‑State Augmentation (HSA) لتغيّر هوية الـ Skills والأدوات بطريقة ما بتغيّر المهمة، وبتشتغل بثلاث مراحل: أولاً HSA‑SFT لتتعلم من مسارات نماذج قوية، ثم General On‑Policy Distillation لاسترجاع العمومية، وآخرها HSA‑RL لتقوي المتانة عبر التعلم المعزز. النتائج على أربع مجموعات اختبار وصلت لـ94.8٪ على أسئلة البث الحي و94.6٪ على أسئلة الـ Harness المتغيّر، مع زمن استجابة P50 = 3.4 ث وP95 = 8.1 ث على GPU وحدة.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يجاوبوا بسرعة وبدقة حتى لو تغيرت الأدوات أو الأسئلة، يعني بيصيروا أكثر فاعلية في البث الحي.
agents training reinforcement learning digital avatars latency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

تحرير الفيديو المتعدد اللقطات بالوكيل الذكي

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
الورقة بتقدّم مهمة جديدة اسمها Multi-Instruction Multi-Shot Long-Video Editing (MMLVE) لتعديل الفيديوهات الطويلة وفق أكتر من توجيه. بدّوا يحققوا ثلاث أهداف: الحفاظ على اتساق التعديل بين اللقطات، فصل التعليمات المتعددة، والحفاظ على البنية الزمكانية بدون تدمير. لإلّا، صمموا إطار عمل وكيل بيستغل Large Language Models وVision-Language Models لتقسيم الفيديو على مستوى اللقطة وفهم التعليمات بدقة. كمان بنوا مجموعة بيانات MMLVE-Bench وثلاث مقاييس لتقييم الأداء، وأظهروا إن MMLVE-Agent بيتفوق على الطرق السّكّوتية الموجودة.
ليش بتهمّك؟: هالطريقة بتخلّي تعديل الفيديوهات الطويلة أكتر دقة وتجنّب الأخطاء اللي بتظهر مع التقسيم العشوائي.
video editing multi-shot LLM VLM benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

Self-OPD: تلميذ بيعلّم نفسه للـ Flow Matching بدون معلم

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
الفريق قدم Self-OPD، طريقة جديدة بتخلّي نموذج الـ flow matching يتعلم من استكشافه الذاتي بدل ما يحتاج معلم مخصوص لكل مهمة. كل خطوة بيقسم التنبؤ deterministic لعدة مرشّحات عشوائية (SDE) وبيركّبهم مع الـ ODE sampler، بعدين بيقارن المكافآت مع مرجع ثابت ليحسب الـ advantage. بعدين بيطبّق هدف pull‑push بيجذب الفروع اللي عندها advantage عالي وبدفع اللي عندها منخفضة، مع تعديل حسب الاتجاه وتغيّر الـ SDE. التجارب على benchmarkات مكافآت مفردة ومختلطة بيّنت إن Self-OPD يتفوّق على طرق RL وOPD القديمة من غير ما يحتاج معلم خاص.
ليش بتهمّك؟: هالطريقة بتقلل كتير من تكلفة التدريب وبتحسّن جودة النماذج بدون ما نحتاج نضيع وقت على تدريب معلمين لكل هدف جديد.
distillation flow matching self-supervised RL generative models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

CaSKG: رسمة مهارات مضادة للواقع للوكيل

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
الفريق قدم CaSKG، إطار رسمة مهارات بيستعمل علاقات سببية‑مضادة للواقع عشان يضبط استرجاع المهارات للوكيل. بيبني رسمة موجهة عالية الاستدعاء من دليل مهارات كبير باستخدام أدلة دلالية، نصية، ومدخل/مخرج، وبعدين بيصقلها بمدقق LLM وإثباتات مضادة للواقع. بعد ما يطبق استعلامات نصية بتشيل أو تبدل أو تعيد ترتيب أزواج المهارات، بيجمع الأدلة بعملية Bayesian smoothing وبيطلع رسمة وزنها موثوقة للمهام. التجربة على ALFWorld وScienceWorld أظهرت إنه CaSKG جاب أعلى درجات بالمقارنة مع Graph‑of‑Skills.
ليش بتهمّك؟: هالطريقة بتخلي الوكلاء يلقوا المهارات اللازمة بسرعة وبدقة أعلى، فبيحسّن أداءهم بالمهمات المعقّدة.
skill retrieval graph LLM agent benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

هل المهارات ثابتة عبر اللغات في LLMs؟

Skill Issue: Are Skills Language-Invariant in LLMs?
الفريق استكشف إشي مهم: هل نماذج اللغة الكبيرة بتتغيّر مهاراتها لما نتعامل معها بلغات مختلفة؟ استخدموا طريقة multilingual self‑play، يعني نسختين من نفس النموذج بيتنافسوا بلعبة نصية، كل وحدة بتلعب بلغة غير التانية، وهيك بيقفلوا كل العوامل غير اللغة. بعد ما جربوا ثلاث نماذج مفتوحة الوزن على ثمان لغات وست ألعاب، لقوا إنه القوة بتتغيّر كتير حسب اللغة، مع اختلاف واضح بالنتايج والاستراتيجيات.
ليش بتهمّك؟: هالنتايج بتبين إنه لازم ننتبه لتفاوت الأداء بين اللغات عشان نطوّر نماذج أكثر عدالة وشمولية.
multilingual LLM evaluation self-play cross-lingual hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

نموذج عالم الكود: وكيل برمجي كدماغ عالمي

Code World Model: Coding Agent as World Brain
الفريق قدم إطار اسمه Code World Model بيقسم عملية تطور العالم عن شكل الفيديو. الوكيل البرمجي بيستخدم قدرات النماذج اللغوية لتفكير بالأحداث وتوليد برمجة بتحافظ على حالة العالم بشكل مستمر، وبعدها بيحول هالبرمجة إلى تمثيل وسيط بيترجمه نموذج الفيديو لصور عالية الجودة. بعد ما عدلوا النموذج على بيانات ألعاب، طلع MiniMax‑H3 يقدر يتبع التعليمات البرمجية ويطلع فيديوهات بتفاصيل غنية. النتيجة بتظهر إن الجمع بين البرمجة والنماذج البصرية ممكن يفتح طريق لعوالم مفتوحة ومستمرة.
ليش بتهمّك؟: هالطريقة بتخلينا نبني أنظمة ألعاب أو محاكيات بتستمر وتتعلم بدون ما نعيد كتابة كل شيء يدويًا.
multimodal world-model video-generation language-model hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

فهم استراتيجيات التطور لتفكير الـLLM: تغطية أوسع للمنطق مقارنةً بـGRPO

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
هالورقة بتستكشف كيف استراتيجيات التطور (ES) بتشتغل كطريقة ما بعد التدريب لتقوية تفكير الـLLM. الباحثين لقوا إن ES بتعطي تغطية أوسع للمنطق مقارنةً بـGRPO، يعني بتحسّن Pass@K وبترفع Pass@1 بدون ما يضغطوا الذاكرة. كمان بيّنوا إن التغييرات الكبيرة بالبارامترات ما بتأثر على كل الوظايف، يعني فيه شوية تحديثات قوية بس قليلة. وآخر شي، اقترحوا طريقة تدريب متسلسلة GRPO‑ES بتستفيد من أقوى ميزات كل وحدة.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة الكبيرة تستفيد أكتر من قدراتها بالمنطق بدون ما تحتاج موارد ضخمة، فمفيد للباحثين يلي بدهم يحسنوا الأداء بسرعة.
Evolution Strategies LLM reasoning GRPO hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

D^3-MOPD: جدولة ديناميكية للمجالات لتقليل استهلاك الحوسبة

D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
الفريق Sun وزملاؤه قدموا طريقة D^3-MOPD لتوزيع أوزان التدريب بين عدة معلمين متخصصين بشكل ذكي، بحيث يراقبوا إشارة الـ reverse-KL اللي بتنولد من الطالب خلال التدريب. الطريقة بتشتغل بمتابعة غير متزامنة لتقعر الـ KL بكل مجال، وتعيد تعديل نسب اختيار البيانات حسب سرعة التحسن المتبقية. هالجدولة ما بتضيف أي عبء على عملية التدريب نفسها، وبتسمح للطالب يتعلم أسرع وبكفاءة أعلى من الطرق التقليدية. التجربة على نموذج Qwen3.6-35B-A3B أظهرت إن الفجوة بين الطالب والمعلم تقلّ بنسبة 97% بدل 63%، ومع نفس الأداء بأقل ثلاث مرات خطوات rollout.
ليش بتهمّك؟: بتوفر وقت وحوسبة أكتر للباحثين اللي بدهم يدمجوا خبرات عدة نماذج في نموذج واحد فعال.
distillation multi-teacher language models efficiency scheduling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 22 أغسطس — تحسين كفاءة LLMs
📚 كل الأعداد