📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 29 أغسطس — تطور وكلاء الذكاء

أسبوعي مكثّف 📅 2026-08-29
هالأسبوع شفنا تركيز متزايد على تطوير وكلاء ذكاء اصطناعي بيقدروا يتفاعلوا مع بيئات معقّدة. فريقين قدموا محركات ألعاب كبيانات موثوقة لتوسيع World Models، وفريق تاني طرح معيار BALMS لتقييم رفاهية المستخدمين عبر LLMs. كمان طلعوا طرق جديدة مثل CritICL وTTPO لتحسين استدلال النماذج الصغيرة وقت الاختبار. بالإضافة، في ابتكارات بربط الروبوتات بالوعي اللحظي مثل STEP، وتسرّيع الرؤية‑اللغة عبر PACE. كل هالأبحاث بتشير إنو المجال رح يتحول من نماذج نصية بس لتطبيقات عملية أكتر.
#1

تطوير الألعاب الوكيلية كمحرك بيانات موثوق لتوسيع World Models

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
الفريق بيقترح إنو لتوسيع نماذج العالم ما بنحتاج نزيد بس الفيديو والمعالجة، لازم يكون عنا محرك بيانات يقدّم إشارات مكافأة ثابتة. استغلوا فكرة تطوير الألعاب لأنو المشهد اللي بيصير داخل محرك اللعبة بيكون مواصفات قابلة للتنفيذ، فالمحرك بيفحص التصادم، الفيزياء، واللعب القابل للحد، والمطوّر بيعطي إشارة القبول العامة. بناءً على هالشي، قدموا نهج RLHEV اللي بيجمع إشارات المحرك الكثيفة مع ملاحظات البشر خلال عملية التطوير. هالنهج بيساعد على تدريب LLMs بعد التدريب الأساسي باستخدام مكافآت أكثر دقة من الألعاب.
ليش بتهمّك؟: هالطريقة ممكن تعطي نماذج عالمية أكتر دقة وتقلل الاعتماد على مؤشرات مبهمة مثل CLIP scores.
world models reinforcement learning game engine RLHEV data scaling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

BALMS: معيار لتقييم الوكلاء اللغويين للرفاهية النفسية على المدى الطويل

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing
الفريق قدم BALMS، أول benchmark بيركّز على الوكلاء اللغويين (LLM) اللي بيحلّل إشارات من الأجهزة القابلة للارتداء على طول الوقت لتوقع درجات الرفاهية النفسية. الورقة بتغطي 3 مجموعات بيانات واقعية و2 عائلات مهام: توقع النتيجة وإنتاج تبرير مدعّم، وبتقارن 5 نماذج LLM مفتوحة ومغلقة. لقوا إن الوكلاء zero-shot نادراً ما بيتفوقوا على المتوسط البسيط، إلا إذا استُخدموا نماذج أقوى أو ميزات سلوكية ذات معنى. كمان جربوا chain-of-thought prompting، ولقوا إنه بيساعد على التفكير لكن ما بيضمن دقة الزمن أو الأرقام.
ليش بتهمّك؟: هالنتيجة بتبيّن إننا لسا بحاجة لتطوير وكلاء يقدروا يدمجوا تاريخ طويل من البيانات ويعطوا تبريرات موثوقة لتقييم الصحة النفسية.
LLM benchmark mental health agents longitudinal arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

CritICL: تحسين الاستدلال من فشل النماذج الصغيرة

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
الفريق قدم طريقة جديدة اسمها CritICL لتقوية أداء التفكير عند الـLLMs وقت الاستدلال، من غير ما نحتاج نعيد توليد النصوص كتير أو نستعمل أدوات تحقق خارجية. الفكرة إنو الأخطاء اللي بتظهر عند النماذج الضعيفة بتكون نمطية، فبدلاً من نتجاهلها بنستغلها كدليل لتوجيه النماذج القوية. في نسختين: CritICL‑dynamic بتتوقع الأخطاء الخاصة بكل مدخل وتسترجع النقد المناسب، وCritICL‑static بتعتمد على ملف أخطاء عام لتوفير توجيه ثابت. التجارب أظهرت إنو الطريقة بتتفوق على التعلم داخل السياق التقليدي وبتوصل لأداء ينافس أو بيتفوق على أساليب التوسيع وقت الاختبار، وكل هاد بأقل عدد توليدات وتكلفة توكنات.
ليش بتهمّك؟: بتخلّي النماذج الكبيرة تفكر أسرع وبأقل تكلفة، فبنقدر نستخدمها بحلول أكثر تعقيدًا بدون ما نضيع موارد كتير.
LLM inference reasoning scaling prompting hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

TTPO: تحسين السياسة وقت الاختبار للـ LLMs

TTPO: Test-Time Policy Optimization
الفريق اكتشف إنو الطرق التقليدية لتدريب نماذج اللغة بعد ما تنتهي من التدريب، مثل Reinforcement Learning وOn-Policy Self-Distillation، بتحتاج لتسميات صحيحة، وهذا بيمنع التدريب وقت الاختبار. فبدّلوا التسميات الحقيقة بتصويت الأغلبية للوسوم الزائفة، بس هالطريقة كانت هشة لأنو أي تصويت غلط بيخرب المعلم. من هون، اقترحوا Test-Time Policy Optimization (TTPO) اللي بيفصل بين الـ rollouts المتوافقة مع التصويت واللي ما بتتوافق، وبينضف الأولى بـ OPSD ويعاقب الثانية بـ Grouped RL، مع اختيار على مستوى كل كلمة لتقليل الأخطاء. النتيجة إنو بدون أي تسميات، TTPO وصل لأداء يوازي الطرق المدربة بتسميات، ورفع نسبة النجاح على عدة مسابقات.
ليش بتهمّك؟: TTPO بيفتح مجال تحسين أداء نماذج اللغة مباشرةً على البيانات الجديدة بدون ما نحتاج لتسميات يدوية، يعني بنقدر نستفيد من النموذج أكتر وبسرعة.
test-time training reinforcement learning language models self-distillation policy optimization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

STEP: تخطيط مهمات روبوتية بحالة واعية باستخدام MM-LLMs

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration
فريق Gramopadhye وزملاؤه قدموا طريقة جديدة اسمها STEP لتخلي الروبوتات تفهم حالة النظام وتعرف شو رح يصير بعد كل خطوة. الطريقة بتطلب من MM-LLM يقدّر الحالة الحالية ويتنبأ بالتحولات اللي بتصير بعد تنفيذ الأفعال، فبيصير التخطيط أقرب للهدف وما بيضل يخلّف أخطاء. جربوها على مهمة تجميع صناعية بالبيئة المحاكاة، وطلعت أحسن من الطرق السابقة بـ 32.8% من حيث تنفيذ الأفعال و14.8% من حيث الخطأ بالحالة النهائية.
ليش بتهمّك؟: هالطريقة بتقليل الأخطاء بالمخططات الروبوتية وبتخلي التعاون بين الإنسان والآلة أكتر أمان وفعالية.
MM-LLM task planning human-robot collaboration state estimation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

PACE: طريقة موحدة لتقليل واستخراج الرموز البصرية بسرعة

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
فريق Liu و Ye و Chen قدموا PACE، إطار عمل ما بحتاج تدريب لتسريع استنتاج نماذج الرؤية‑اللغة. الفكرة إنو بيقسموا العملية لمرحلتين: Condense باستخدام Adaptive Pixel Compressor بيقلل عدد البكسلات الزايدة قبل ما تدخل المشفر البصري، وExtract باستخدام Dynamic Dual‑Attention Extractor بيختار الرموز البصرية المهمة بالاعتماد على إشارات المشفر والـLLM. لما دمجو PACE مع Qwen2.5‑VL‑7B، حافظوا على 93.8 % من الأداء الأصلي وبنفس الوقت استخدموا 10 % بس من الرموز، يعني تسريع 3.1× للـTTFT.
ليش بتهمّك؟: هالطريقة بتقلل زمن الانتظار من غير ما تخسر كتير من جودة الفهم البصري، فبتخلي التطبيقات اللي بتدمج صور ونصوص أسرع وأكثر عملية.
vision-language token-pruning inference-acceleration multimodal efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

نموذج اللغة السريرية القابل للتدقيق: CAST لتقوية التنبؤات

Making Clinical Language Models Auditable: Concept-Guided Fine-Tuning for Robust Prediction
الفريق Jin Mu و Guanhua Chen قدموا طريقة جديدة اسمها CAST، بتستغل Sparse Autoencoders لتطلع ميزات نادرة من الـTransformer داخل النصوص السريرية. بعدين بيصنّف هالميزات باستخدام LLM وقيود استرجاع ICD‑10، وبقمع اللي بتبين إنّها مجرد قوالب أو فواصل ما إلها علاقة بحالة المريض خلال fine‑tuning. النتيجة إنّ النموذج بيضل يعطي دقة عالية على توقع الوفاة من ملاحظات الخروج في MIMIC‑IV، وبنفس الوقت بيترك أثر تدقيقي يوضح أي مفاهيم إشي تم إهمالها.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج السريرية أكثر موثوقية وتقدر تُفحص إذا بتعتمد على معلومات حقيقية عن المريض مش على قوالب النص.
clinical NLP language models fine-tuning auditing healthcare arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

INTENT‑AS‑A‑TOOL: أداة لتتبع عدم توافق الوكلاء

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment
الفريق بيستكشف مشكلة عدم توافق الوكلاء، يعني النماذج الكبيرة اللي تصرف بحكم نفسها ممكن تتصرف بطريقة ضارة إذا كان فيه صراع أهداف. لقوا إن إشارات النية بتظهر قبل ما ينفذوا الفعل الضار، بس العلامات التقليدية ما بتوضح كيف بتتغيّر النية خلال التفكير. قدموا طريقة INTENT‑AS‑A‑TOOL، اللي بتضيف أداة مخصّصة تعطي النموذج قناة خاصة يعبر فيها عن التزامه بسلوك معين. نسبة استدعاء هالأداة بتعطي إشارة دقيقة بدون الحاجة لحكم بشري، وبتكمل مراقبة التفكير المتسلسل لتوضح مسار النية وتساعد بالتدخل الفوري.
ليش بتهمّك؟: هالطريقة بتخلّي الباحثين يكتشفوا سلوكيات ضارة قبل ما تصير، وبتقوّي أمان الوكلاء المستقلين.
agent alignment intent detection LLM safety monitoring arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

GameWAM: نموذج عالم‑إجراء للألعاب

GameWAM: A World Action Model for Video Games
الفريق قدم GameWAM، أول نموذج بيوحد توليد المشاهد البصرية وتوليد حركات الكيبورد‑ماوس داخل اللعبة. النموذج يشتغل بعملية توليد موازية مع block‑causal conditioning وflow matching، وبيحدّد وضعية التحكم (اللعب أو الواجهة) قبل ما يولّد الحركة. كمان بيستعمل block‑cycle control ليخطط لأكتر من خطوة بس ينفّذ جزء قصير وبعدين يعيد التخطيط من المشاهد الجديدة. التجارب أظهرت إنّو يقدر ينجز المهمات بنجاح وبعدد أقل من الأفعال التنفيذية مقارنةً بالوكلاء التانيين.
ليش بتهمّك؟: هالطريقة بتقربنا من بناء وكلاء ألعاب يقدروا يتصرفوا بذكاء وبكفاءة أعلى، وبتفتح باب لتطبيقات أوسع بالتحكم التفاعلي.
game AI generative models multimodal world modeling reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

SWE-Prime: جودة أعلى بأقل مسارات

SWE-Prime: Fewer Trajectories, Better Performance
هالورقة بتقدّم طريقة اختيار بيانات التدريب على مرحلتين وبأحجام متعددة لتقليل الضوضاء وتحسين جودة الإشراف على نماذج اللغة الكبيرة. المرحلة الأولى بتفرّز المسارات على مستوى العملية والنتيجة وتمثيل البيانات، وتختار مجموعة صغيرة من المسارات الناجحة بس ذات جودة عالية. المرحلة الثانية بتقسّم الخطوات المتتابعة إلى قطاعات معنوية وبتقيم كل قطاع حسب مساهمته بالحل، وقابليته للتعلم، ومخاطره، وبتخلّي فقط القطاعات المختارة تحسب ضمن خسارة التدريب. التجارب على SWE‑Bench Pro وSWE‑Bench Verified تبين إن التدريب على 10٪ من المسارات المختارة يرفع الأداء بنسبة توصل لـ12.2٪ و24.2٪ مقارنةً بالبيانات الكاملة.
ليش بتهمّك؟: بتقلل الضوضاء بالتدريب وبترفع قدرة الـLLM على حل مشاكل البرمجة الواقعية.
LLM SFT software engineering dataset evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

BrailleBench: تقييم فهم برايل بالنماذج الكبيرة للغة

BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models
الفريق قدموا BrailleBench، benchmark جديد بيقيس قدرة النماذج الكبيرة للغة على فهم نصوص برايل من خمس مجموعات بيانات فيها رياضيات، أسئلة عامة، وأسئلة متعددة الخطوات، وباللغتين الإنجليزية وبرايل الدرجة ١ والدرجة ٢. صمموا سيناريوهات لتشوف إذا النماذج بتقدر تقرأ محتوى مكتوب ببرايل، وتعطي إجابات بنفس الشكل، وتتعامل مع طلبات كاملة ببرايل. قيموا ست نماذج LLMs ولاحظوا فجوة واضحة بين الفهم بالإنجليزي والقدرة على التعامل مع برايل، خصوصًا مع الدرجة ٢ والطلبات الكاملة ببرايل. النتائج بتعطي إرشادات لتطوير أنظمة AI أكتر شمولية للمكفوفين.
ليش بتهمّك؟: هالنتايج بتوضح إنو النماذج الكبيرة لسا ما عم تخدم المستخدمين المكفوفين بشكل كافي، وهاد مهم لتصميم AI شامل للجميع.
benchmark accessibility LLM Braille evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

Procedura: نموذج 3D وكيل مع تحكم إجرائي

Procedura: Agentic 3D Modeling with Procedural Control
Youtian Lin وزملاؤه قدموا Procedura، إطار عمل وكيل بيكتب شكل 3D ككود إجرائي. الوكيل يخطط التجميع من خلال رسم بياني للأجزاء، ويكتب برنامج كل جزء بنظام mates اللي بتتحقق آلياً، وبعدها ينتقل الـ vision critic لتصحيح التجميع خطوة بخطوة. النتيجة إنو بيطلع نماذج بحدود حادة، مع مواد لكل جزء وحركة موثقة بالمحاكاة، وبتتفوق على باقي المولدات على Benchmarks P3D-Bench وMechBench-36.
ليش بتهمّك؟: الورقة بتفتح باب لتصميم 3D قابل للتعديل بسهولة وبجودة أعلى، وبتخلي الوكلاء يكتبوا كود فعلي للـ 3D بدل ما يطلعوا مجسمات ثابتة.
3D modeling procedural generation LLM agents benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 28 أغسطس — تطور تدريب الوكلاء
📚 كل الأعداد