📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 27 يونيو — نمذجة عالم داخل السياق وتحكم روبوتي

أسبوعي مكثّف 📅 2026-06-27
هلقيت هالأسبوع إشي مهم بمجال الذكاء الاصطناعي. فريق Wang قدموا In‑Context World Modeling (ICWM) اللي بيسمح للروبوتات تتعرف على حالتها من تفاعلات سابقة بدون ما نعيد تدريب النموذج. طريقة InfoKV خفضت حجم KV‑Cache للـ LLMs وقت التفكير الطويل باستخدام مقياس Forward Influence. كمان شفنا PhysiFormer يدمج diffusion مع transformer لتوليد حركة 3D واقعية، وإطار Robust‑TO يضيف مقياس موثوقية لكل فريم بالفيديو. بدنا نركز هلق على معايير جديدة مثل DailyReport وGauntletBench لتقييم الوكلاء، وطرق تحسين التفكير الطويل عبر بيانات وصفية.
#1

نمذجة العالم داخل السياق للتحكم الروبوتي (ICWM)

In-Context World Modeling for Robotic Control
الفريق Wang وزملاؤه قدموا طريقة جديدة اسمها In-Context World Modeling (ICWM) عشان الروبوتات تقدر تتعرف على حالتها من خلال شوية تفاعلات سابقة، بدون ما نحتاج نعيد تدريب النموذج. الفكرة إنه النموذج بيستغل نافذة السياق ليعرف كيف النظام بيشتغل، مش بس يتبع الأوامر الحالية. بهالطريقة الروبوت بيقدر يتعامل مع كاميرات أو أشكال جديدة من غير ما نضطر نعمل fine‑tuning كثيف. التجارب على محاكاة وحقيقي أظهرت إنه ICWM بيتفوق بكتير على الطرق التقليدية خصوصاً مع تغيّر زاوية الكاميرا.
ليش بتهمّك؟: هالطريقة بتقوّي قدرة الروبوتات على التكيّف السريع ببيئات جديدة بدون ما نضطر نعيد ضبط أوزان النموذج.
robotics in-context learning world modeling VLA adaptation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

ضغط KV Cache بوعي معلوماتي لتفكير طويل

Information-Aware KV Cache Compression for Long Reasoning
الفريق قدم طريقة InfoKV لتقليل حجم ذاكرة الـ KV اللي بتستخدمها نماذج اللغة الكبيرة وقت التفكير الطويل. بدل ما يعتمدوا بس على أوزان الـ attention لتحديد أهم الكلمات، استعملوا مقياس جديد اسمه Forward Influence بيقيس كيف كل كلمة ممكن تأثر على السياق المستقبلي. كمان دمجوا إشارة عدم اليقين التنبؤي مع تطور التمثيلات الطبقية، ودمجوها مع الـ attention لتحديد أي توكنات نضغطها. التجارب على Benchmarks طويلة السياق مع Llama-3.1 وLlama-3.2 وDeepSeek-R1 أظهرت إن InfoKV يتفوق على طرق الضغط السابقة في كل من مرحلة التحميل والإنشاء.
ليش بتهمّك؟: هالطريقة بتخلي نماذج اللغة الكبيرة تشتغل أسرع وتستهلك أقل من الذاكرة، خاصةً لما نحتاج نفهم نصوص طويلة.
LLM KV cache compression long-context InfoKV hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

PhysiFormer: محاكاة ميكانيكا الأشياء في الفضاء العالمي

PhysiFormer: Learning to Simulate Mechanics in World Space
الفريق Chen وLan وVedaldi قدموا PhysiFormer، transformer مبني على diffusion لتوليد حركة ثلاثية الأبعاد واقعية للأجسام. النموذج ياخد مواضع الرؤوس والسرعات ونوع المادة، ويولد مسارات مستقبلية مباشرةً في إحداثيات العالم، من غير ما يحتاج أي افتراضات مسبقة عن الصلابة أو السببية. العملية كلها بنظام denoising diffusion، والـ attention مفصول على الوقت والمساحة والأجسام لحتى يشتغل بكفاءة على مشاهد فيها أكتر من جسم. تم تدريب النموذج على أكثر من 100k مسار محاكى، وبيظهر أداء أحسن بكتير من الطرق autoregressive من حيث دقة المسار، الحفاظ على الصلابة، والاتساق الفيزيائي.
ليش بتهمّك؟: هالطريقة بتخلينا نقدر نولد حركات فيزيائية دقيقة ومتنوعة حتى لو ما كان عنا معلومات كاملة عن المستقبل، وهذا مهم لتطبيقات الروبوتات والرسوم المتحركة.
diffusion transformer physics simulation 3D robotics hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

فهم الفيديو بثقة مع Robust-TO

Confidence-Aware Tool Orchestration for Robust Video Understanding
الفريق He و Choi و Yoon قدموا إطار عمل اسمه Robust-TO بيضيف مقياس موثوقية لكل فريم بالفيديو، يعني ما بيخلي النموذج يثق بكل صورة كأنها نظيفة. كل أداة بصرية بتستقبل سؤال فرعي وإطار موثوق وبترد بأدلة مثل صندوق حدود أو نص أو فعل مع درجة موثوقية. هالدرجات بتتجمع بثلاث مستويات لتحدد وزن الأدلة، وفيه مكافأة اسمها confidence-cost GRPO بتحسّن الدقة والفعالية. التجارب على benchmarkين للفيديو أظهرت إن Robust-TO وصل لـ56.4% دقة على البيانات النظيفة وتفوق على Gemini-2.5-Pro وحتى تحت تشويش واقعي ما انخفضت الدقة كثير.
ليش بتهمّك؟: هالطريقة بتقلل الفجوة بين الأداء النظيف والواقع المتشوش، فبتخلي نماذج الفهم الفيديو تكون أكثر موثوقية بالمواقف اليومية.
video-understanding robustness multimodal LLM tool-orchestration hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

DailyReport: معيار مفتوح لتقييم وكلاء البحث اليوميين

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks
الفريق قدم DailyReport، معيار مفتوح بيقيس قدرات وكلاء البحث اللي بيستعملوا LLMs على مهام بحث يومية. فيه 150 مهمة مفتوحة مع 3,546 rubric بتغطي أسئلة واقعية ومُحدّثة، وكل مهمة بتنقسم لمهام فرعية وبيتم تقييمها عبر cascade rubrics بأبعاد منفصلة. الطريقة بتعطي درجات تفسيرية لكل بُعد وتلخّصها بدرجة تفضيل المستخدم. التجربة على 17 نظام وكيل أظهرت إنهم بعدهم ما وصلوا لتوقعات المستخدمين.
ليش بتهمّك؟: هالمعيار بيساعدنا نفهم وين الوكلاء بحاجة لتحسين، وبيوفر دليل واضح للباحثين لتطويرهم.
search agents benchmark evaluation LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

ما وراء هندسة المكافأة: وصفة بيانات لتحسين التفكير على سياق طويل

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning
الفريق اللي بيضم Xiaoyue Xu وزملاؤه بيقترحوا طريقة بسيطة من ناحية البيانات، يشتغلو فيها على ثلاث مجموعات مهام: الاسترجاع، تجميع أدلة متعددة، والتفكير. جمعوا 8 مجموعات بيانات فيها حوالي 14 ألف مثال، وجرّبوا هالوصفة على ثلاثة نماذج Qwen (4B/8B/30B-A3B) وشافوا تحسينات واضحة على سبع benchmarks للـ long‑context. كمان لما استمروا بالتدريب على نموذج مُجهَّز للوكيل، ارتفعت أداء GAIA وBrowseComp. الباحثين رح يطلقوا مجموعاتهم للكل لتسهيل الأبحاث الجاية.
ليش بتهمّك؟: هالوصفة بتظهر إن تحسين بيانات التدريب ممكن يرفع قدرة النماذج على التفكير عبر نصوص طويلة بدون ما نحتاج نلعب كثير على المكافآت.
reinforcement learning long-context data-centric LLM RL hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

تعلّم من أخطائك: مسارات تصحيحية للـ Self‑Distillation

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation
الفريق قدم طريقة جديدة اسمها Trajectory‑Augmented Policy Optimization (TAPO) لتقوية الـ self‑distillation بالـ LLMs. بدل ما يطابقوا توزيعات الاحتمالات بس، TAPO بيولد مسارات صغيرة فيها الخطأ لحد ما يصير، وبعدين يضيف تشخيص طبيعي‑اللغة وتصحيح مبني على مثال صحيح من نفس المجموعة. هالطريقة بتحافظ على توزيع النموذج على طول التدريب وبتقلل التداخل بالـ gradient. التجارب على مسابقات رياضية مثل AIME وHMMT أظهرت تحسين ثابت مقارنةً بـ GRPO.
ليش بتهمّك؟: بتخلّي النماذج الكبيرة تتعلم من أخطائها بشكل أدق، فبتصير أحسن بالتحليل وحل المسائل المعقّدة.
self-distillation language-models reinforcement-learning trajectory reasoning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

مقارنة GUI vs. CLI: شو بيحدّوا بإنجاز المهام

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
الورقة بتقدّم benchmark جديد فيه 440 مهمة على سطح المكتب، بيقارن بين وكلاء GUI اللي بيشتغلوا بشاشات بس وبين وكلاء CLI اللي بيستعملوا أوامر مهارة. كل وكيل استقبل نفس الهدف والحالة، بس كل واحد مقيد بطريقته الأصلية. النتائج بتظهر إن أقوى وكيل GUI وصل لـ59.1% نجاح، بينما تحسين مهارات CLI رفع نسبة النجاح لـ69.3%، يعني العائق بالـCLI أكتر بنقص المهارات مش بنقص النموذج.
ليش بتهمّك؟: هالنتائج بتفيدنا نعرف وين نركز تحسين الوكلاء حسب نوع الواجهة لنرفع كفاءة تنفيذ المهام اليومية.
agents benchmark GUI CLI execution hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

تحدّي الوكلاء: إعادة تقييم قدراتهم مع GauntletBench

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
الفريق قدم GauntletBench، منصة ويب بتقيس قدرة الوكلاء على شغل مهام صعبة ما بنشوفها كتير، مثل الفهم الزمني، الفهم الرسومي، والتفكير ثلاثي الأبعاد، ضمن خمس تطبيقات احترافية. كل تطبيق فيه عشرين مهمة بصرية، يعني مجموع ميت مهمة. النتائج فرجتنا إن أقوى وكيل حالياً وصل بس 19.1٪ نجاح، بينما البشر العاديين يقدروا ينجزوا أكتر من 80٪.
ليش بتهمّك؟: هالنتيجة بتبيّن قديش الوكلاء لسه بعيدين عن التعامل مع مشاكل الحياة اليومية المعقّدة.
agents benchmark generalization evaluation AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

نفس الدليل، إجابة مختلفة: فحص حساسية الترتيب في MLLMs

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models
الفريق قدم أداة اسمها Facet-Probe لتدقيق حساسية الترتيب عند نماذج اللغة الكبيرة المتعددة الوسائط. الفحص يغطي خمس جوانب: الاختيار، قطعة الدليل، ترتيب المستند، مجموعة الصور، وترتيب الأنماط المختلطة، وباستخدام نموذج بايزي للردود بيفصلوا بين ضجيج الترتيب والتحيز. النتايج أظهرت إن ولا نموذج من الـ18 اللي اختبروه ما فيه استقرار للترتيب، ومعدل القلب بين 24٪ و50٪، وأقوى نموذج لسا بيقلب الجواب بـ13.4٪ من الحالات. جربوا تعديل الـprompt بدون تدريب، ولقوا إن التحسين محدود وما بينتقل بين النص والرؤية.
ليش بتهمّك؟: لأن حساسية الترتيب بتقوّض موثوقية النماذج اللي بنعتمد عليها يوميًا، وبتخلي النتائج غير ثابتة.
multimodal evaluation robustness language-models AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

توائم رقمية مبنية على اللغة (LLM) لمساعدة كبار السن

Language-Based Digital Twins for Elderly Cognitive Assistance
الفريق اقترح إطار توائم رقمية يعتمد على اللغة لتقليد سلوك الحديث عند كبار السن، ودمج إشارات ستايلومتريكية وبيانات سياقية. استخدموا large language models مع multi-head conditional variational autoencoder (cVAE) لقياس جودة الاسترجاع وتوقع درجات الإدراك. جربوا النموذج على مجموعة I-CONECT ولقوا إنه بيحافظ على الخصائص الشخصية وبيحقق أخطاء توقع MoCA قريبة من البيانات الحقيقية، متفوق على ردود GPT العادية.
ليش بتهمّك؟: هالطريقة بتخلينا نتابع صحة الإدراك عند كبار السن بشكل مستمر وغير غازي، وبدّها تنبؤ مبكر للمشاكل.
digital twin language model cognitive health MoCA cVAE arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

تمكين وكلاء الواجهة الرسومية عبر استكشاف الخبرات الذاتية واستخدام الخبرات المتراجعة للتخطيط

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
الفريق قدم طريقة جديدة اسمها PEEU، بتخلي الوكلاء الصغار يكتشفوا بيئات الويب لحالهم ويستفيدوا من الخبرات المتراجعة لتوليد بيانات تدريب عالية المستوى ومتوافقة. كمان حطوا إطار TDHAF لتحليل كيف بتنقسم المهام على مستويات منخفضة ومتوسطة وعالية، ولقوا إن التدريب على مستوى عالي بيقوي القدرة على التعميم خارج النطاق. التجارب على benchmark حقيقي ورّيت إن نموذج 7B حقّق 30.6% دقة، وتفوق على نموذج Qwen2.5-VL-32B الضخم.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء الصغار يخططوا مهام معقدة بأقل تكلفة وتدعم الخصوصية، فمفيد للباحثين اللي بدهم نماذج فعّالة بدون ما يصرفوا موارد هائلة.
GUI agents planning multimodal MLLM OOD arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | 27 يونيو — نمذجة عالم داخل السياق وتحكم روبوتي
📚 كل الأعداد