📡 أحدث عدد

شو في AI؟ | 1 يوليو — إيقاف ذكي للوكيل، نموذج متعدد الوسائط

يومي 📅 2026-07-01
أبرز ما صدر اليوم في أبحاث الذكاء الاصطناعي و NLP.
#1

التوقف الذكي للوكيل: متى يوقف الـLLM عن الفعل؟

Agentic Abstention: Do Agents Know When to Stop Instead of Act?
الوكيل المبني على LLM لازم يشتغل على عدة جولات، يستخدم بحث على الويب، واجهات تصفح، أو أدوات الطرفية ليحقق هدف المستخدم. بس مش كل هدف واضح أو ممكن بالبيئة المتوفرة، فهنا بيجي مفهوم Agentic Abstention، يعني متى يقرر الوكيل يوقف ويتوقف عن استدعاء الأدوات. الباحثين جربوا هالمشكلة على مهام التسوق على الويب، والبيئات الطرفية، وأسئلة وإجابات، وقيّموا 13 نظام وكيل و2 هياكل وكيل على أكثر من 28,000 مهمة، ولاحظوا إن التحدي الأكبر مش بس إن الوكيل يقدر يوقف، بل متى يوقف بالضبط. بعدين قدموا طريقة CONVOLVE لهندسة السياق، اللي حسّنت توقيت الإيقاف بشكل كبير بدون تعديل وزن النموذج، خصوصًا لـ Llama-3.3-70B.
ليش بتهمّك؟: هالنتائج بتخلينا نطور وكلاء أكثر أمانًا وفعالية، ما بيضيعوا وقت المستخدمين ولا يخلوا النظام يشتغل بلا فائدة.
🌱 شو إلك منها؟
تخيّل إنك تسأل مساعد صوتي عن مطعم، وهو ما يلاقي شي مناسب، بدال ما يظل يدور ويضيع وقتك، يوقف ويخبرك إن ما في نتيجة. هالطريقة بتخلي التطبيقات اليومية، مثل الشات بوت أو المساعدين الذكيين، تكون أسرع وأدق. رح تشوف الفرق لما تستعمل خدمة بتعرف متى تقول "ما بعرف" بدل ما تستمر تحاول تحل المشكلة بلا فائدة.
agent abstention LLM evaluation CONVOLVE hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

Orca: نموذج أساسي لعالم متعدد الوسائط

Orca: The World is in Your Mind
فريق Wang وزملاؤه قدموا Orca، أول نموذج أساسي بيحاول يفهم العالم كله من إشارات بصرية ولغوية مع بعض. بدلاً ما يركزوا على توقع كلمة أو صورة أو فعل لحالو، ركّزوا على توقع الحالة الجاية للبيئة (Next-State-Prediction) ليعطوا تمثيل موحد للواقع. النموذج تعلّم من فيديوهات مستمرة (unconscious learning) ومن أوصاف لغوية للأحداث (conscious learning) باستخدام بيانات ضخمة فيها 125K ساعة فيديو و160 مليون توضيح. بعد ما تدربوا، خلو العمود الفقري ثابت واستخدموا ديكودر خفيف لكل وسيلة لتوليد نص، صورة أو حركة.
ليش بتهمّك؟: الورقة بتظهر إنه نموذج موحد للواقع ممكن يرفع من جودة التطبيقات اللي بتحتاج تفهم، تتوقع أو تتصرف بالعالم الحقيقي.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يتوقع شو رح يصير بالفيديوهات أو يجاوب على أسئلتك عن الصور بطريقة طبيعية، هالشي بيخلي المساعدين الذكيين أو الألعاب أذكى وتتعامل مع العالم أقرب للإنسان. هالقدرة ممكن تشوفها قريبًا بخدمات الترجمة أو المساعدة في التعليم.
multimodal foundation model world modeling video VQA hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

Dockerless: مدقق برامج بدون بيئة للوكيل البرمجي

Dockerless: Environment-Free Program Verifier for Coding Agents
الفريق قدم Dockerless، مدقق للبرمجيات ما بيحتاج يشتغل داخل حاويات Docker أو أي بيئة جاهزة. بدل ما ينفّذ الاختبارات، بيستكشف المستودع ويجمع أدلة عشان يقرر إذا التصحيح صحيح ولا لأ. على benchmark التقييم، تفوق أقوى مدقق مفتوح المصدر بـ14.3 نقطة AUC، وبيخلّي خط أنابيب ما بعد التدريب كاملًا بدون بيئات. النتيجة إن النموذج وصل نسب حل عالية على مجموعات SWE-bench Verified، Multilingual، وPro، متقارب مع الطرق اللي بتعتمد على بيئات تشغيلية.
ليش بتهمّك؟: هالطريقة بتقليل تكلفة إعداد بيئات الاختبار، فبتسرّع تدريب وكلاء البرمجة وتخليهم أكتر كفاءة.
🌱 شو إلك منها؟
تخيّل إنك بدك تتأكد من تصليح كود بدون ما تنزل كل البرامج وتضبط بيئة التشغيل – Dockerless بيعمل هالشي من غير ما تشغّل أي شي. يعني زي ما بنقارن وصفة مع الأصل من غير ما نطبخها. هالشي ممكن يطلع بأدوات مثل GitHub Copilot أو أي مساعد برمجي بيستعملك اليومي، فبتستفيد من تصحيحات أسرع وأقل تعقيدًا.
code verification coding agents RL SFT benchmarks hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

DOPD: تقطير مزدوج على سياسات مع ميزة

DOPD: Dual On-policy Distillation
الفريق اقترح DOPD، طريقة جديدة بتوزّع إشارات التدريب على مستوى الكلمات بين معلم ومتعلم مميزين حسب الفارق بالميزة والاحتمالات. هالطريقة بتخفّف من مشكلة "privilege illusion" اللي بتخلّي النموذج يتوقع معلومات ما بيقدر يحصل عليها. التجارب على نماذج اللغة الكبيرة ونماذج الرؤية-اللغة أظهرت إنه DOPD يتفوّق على طرق التقطير التقليدية وبيدعم الاستقرار والقدرة على التعميم. كمان جربوا هالطريقة على مهام التعلم المستمر والبيانات الخارجة عن التوزيع، وطلعت النتائج ممتازة.
ليش بتهمّك؟: هالنهج بيساعد نماذج اللغة تتعلم أسرع وبقوة أعلى، فبيحسّن جودة التطبيقات اللي بنستعملها يوميًا.
🌱 شو إلك منها؟
تخيّل إنه المساعد الذكي عندك بيصير يجاوب بدقة أكبر، زي معلم بيعطيك توجيه شخصي لكل سؤال. هالتحسين بيظهر لما تستخدم تطبيقات الترجمة أو البحث أو كتابة النصوص، لأنّها بتصير أسرع وأدق. يعني رح تحسّ بالفرق كل ما استخدمت هالخدمات على موبايلك أو الكمبيوتر.
distillation language models robustness continual learning dual learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

GR2: ريندر جديد للترتيب باستخدام LLM

GR2 Technical Report
الفريق قدم إطار GR2 للترتيب النهائي بالمقترحات، بيجمع بين تدريب وسط على معرفات معنوية فريدة، وتقطير مسار التفكير من معلم أقوى عبر توجيه خاص واختيار رفض، وكمان بيستفيد من reinforcement learning مع مكافآت قابلة للتحقق. كمان ضافوا ضاغط سياق لتقليل تكلفة التدريب، وOn-Policy Distillation كبديل scalable للـ SFT، مع تقطيع التفكير لتقليل زمن الاستجابة. التجربة على حركة مرور صناعية أظهرت تحسين +18.7% على R@1 و+7.1% على R@3 و+9.6% على N@3 مقارنة بالطرق القديمة.
ليش بتهمّك؟: GR2 بيقرب قدرات الـ LLM من تجربة المستخدم الفعلية بالمواقع، فبيلقّح الترتيب النهائي ويزيد التفاعل والرضا.
🌱 شو إلك منها؟
تخيل إنك عم تشوف سلة منتجات على تطبيق تسوق، GR2 بيخلّي العناصر اللي بتظهرلك أقرب للي بتحبها، يعني ما بتضيع وقتك تدور. كأنه صديق بيفهم ذوقك وبيختار لك أحلى شي. هالتقنية رح تصير موجودة بخدمات التوصية اللي بتستعملها كل يوم، مثل تطبيقات التسوق أو الفيديوهات.
LLM re-ranking reinforcement learning recommendation industrial AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

BlockPilot: سياسة اختيار حجم الكتلة المتكيّفة مع كل عينة

BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding
الورقة بتقدّم BlockPilot، آلية بتختار حجم الكتلة الأنسب لكل عينة حسب تمثيل مرحلة الـ prefilling. الفكرة إنه بدل ما نستخدم حجم ثابت لكل الإدخالات، بنعتمد على سياسة خفيفة الوزن بتتنبأ بالحجم المثالي مرة وحدة بعد الـ prefilling. الطريقة Plug‑and‑Play وما بتضيف عبء كبير، وبتحسّن السرعة بشكل ملحوظ، مثلاً على نموذج Qwen3‑4B حققت تسريع 4.20× وطول قبول 5.92.
ليش بتهمّك؟: بتسرّع توليد النصوص وبتقلل زمن الانتظار للمستخدمين بشكل واضح.
🌱 شو إلك منها؟
تخيل إنك عم تسأل مساعد ذكي سؤال، وبدلاً ما ينتظر دقيقة لتلقى الجواب، يرد عليك خلال ثواني قليلة. هالتحسين بيشبه الشيف اللي بيجهّز أكلة متعددة المكونات مرة وحدة بدل ما يضيف كل مكوّن لحالو. هالسرعة بتظهر بخدمات الدردشة، الترجمة الفورية، أو أي تطبيق بيحتاج توليد نص سريع.
speculative decoding diffusion language models efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

ما بعد الـ IID: هل نماذج الأساس للبيانات الجدولية عامة فعلاً؟

Beyond IID: How General Are Tabular Foundation Models, Really?
هالبحث بيقدّم BeyondArena، أول benchmark موحد وشامل للبيانات الجدولية بيغطي سيناريوهات الـ IID، الزمنيّة، والمجمّعة، وكمان أحجام عينات وأبعاد مميزات مختلفة. كمان بنوا Data Foundry، إطار بايثون ومخطط بيانات لتجميع وتوحيد مجموعات البيانات الجدولية. التجربة على 11 نموذج و142 مجموعة بيانات بتبين إنه النماذج الأساس عم تتفوق على البيانات الصغيرة والمتوسّطة الـ IID، بس النماذج الشجرية والنماذج العميقة لساّ متفوّقة على البيانات الكبيرة، غير الـ IID، وعالية الأبعاد.
ليش بتهمّك؟: لأنّو بدون benchmark موحد بنضل نشتغل على تحسينات بسيطة على بيانات IID وما منوصل لتحديات البيانات الواقعية المعقّدة.
🌱 شو إلك منها؟
بتقدر تستخدم هالمقاييس لتعرف إذا النموذج اللي عم تستعمله بيناسب بياناتك اليومية ولا لا، زي توقع مبيعات شهرية أو تصنيف زبائن حسب وقت الشراء. يعني إذا عندك بيانات متغيّرة مع الوقت أو مجموعات كبيرة، هالنتائج بتدلّك إنه ممكن تحتاج نموذج شجري أو شبكة عميقة بدال نموذج أساس جدولي بسيط. كمان هالإطار Data Foundry بيسهّل عليك تجمع وتجهّز البيانات لتدريب أي نموذج.
foundation-model tabular-data benchmark IID evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

تخطي البصريات بالمستوى المشغّل: أسرع MLLM بلا خسارة

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference
الفريق قدم طريقة جديدة لتقليل حسابات النماذج الكبيرة المتعددة الوسائط. بدلاً من حذف كل التوكنات البصرية أو تخطي طبقات كاملة، بيحددوا أيّ عمليات attention أو FFN ما إلها تأثير على الجواب وبياستغنوا عنها. هالطريقة بتخلي السلسلة البصرية كاملة، بس بتتخطى العمليات الزايدة حسب الطبقة. التجارب على ثلاث معماريات و10 benchmarks للـ VQA أظهرت إنه بيقللوا 33.7% من TFLOPs مع الحفاظ على 99.5% من الأداء الأصلي.
ليش بتهمّك؟: هالطريقة بتخلّي تشغيل نماذج MLLM أسرع وأرخص من غير ما نضيع الدقة.
🌱 شو إلك منها؟
تخيل إنك عم تستخدم تطبيق ترجمة صور أو مساعد بصري، وبدال ما يستهلك وقت وطاقة كثير، بيصير يشتغل بسرعة أكبر. يعني ممكن ترفع صورك وتستقبل إجابات فوراً، حتى على جوّال قديم. هالتحسين رح يبان بأدوات مثل Google Lens أو تطبيقات الدردشة اللي بتفهم الصور.
multimodal efficiency transformer VQA token-skipping arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

تدريب تطوري: كيف تتعلم نماذج اللغة الكبيرة الاكتشاف عبر 371 مهمة تحسين

Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
هالورقة بتقدّم Evolution Fine-Tuning (EFT)، طريقة جديدة بتعلّم نماذج اللغة الكبيرة تتطوّر حلول عبر مهام مختلفة عن طريق تحويل مسارات البحث التطوري لإشراف. الباحثين بنوا مجموعة بيانات اسمها Finch Collection فيها 156 ألف مسار من 10 مجالات و371 مهمة تحسين، وبعدين ضبطوا نماذج من 2B إلى 9B باراميتر. النتايج بتظهر إنّو النموذج بعد EFT بيستفيد من الخبرة السابقة وبيتحسّن بمتوسط 10.22٪ على 22 مهمة جديدة، وكمان بيطابق أو يتفوّق على أحدث الطرق في شغلات زي تجميع الدوائر ومشكلة إردوش.
ليش بتهمّك؟: لأنّه بيسمح لنماذج اللغة الكبيرة تعيد استعمال استراتيجيات البحث وتقلل الحاجة لتدريب من الصفر لكل مشكلة جديدة.
🌱 شو إلك منها؟
تخيّل عندك مساعد ذكي يتعلّم كيف يحلّ ألغاز أو يضبط جداول، وبعد ما يتدرّب يقدر يطبّق الخبرة هادي على أي شغلة جديدة من غير ما يبدأ من الصفر. يعني زي الشيف اللي جرّب كتير وصفات وبعدين يقدر يطبخ أطباق جديدة بسرعة. هالنوع من التقنية رح يطلع بأدوات تساعدك تحسّن أداء برامجك أو تختار إعدادات أسرع لتطبيقاتك اليومية.
LLM fine-tuning evolutionary search optimization RL hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

فهم النوايا وإقناع بلا حكي: LLMs يغيّروا معتقدات عبر التخطيط والعمل

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action
الباحثين قدموا تقييم جديد للـ LLMs يختبر قدرة الوكيل على إحداث حالات إيمان معينة بغير الكلام، سماوه Non-Conversational Planning ToM (NCP-ToM). استخدموا إطار NCP-ExploreToM يخلّي النموذج يتحكم بأشياء أو يوجه شخصيات لغرف لتوصّل هدف الإيمان. قيموا ستة نماذج من ضمنها GPT-5 وGemini 2.5 Pro وClaude 4 على 600 مهمة، وGPT-5 نجح بحوالي 80% وتفوّق على البشر، بس لسه مش بنفس القوة. كمان لقوا إن كل النماذج، زي البشر، أحسن بحالات إيمان صحيحة مقارنة بحالات إيمان كاذبة، وهذا إشارة إيجابية للـ alignment.
ليش بتهمّك؟: المهمة لأنها بتكشف كيف ممكن للـ AI يسيطر على أفكار الناس بطرق غير كلامية وبتنبه لمخاطر التلاعب.
🌱 شو إلك منها؟
تخيل مساعد ذكي يخلّيك تصدّق إن شي موجود بالغرفة بس هو ما شافه، لأنه حرك أشياء. هالقدرة ممكن تساعد بتعليم الأطفال أو تنظيم البيت، بس كمان ممكن يضللنا. ممكن تشوف هالشي بألعاب أو روبوتات بتتصرف حسب نواياك.
Theory of Mind LLM Agentic Evaluation Safety Alignment arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

لما LLMs تقرأ الجداول بخفة: قياس وتقليل أخطاء الإشارة للبيانات

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
الفريق الباحث قدم أول تقييم منهجي لأخطاء الإشارة للبيانات (DREs) اللي بتصير لما الـLLMs تتعامل مع الجداول، ولقوا إن هالأخطاء موجودة بكل النماذج من 1.7B لحد 20B باراميتر. كمان جربوا يضيفوا مكوّن "critic" يراقب الإشارة للبيانات، ولقوا إنه بيحسّن دقة الإجابات لحد 12٪ عبر الفلترة والرفض العشوائي. آخر شي درّبوا نموذج critic خفيف وزن 4B باراميتر وصل لمعدل F1 حوالي 78.2٪، وقدر يكتشف الأخطاء داخل وخارج التوزيع ويساعد النماذج الكبيرة أثناء الاستدلال.
ليش بتهمّك؟: هالورقة بتظهر طريقة عملية لتقليل الأخطاء اللي بتخلّي إجابات الـLLM غير موثوقة، وبتحسّن الاعتماد على النماذج الكبيرة في التطبيقات الواقعية.
🌱 شو إلك منها؟
تخيل إنك تسأل برنامج ذكي عن جدول أسعار، وبيطلع لك أرقام غلط أو بيغفل عن بيانات مهمة؛ هالخطأ ممكن يسبب مشاكل. الباحثين لقوا طريقة تخلي البرنامج يتأكد من إنه عم يقرأ الجدول صح قبل ما يعطيك الجواب، زي ما بنفحص الفاتورة قبل ما ندفع. هالتحسين رح يبين أكتر في التطبيقات اليومية زي المساعدات الصوتية أو أدوات تحليل البيانات اللي بنستعملها كل يوم.
LLM tables data-referencing evaluation critic arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

تجميع المهارات للـ LLM Agents

Generative Skill Composition for LLM Agents
الفريق قدم SkillComposer، نموذج بيقدر يحدّد مجموعة المهارات المناسبة وعددها وترتيب تنفيذها لمهمة معينة. النموذج بيستخدم ديكودر autoregressive مقيد لتوليد تسلسل المهارات من مكتبة مهارات موجودة، وبيتعلم من أزواج مهمة‑تركيب من مكتبة بشرية. التجربة أظهرت إنه على وكلاء برمجة مثل GPT-5.2‑Codex و Gemini‑3‑Pro‑Preview، SkillComposer رفع نسبة النجاح بأكثر من 20 نقطة مقارنةً بدون مهارات، وتفوق طرق الاسترجاع التقليدية.
ليش بتهمّك؟: هالطريقة بتقلل الجهد ووقت التحضير للمهام المعقّدة، وبتحسّن أداء الوكلاء البرمجيين.
🌱 شو إلك منها؟
تخيل إنك بدك تحل مشكلة برمجية معقّدة، هالأداة بتجمع لك الخطوات اللازمة وتنفّذها بالترتيب الصح، فبتوفر عليك وقت البحث والكتابة. كمان بتخلي المساعدات الذكية على الإنترنت تكتب الكود أسرع وبدقة أعلى. ممكن تلاقي هالتقنية ضمن أدوات كتابة الكود الآلية أو مساعدات البرمجة اللي بتستعملها كل يوم.
LLM skill composition code generation retrieval agents arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

عقول صغيرة، إنجازات كبيرة: نماذج لغة مدمجة

Little Brains, Big Feats: Exploring Compact Language Models
الفريق بقيادة Dari Baturova استكشفوا كيف النماذج الصغيرة بتشتغل داخل نظام Retrieval-Augmented Generation (RAG). استعملوا مجموعات بيانات مفتوحة ومملوكة لتقييم الأداء عبر مواضيع وأسئلة مختلفة. لقوا إنه النظام مع النماذج الصغيرة يقدر يشتغل مباشرة على الجهاز بدون أي GPU وبوقت معقول. الكود والمواد الإضافية متوفرة على GitHub.
ليش بتهمّك؟: هالنتيجة بتخلينا نستخدم نماذج أصغر على هواتفنا أو أجهزتنا الشخصية بدون الحاجة لكروت شاشة قوية.
🌱 شو إلك منها؟
تخيل إنك تقدر تسأل موبايلك أسئلة معقدة ويجاوبك بسرعة، حتى لو ما عندك جهاز ألعاب قوي. هالشي بيشبه لما تستخدم تطبيق ترجمة أو مساعد صوتي يشتغل offline. يعني ممكن تستفيد من الذكاء الاصطناعي حتى بأماكن ما في فيها إنترنت قوي أو بطاريات طويلة.
language models retrieval-augmented generation on-device efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

OSWorld 2.0: اختبار قدرات الوكلاء على شغل الكمبيوتر لفترات طويلة

OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
الفريق قدم OSWorld 2.0، benchmark فيه 108 سيناريو واقعي للكمبيوتر بيحتاجوا من الإنسان حوالي ساعة ونص وشغل معقد. كل سيناريو بيستدعي مئات نداءات لأدوات، وبيحكي عن تحديات مثل التفاعل المستمر والبيئات المتغيرة. جربوا الوكلاء المشهورين مثل Claude Opus 4.8 وGPT‑5.5، ولاحظوا إنهم ما زالوا يكمّلوا بس نسبة قليلة من المهمات. النتائج بتظهر إن الوكلاء اليوم بعدهم بعيدين عن مستوى الاحترافية المطلوبة بالواقع.
ليش بتهمّك؟: هالنتائج بتخلينا نفهم وين الوكلاء بحاجة لتطوير قبل ما نقدر نعتمد عليهم بشغلنا اليومي.
🌱 شو إلك منها؟
تخيل إنه برنامج ذكي يقدر يفتح لك الإيميل، يكتب تقرير، أو يحلّ لك مشكلة على الكمبيوتر بدون ما تتعب. هالورقة بتظهر إن التقنية لسا ما وصلت لهالالمستوى، فممكن تحتاج تنتظر شوية قبل ما تشوف هالالمساعدة بالمكتب أو بالبيت. بس لما تتحسّن، رح يقدروا يسهّلوا علينا شغلات مثل تنظيم الفواتير أو تعديل الصور بسرعة.
benchmark agents computer-use long-horizon evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

QVal: تقييم رخيص للإشارات الكثيفة للـLLM Agents

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
الفريق قدم QVal، بيئة اختبار ما بتحتاج تدريب لتقييم إشارات الإشراف الكثيفة على الوكلاء. الطريقة بتقيس إذا كانت الإشارات بترتب الأفعال حسب قيم Q لسياسة مرجعية قوية، فبنعرف جودة الإشارة قبل ما نبدأ التدريب. جربوا 21 طريقة عبر أربع بيئات مختلفة وعلى ست نماذج مفتوحة الوزن، ولاحظوا إن أساليب الـprompting البسيطة بتتفوق على أغلب الطرق الحديثة. النتائج ثابتة على أحجام النماذج والبيئات وأنواع الملاحظات.
ليش بتهمّك؟: هالاختبار بيسمح للباحثين يقارنوا إشارات الإشراف بسرعة وبأقل تكلفة، فبنوفر وقت وجهد كبيرين قبل ما ندرب الوكلاء.
🌱 شو إلك منها؟
زي ما بنجرب وصفة قبل ما نطبخ، QVal بيفحص طريقة تقييم الأفعال قبل ما ندرّب أي نموذج، فبنوفر جهد ووقت. يعني إذا كنت عم تشتغل على مساعد ذكي أو روبوت، هالأداة بتساعدك تختار الطريقة الأنسب من غير ما تضيع موارد على تجارب طويلة. ممكن تلاقيها ضمن أدوات تحسين المساعدات الرقمية اللي بنستعملها يوميًا.
agents evaluation language-models supervision benchmarking arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

كسر سلاسل الفشل: تعلّم معزّز خطوة بخطوة للتمييز الطبي المتعدد الوسائط

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
الفريق قدم خوارزمية جديدة اسمها MRPO بتعتمد على مكافآت خطوة بخطوة لتقليل الأخطاء اللي بتصير بالمراحل الأولى من التفكير بالصور الطبية. إذا الجواب النهائي كان غلط، الخوارزمية بتعطي عقوبات أقوى للخطوات اللي سببت الخطأ، وبهالطريقة بتكسر سلاسل الفشل. جربوها مع ثلاث نماذج LLM متعددة الوسائط ولاحظوا تحسن واضح بالمقارنة مع طرق RL التقليدية وحتى مع نماذج أكبر حجمًا.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الذكاء الاصطناعي الطبية تعطي قرارات أدق وأسرع، خصوصًا بالمواقف اللي فيها أخطاء مبكرة ممكن تضر المريض.
🌱 شو إلك منها؟
تخيل لو برنامج يقرأ صورة أشعة ويعطي تشخيص، لكن لو ارتكب غلطة بالبداية يقدر يصححها قبل ما يوصل للنتيجة. هالتحسين بيقلل فرص التشخيص الخاطئ، وبيخلي الأطباء يثقوا أكتر بالأدوات الرقمية. ممكن تشوف هالشيّ يوميًا في تطبيقات الصحة على الموبايل أو المواقع اللي تساعدك تفهم فحوصاتك.
multimodal reinforcement learning medical VQA LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

تقسيم ذكي للطرق على نطاق صناعي باستخدام LLM

Adaptive Cluster-First Route-Second Decomposition for Industrial-Scale Vehicle Routing
الفريق اللي بيقود البحث، أوغوزهان كاراهمتوغلو وهيونغ كيم، قدموا طريقة جديدة لتقسيم مسألة توصيل البضائع الكبيرة. الفكرة إنه بيستعملوا نموذج لغة كبير (LLM) كصانع قرار عالي المستوى، يقرر متى يضيف تجميع أو يوازن أو ينقّح الفروع حسب حالة المشكلة. هالطريقة بتجمع بين تقسيم الزباين والعربيات مع مراعاة السعة، وبتشتغل على مشاكل فيها لحد نص مليون زبون. التجارب على بيانات صناعية وبيانات معيارية بتبين إنه الأداء منافس وبيتحمل أحجام أكبر من اللي كانت ممكنة قبل هيك.
ليش بتهمّك؟: هالطريقة بتخلّي شركات النقل تخطط لمسارات أكتر كفاءة وتوفر وقت وتكلفة، خاصةً لما تكون عندها مئات الآلاف من الطلبات.
🌱 شو إلك منها؟
تخيّل إنك بدك توصل طلبات من متاجر كتيرة للزبائن، بدال ما يضيعوا وقتهم بانتظار شاحنات مش منظّمة، هالنظام بيساعد الشركات ترتّب الشحنات بسرعة وبطريقة مرتّبة. يعني بتصير الشحنات توصل أسرع، زي لما تشتري أكل من مطعم وتستلموه بوقت قصير. هالتحسينات بتظهر في تطبيقات التوصيل الكبيرة أو خدمات اللوجستيات اللي بنستعملها يوميًا.
vehicle routing LLM optimization logistics CFRS arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

MECoBench: اختبار تعاون الوكلاء المتعددين في بيئات تجسيدية

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments
هالورقة قدمت MECoBench، منصة اختبار نظامية بتقيس كيف الوكلاء المتعددين يشتغلوا سوا ببيئات بصرية واقعية. جربوا عدة نماذج MLLMs وشافوا إن التعاون عادةً بيحسّن إكمال المهمات، بس الفائدة بتعتمد على توازن المكسب مع صعوبة التنسيق. كمان لقوا إن التواصل بين الوكلاء أساسي، وأحسن طريقة تعاون بتختلف حسب عدد الوكلاء وقدرة النموذج. وأخيرًا، التعاون بيقوّي المتانة ضد الضوضاء والظروف الاستكشافية الصعبة.
ليش بتهمّك؟: بيفتح الباب لفهم كيف نقدر نستغل التعاون بين الوكلاء لتقوية الروبوتات وتطبيقات الذكاء الاصطناعي الواقعية.
🌱 شو إلك منها؟
تخيل لو عندك كم مساعد ذكي بالبيت يشتغلوا سوا، مثل ما بيشتغلوا مع بعض لتشغيل الأنهار أو تنظيم المواعيد، التعاون بيخليهم ينجزوا أسرع وأدق. هالشي ممكن تحسه إذا استعملت تطبيقات ذكية بتعتمد على أكثر من جهاز أو خدمة تتكلم مع بعض. يعني كل ما زاد التعاون، كل ما صار حياتنا اليومية أسهل وأقل تعقيدًا.
multimodal agents benchmark collaboration embodied AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

تهيئة أُرثوغونالية تحافظ على الهندسة لتكييف منخفض الرتبة في RLVR

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR
الباحثين Zhang وزملاؤه قدموا تحليل نظري يوضح إن التهيئة الأُرثوغونالية هي الأقرب للنتيجة اللي بتحصل مع التدريب الكامل. بناءً على هالتحليل، صمموا طريقة جديدة للتهيئة اسمها geometry‑preserving orthonormal initialization، وطلعوا بنسختين RLPO وRLMO. التجارب على مجموعات اختبار للرياضيات أظهرت إن هالطريقة بتثبت التدريب تحت RLVR وبتتفوق على LoRA التقليدي وبتقلب موازين PiSSA وMiLoRA اللي ممكن يطيقوا أداءً أسوأ. الكود والنتايج متوفرة على GitHub.
ليش بتهمّك؟: هالتهيئة بتقليل الفجوة بين التدريب الخفيف والتدريب الكامل، فبتعطي نماذج لغة أقوى بأقل تكلفة تعديل.
🌱 شو إلك منها؟
تخيل إنك عم تعلم طالب يشتغل على مسائل رياضية، ومع طريقة التهيئة الجديدة بيصير الطالب يركز أسرع وما بيضيع وقت. هالشي بيساعد التطبيقات اللي بتعتمد على الذكاء الاصطناعي لتوليد حلول رياضية أو نصوص دقيقة، زي المساعدات الذكية على الموبايل. يعني إذا استعملت تطبيق بيستعمل هالنماذج، رح تلاقيه يجاوب أسرع وبشكل أدق.
LoRA RLVR orthogonal initialization low-rank adaptation reinforcement learning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

تقليص الذيل الطويل لتقييم نماذج العالم البصري

Trimming the Long-Tail of Visual World Modeling Evaluation
الفريق قدم Tailor-Bench، benchmark جديد بيفحص قدرة نماذج العالم البصري على تمثيل تفاعلات فيزيائية نادرة وغير معتادة. صمموا ثلاث أوضاع سيناريو: Regular للسيناريوهات الشائعة، Unconventional اللي بيبدل الأدوات بأدوات متوافقة بالخصائص لتحدي تعميم القدرة، وImpossible اللي بيضيف أدوات تخالف الخصائص لتقيس الوعي بالقيود. كمان فيه إعدادين: predictive generation لتوليد النتيجة بدون توجيه، وdescriptive generation لتوليد النتيجة المطلوبة بدقة. النتائج بتبيّن فجوة واضحة بالذيل الطويل، حيث الأداء بينخفض من Regular لتحت Unconventional وImpossible، والنماذج بتعتمد على أنماط بصرية سطحية.
ليش بتهمّك؟: هالنتائج بتبين إن نماذج الصور والفيديو ما زالت غير قادرة على تعميم الفهم الفيزيائي للسيناريوهات النادرة، وهاد مهم لتطوير تطبيقات أكثر واقعية وتنوعًا.
🌱 شو إلك منها؟
زي ما بنشوف تطبيقات تعديل الصور أو توليد الفيديوهات، هالنماذج بتشتغل كويس مع المشاهد العادية، بس إذا طلبنا منها شي غريب أو غير مألوف، ممكن يطلع النتيجة غريبة أو غير منطقية. يعني إذا طلبت من برنامج يرسم شخص عم يستعمل شوكة كأداة لتثبيت شيء، ممكن ما يطلع صحيح. هالمشكلة ممكن تأثر على أدوات التصميم أو الألعاب اللي بدها تتعامل مع مواقف غير متوقعة.
visual modeling benchmark long-tail physical reasoning computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 9
Agentic Abstention
Agentic Abstention يعني إن النموذج يختار يماسكش قرار إذا ما كان واثق، احنا بنخليه يعتذر عشان نتجنب الأخطاء.
Next-State-Prediction
Next-State-Prediction فكرة إنو النموذج يتوقع الحالة الجاية بعد خطوة معينة، بنستعملها لتدريب موديلات تتوقع شنو رح يصير بعدين، متل الألعاب أو السلاسل الزمنية.
VQA
اختصار Visual Question Answering، يعني بتعطي الموديل صورة وبتسأله سؤال عنها وهو بيجاوب. إشي زي 'شو في الصورة دي؟' والنظام يفهم ويرد، وبنسمع عنه كتير في تطبيقات مساعدة ذوي الاحتياجات الخاصة والبحث العلمي.
latent space
فضاء مخفي داخل النموذج بحط فيه المعلومات المهمة بشكل مضغوط وبسيط، بدل ما يشتغل على البيانات الخام الضخمة. إشي أساسي في نماذج الذكاء الاصطناعي الحديثة عشان بيخليها أسرع وأذكى في معالجة المعلومات.
multimodal
النموذج بيقدر يتعامل مع أكتر من نوع بيانات، مثل النص والصورة مع بعض، هالشي بيسمح له يفهم إشي أكتر تعقيداً
SFT
اختصار Supervised Fine-Tuning، يعني بناخد نموذج ذكاء اصطناعي جاهز ونعلّمه من جديد على بيانات محددة عشان يبقى أحسن في مهمة معينة، زي ما بتدرّب موظف جديد على شغل محدد.
On-Policy Distillation
هالطريقة بنقل فيها المعرفة من نموذج بيتعلم على نفس السياسة (on‑policy) إلى نموذج أصغر أو أبسط، يعني بنخلي الـteacher يعلّم الـstudent مباشرةً خلال التدريب. بنستعملها مش لتقليل حجم النموذج بس كمان لتسريع التعلم.
privilege illusion
مصطلح بنستعمله لنوضح إنو أحياناً بنظن إنو عندنا امتيازات أو فرص أكتر من غيرنا، بس هالإحساس مجرد وهم، مش حقيقة، وبدنا نفهمه عشان ما نضلّوا بنقارن غلط بيننا وبين غيرنا
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
🤖 موديلز 3
CONVOLVE
CONVOLVE نموذج بيعتمد على الشبكات الالتفافية لتعامل مع البيانات المكانية، بنستعمله عشان يلتقط الأنماط من الصور.
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
Dockerless
موديل بيشتغل بدون حاويات Docker، يعني ما بنحتاج نعبّيه بحاوية لتشغّله، بنسمع عنها لأنو بتسهل النشر على الأجهزة اللي ما فيها Docker.
📏 مقاييس 1
AUC
هو رقم بين 0 و1 بيقيس قد الموديل شاطر يفرق بين الحالات الصح والغلط، كل ما قرب من 1 كل ما هو أحسن. بنسمع عنه كتير عشان هو من أعدل المقاييس خصوصاً لما البيانات مش متوازنة.
🗂️ بيانات 1
WebShop
WebShop هو داتا سيت فيه منتجات وتفاصيل من متاجر إلكترونية، بنستعمله عشان نمّوّج تفهم طلبات الشراء وتولّد توصيات
كل المصطلحات ←
العدد السابقشو في AI؟ | 30 يونيو — أداء تريليون باراميتر وتحرير مباشر
📚 كل الأعداد