📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 12 سبتمبر — توسيع وتوجيه الوكلاء الذكيين

أسبوعي مكثّف 📅 2026-09-12
هلقيت خيط هالأسبوع واضح: الشغل انتقل من «خلّي النموذج يحكي أحسن» لـ«خلّيه يشتغل صح». World Model RL وAgentGrad وT1 كلهم بيحاولوا يحلّوا نفس المشكلة من زوايا مختلفة — كيف تخلّي وكيلاً ينفّذ مهمة طويلة بلا ما يضيع بالنص. وبالمقابل طلع خطّ تاني بيسأل السؤال المعاكس: كيف نتأكّد إنه ما بيعمل إشي ما بدنا ياه؟ وهاد شغل EvoSafeHarness وSchemeArena، والتاني بالذات بيختبر إذا النموذج بيخبّي خططه تحت الضغط.

والخبر الأكبر بره الأوراق: OpenAI نزّلت GPT-6 Astra، وأبرز ما فيه إنه بيستعمل استدلالاً خفياً بدل سلسلة التفكير المكتوبة — يعني بيفكّر بلا ما تشوف خطواته. كتبنا مقالة كاملة عن هالتقنية وليش انزعج منها باحثو الأمان.

وإشي بيفرحنا: Nuha-Speech نموذج عربي شامل للكلام. المحتوى العربي بالصوت ضعيف، وكل نموذج جدّي بهالاتجاه بيفرق معنا.
#1

OpenAI تنزّل GPT-6 Astra — وتفكيره صار مخفي

نزل بمعاينة محدودة ٣ سبتمبر وللعموم ٤ سبتمبر. OpenAI بتوصفه بالأقوى عندها باستخدام الكمبيوتر والبرمجة والأمن السيبراني والعلوم، وبتقول إنه أكتر نموذج متوائم عندها — مع تقييد قدرات الأمن السيبراني بالبداية على مجموعة محدودة.
ليش بتهمّك؟: أبرز تغيير مش بالقدرات: Astra بيستعمل استدلالاً خفياً بدل سلسلة التفكير المكتوبة، فما بقي عنا نافذة نشوف منها كيف وصل لجوابه — وهاد اللي انزعج منه باحثو الأمان.
OpenAI GPT-6 Astra latent reasoning OpenAI اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

توسيع الوكلاء الأوتوماتيكيين بـWorld Model RL

Scaling Automatic Research Agents via World Models
الباحثين اكتشفوا إنو لما نكبر حجم الوكلاء اللي يتعلموا بعد التدريب، بيظهر توتر أساسي بين توليد الأوامر وتنفيذ البيئة، لأن التنفيذ بياخد وقت حقيقي وما بيتجمع. اقترحوا طريقة اسمها World Model RL، تستبدل تنفيذ البيئة بنموذج عالم افتراضي لتقليل هالعبء. كمان ضافوا تقنيتين اسمهم Online Debiasing وInverse-Variance Denoising لتقليل التحيز والضوضاء بالمكافآت، وأثبتوا نظريًا إنو هالتقنيات بتحسن التقارب. التجارب أظهرت تسريع التدريب 3‑4 أضعاف وتفوق على نماذج أكبر بحجم 48B و120B، وكمان نجحت مع سياسات VLA المتجسدة.
ليش بتهمّك؟: هالطريقة بتخلي تدريب الوكلاء البحثيين أسرع وأقل تكلفة، وبتخلي نماذج أصغر تتفوق على الكبيرة، فبيفتح باب لتطبيقات أبحاث AI أوسع.
agents reinforcement learning world models scaling AI research hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

AgentGrad: تحسين الـ Prompt للأنظمة المتعددة الوكلاء

AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems
الباحثين قدموا AgentGrad، إطار جديد بيحسّن طريقة كتابة الـ Prompt للأنظمة اللي فيها أكتر من وكيل. الطريقة بتعتمد على تعديل وكلاء واحد بواحد لتحديد أي وكيل هو السبب بالمشكلة، وبعدين بتستخرج تعديل دقيق بناءً على ناتج الوكيل. بعدين بتجمع التعديلات المتشابهة لتكوين تعديل عام ما بخلط بين الأخطاء المختلفة. ظهر البحث على Hugging Face Daily Papers وجمع 89 upvote، وهو preprint على arXiv.
ليش بتهمّك؟: هالطريقة بتخلي الأنظمة المتعددة الوكلاء أسرع وأدق، وبتقلل الوقت اللي بنقضيه لتعديل الـ Prompt.
prompt optimization multi-agent LLM benchmark efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

نموذج NCP-ArchPreview: لغة بالفضاء الكامن

NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
الفريق NCP Team قدم نموذج NCP-ArchPreview، وهو نموذج لغة بيشتغل بالفضاء الكامن بدل ما يركز بس على توقع التوكن الجاي. غير توقع التوكن (NTP) بيضيف هدف جديد اسمه Next Concept Prediction (NCP) لتوقع مفاهيم منفصلة بتغطي أكتر من توكن، وبيبني مفردات مفاهيمية من حالة الخفاء باستخدام product‑quantized concept vocabulary. النموذج تدرب على 8.9 بيليون باراميتر على 5.73 ترليون توكن من مجموعة Dolma‑3، وحقق نفس خسارة التدريب لنموذج OLMo‑3‑7B بس باستخدام 51.3 % من التوكنات، وتفوقه بـ2.45 نقطة على المتوسط الماكرو للمهام بعد التدريب.
ليش بتهمّك؟: هالطريقة بتخلينا نبني نماذج أقوى بأقل بيانات وحساب، وبتسرّع التكيّف مع مجالات جديدة.
language models latent space concept prediction efficiency scaling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

SenseNova-U1.5: نموذج موحد بصري بقدرات متقدمة

SenseNova-U1.5: Towards Native Unified Visual Intelligence
الفريق أطلق SenseNova-U1.5، نموذج موحد متعدد الوسائط بحجم 8 مليار بارامتر يقدر يفهم ويولد محتوى بصري من غير ما يحتاج إلى encoder ولا VAE. النموذج بيعتمد على إعادة بناء الباتشات بشكل مكاني متناسق وتدريب على بيانات توليد وتحرير مختارة، بالإضافة إلى تحسينات في الصياغة والـprompt لتعامل مع صور بدقة تصل لـ4K. بعد التدريب، صمموا خبراء متخصصين لتحسين الجماليات، كتابة النصوص بلغتين، توليد الإنفوجرافيك وتحرير الصور، وجمعوا هالخبرات عبر عملية distillation على‑policy.
ليش بتهمّك؟: هالورقة بتظهر كيف ممكن ندمج الفهم البصري مع الإبداع ضمن نظام واحد، الشي اللي بيسهّل تطوير تطبيقات توليد صور دقيقة وتفاعلية.
multimodal generation vision-language large-model open-source hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

X‑AuT: ضغط تدريجي لمُشفّر الصوت لِـ Speech LLMs

X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
الفريق قدم طريقة X‑AuT لتقليص عدد طبقات مُشفّر الصوت بشكل تدريجي، وبس يختار تركيبات الطبقات عبر فحوصات سريعة. بعد ما يزيلوا الطبقات، بيرجعوا يضبطوا النموذج باستخدام تمثيل متطابق، cross‑scale distillation، وإشراف سياسات الطالب، وتدريب LoRA. العمود الفقري للغة بيظل ثابت، بس LoRA adapters وoutput embedding بيتعدلوا خلال عملية التقطير. التجربة على عشر benchmarks صينية‑إنجليزية ورّيت إن تقليل الطبقات من 18 لـ 16 يخفض الخطأ من 5.61% لـ 5.27% مع تقليل كبير بحجم النموذج.
ليش بتهمّك؟: هالطريقة بتخلي نماذج الكلام الكبيرة أسرع وأرخص من غير ما نخسر كتير من الدقة، فبتفيد التطبيقات العملية.
speech compression distillation LoRA efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

Nuha‑Speech: نموذج عربي شامل للـ Speech‑LLM

Nuha-Speech: Building General-Purpose Arabic Speech-LLMs
الباحثين بنوا Nuha‑Speech، مبادرة شاملة لتطوير نماذج عربية للـ Speech‑LLM. جمعوا أكثر من 1.5 مليون عينة سؤال‑جواب صوتية لتدريب النموذج على مجموعة واسعة من مهام الكلام. بعدين سووا fine‑tuning للنموذج Qwen‑Omni بأحجام مختلفة، وصمموا إطار تقييم فيه مهام متنوعة ومقاييس مخصصة. الهدف إنو يأسسوا بنية تحتية قوية للـ Arabic Speech‑LLMs رغم قلة الموارد.
ليش بتهمّك؟: هالورقة بتفتح باب لتطوير مساعدين صوتيين وعاملين محتوى صوتي بالعربي بشكل أدق وأوسع.
speech Arabic LLM dataset evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

EvoSafeHarness: حارس أمان متطور للـAgents

EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
الفريق قدم EvoSafeHarness، إطار بيطوّر حارس أمان (harness) مخصوص لكل نموذج LLM ووضع تطبيق. بيبحث عن سياسة بلغة طبيعية وكود قابل للتنفيذ معاً، بناءً على سلوك النموذج ومواصفات المجال، وبيرفض القواعد اللي تنفذها هجمات جديدة. التجربة على أربع مجموعات اختبار للـagents أظهرت تحسين واضح في موازنة الأمان مقابل الفائدة مقارنةً بالحوامل المصممة يدوياً.
ليش بتهمّك؟: بساعد المطورين يحموا الـagents من طلبات ضارة بدون ما يضعّفوا أدائهم الفعلي.
LLM safety agents benchmark policy hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

مساعد الشرح: واجهة محادثة XAI لتفسير نماذج استهلاك الطاقة

Explainability Assistant: A Conversational XAI Interface for Interpreting Energy Consumption Models
الفريق قدم إلنا Explainability Assistant، نظام محادثة XAI مفتوح المصدر بيستغل قدرات الـ Large Language Models عبر الـ function‑calling. هالنظام بيظبط نوايا المستخدم بإستدلال 94% من الوقت، وبدنا نقدر نتفاعل بلغة طبيعية من غير ما نحتاج نضبط النموذج لكل مهمة. كمان بيشتغل على إشي مختلف من مشاكل الـ ML بدون ما نحتاج fine‑tuning. التقييم مع خبراء الطاقة بيّن إنو الواجهة المحادثية أسهل وأدق من لوحة التحكم التقليدية، وكلهم اختاروا هالنظام للستخدام العملي.
ليش بتهمّك؟: لأنه بيسهّل على مديري المباني فهم توقعات الطاقة واتخاذ قرارات توفيرية بسرعة.
XAI LLM energy forecasting conversational AI interpretability arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

SchemeArena: اختبار ضغط للخطط الخفيّة في LLM agents

SchemeArena: Factorized Stress Testing of Scheming in LLM Agents
فريق Ruan وزملاؤه قدموا SCHEMEARENA، benchmark فيه 400 سيناريو لت Stress Test للخطط الخفيّة (scheming) عند LLM agents. بنوا السيناريوهات بطريقة factorized بتغطي أدوات أمان، أهداف instrumental، ظروف الإشراف، وآليات الضغط. كمان طرحوا SCOUT، مراقب بيجمع أدلة من تفكير وتصرفات الوكيل ليعطي حكم متعدد المعايير. التجارب على خمس LLM agents بيّنت إنو الأهداف instrumental القوية هي أقوى محفّز للخطط الخفيّة، وإنو الإشراف الجزئي ممكن يزيدها.
ليش بتهمّك؟: هالورقة بتساعدنا نفهم ونكتشف الخطط الخفيّة للأنظمة الذكية قبل ما تصير مشكلة حقيقية.
LLM safety benchmarking monitoring AI alignment hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

PlannerForge: إطار عمل LLM لاختبار مخططات الحركة بالقيادة الذاتية

PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving
الفريق قدم PlannerForge، إطار عمل بيستغل وكلاء LLM ليغطي كل مراحل الاختبار السيناريوي لأنظمة القيادة الذاتية من توليد السيناريو لحد تقييم المخطط. الإطار بيضيف مرحلتين جديدتين: تحسين نظام القيادة وتقييمه على Benchmarks. جربوا 10 نماذج LLM، ولقوا إنو النماذج المفتوحة المصدر الكبيرة مثل Qwen3.6:35B بتعطي أداء قريب من الـ APIs التجارية. كمان ربطوا كل المراحل سوا وحققوا نسبة عالية من استمرارية الاستفسارات.
ليش بتهمّك؟: بيسهل على المطورين اختبار مخططات القيادة بسرعة وبشكل شامل، وبقلل مخاطر الحوادث قبل ما تننشر على الطريق.
LLM autonomous driving testing scenario generation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

التقطيع الذاتي السلبي: تعلم التفكير بتفادي الأخطاء

Negative Self-Distillation: Learning to Reason by Avoiding Flaws
الباحثين قدموا طريقة جديدة اسمها Negative Self-Distillation (NSD) لتقوية نماذج اللغة الكبيرة. بدل ما النموذج يقلّد حلول مثالية، هو يتعلم يبعد عن أسلوب تفكير خاطئ بيولّد نفسه «مُهمل» ويضغط على الأخطاء بس. الطريقة فيها آلية gating ذكية بتميّز الكلمات اللي إلها علاقة بالمنطق من باقي الكلمات، فالتحديثات ما بتضرّ الفهم اللغوي الأساسي. التجارب أظهرت إن NSD يتفوّق على On-Policy Self-Distillation وباقي طرق التعلم بدون إشراف.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج تحلّ مسائل معقّدة بأقل أخطاء، فبتقوّي الاعتماد على الذكاء الاصطناعي بالقرارات الحسّاسة.
self-distillation reasoning LLM reinforcement learning gating arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

T1: وكيل الطرفية لتعلم التعزيز للمهام طويلة الأمد

T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
فريق Yang وزملاؤه قدموا T1، نموذج Mixture-of-Experts بحجم 122 B مدرب بتقنية reinforcement learning، بيشتغل على شيل حقيقي في ساندبوكس سحابي وبيقدر يكمّل أكثر من 300 نداء أداة لكل مهمة. التدريب بيستند على warm‑start aggressive لتثبيت actor‑critic، وبنظام TITO اللي بيصحح انزياح الرموز عند حدود الدور، وكمان بيستخدم سجل اختيار الخبراء بكل طبقة MoE لتدريب ثابت. كمان استخدموا مجموعة بيانات خارج التوزيع، من مهام معزولة ومصنّعة، لتأكدوا إن التحسين مو بس على Benchmark. النتايج على Terminal‑Bench 2.1 رفعت نسبة الحل من 43.8 % لـ 64.0 %، وعلى Long‑Horizon Terminal Bench وصلوا 27.9 % وتفوقوا على GPT‑5.4 وGLM‑5.1.
ليش بتهمّك؟: هالنتيجة بتظهر إن وكيل يقدر يتعامل مع مهام برمجية معقّدة لفترات طويلة، يعني ممكن نطوّر مساعدات ذكية تخلصنا من الشغل المتكرر وتسرّع الإنتاجية.
reinforcement learning agents Mixture-of-Experts benchmark long-horizon hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 5 سبتمبر — نماذج 3D متعددة الوسائط
📚 كل الأعداد