📡 أحدث عدد

شو في AI؟ | 30 يونيو — أداء تريليون باراميتر وتحرير مباشر

يومي 📅 2026-06-30
سلام 👋 احنا اليوم بنقدملكم ملخص سريع للعدد اللي فيه 20 عنوان مهم بالذكاء الاصطناعي، والهدف إنكم تلاقوا الفكرة الأساسية بكل بساطة.
#1

أداء بمستوى تريليون باراميتر مع عميل 35B

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
الفريق قدم Agents‑A1، نموذج Agentic بحجم 35 بillion مع تقنية Mixture‑of‑Experts. الفكرة الأساسية إنّه بيوسّع أفق الوكيل عن طريق مسارات طويلة طولها متوسط 45 k توكن، وبيدمج معرفة خارجية وإجراءات ومراجعات. النموذج تدرب بثلاث مراحل: fine‑tuning شامل، تدريب معلمين متخصصين لكل مجال، ثم تقطير on‑policy متعدد المعلمين مع توافق المفردات. النتيجة إنّ Agents‑A1 يحقق أداء قريب من نماذج تريليون باراميتر على مجموعة من Benchmarks الطويلة الأمد.
ليش بتهمّك؟: هالورقة بتفرجينا طريقة عملية نقدر فيها نحصل على أداء ضخم بموارد أصغر، يعني بدنا نشتغل بذكاء أكتر.
🌱 شو إلك منها؟
تخيل عندك مساعد ذكي يقدر يشتغل على مشروع كبير، مثلاً يكتب لك تقرير أو يخطط لك رحلة، بدون ما تحتاج كمبيوتر ضخم. هالمساعد بيقدر يتبع خطوات طويلة ويجمع معلومات من مصادر مختلفة، زي ما بنعمل بنقطة بنقطة في حياتنا اليومية. هالشي ممكن تشوفه قريباً بتطبيقات الدردشة أو أدوات الإنتاجية اللي بتستعملها كل يوم.
agent Mixture-of-Experts scaling benchmarks long-horizon hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

TUA-Bench: بنشمارك للوكيليات اللي بتشتغل بالترمينال

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
الفريق قدم TUA-Bench، بنشمارك جديد بيقيس قدرات الوكيليات اللي بتشتغل من خلال الترمينال على 120 مهمة واقعية من تحرير مستندات وإدارة إيميلات لحد شغل علمي مع برامج متخصصة. كل مهمة مصممة يدويًا وبتتنفذ بترمينال حقيقي مع سكريبت إعداد ثابت، والتقييم بيتم بنظام scoring يعتمد على تنفيذ المهمة. أفضل وكيل جربوه، Claude Code مع Claude Opus 4.8، وصل لـ 65.8% من الأداء الكلي، بس لسه فيه فجوات كبيرة. الهدف إن هالبنشمارك يسرّع تطور الوكيليات من مساعدات متخصصة لمساعدات عامة موثوقة بكل البيئات الرقمية.
ليش بتهمّك؟: هالبنشمارك بيفتح عيوننا على القدرات الفعلية للوكيليات بالترمينال وبيساعدنا نطورهم ليكونوا أكثر تنوعًا وفائدة بالمهام اليومية.
🌱 شو إلك منها؟
تخيل إنك تقدر تخلي برنامج يشتغل لك على الكمبيوتر من غير ما تكتب أوامر معقّدة، مثل ما بتطلب من مساعدك يرسل إيميل أو يلاقي معلومة من الويب بسرعة. هالتقنية ممكن تخلّي شغلنا أسرع وتقلل الأخطاء اللي بنوقع فيها وإحنا نكتب أوامر يدوياً. ممكن تشوفها قريبًا في أدوات مثل مساعدات النظام أو تطبيقات الدعم التقني اللي بتستعملها على الكمبيوتر أو الموبايل.
agents benchmark terminal LLM evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

LiveEdit: تعديل فيديو مباشر بوقت حقيقي

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
الفريق قدم إطار عمل جديد لتعديل الفيديو بشكل مباشر، يشتغل إطار بإطار مع الحفاظ القوي على المحتوى. استعملوا ثلاث مراحل لتقطير القدرة من نموذج قوي ثنائي الاتجاه إلى محرر أحادي الاتجاه سريع، فصير عندنا تعديلات ثابتة على طول الفيديو بدون ما تنقص الجودة. كمان أضافوا نظام تخزين للماسك يخفّف الشغل بين الإطارات، فسرعة الاستنتاج صارت 12.66 إطار بالثانية. هالطريقة وصلت لأعلى جودة بين طرق التعديل الحي وبتسرعة تخليها مناسبة لتطبيقات الواقع المعزز.
ليش بتهمّك؟: هالورقة بتخلّي تعديل الفيديو الحي واقعي وسريع، يعني ممكن نستخدمه بألعاب الواقع المعزز أو البث المباشر بدون تأخير ملحوظ.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع أصحابك على مكالمة فيديو وتقدر تغير الخلفية أو تضيف تأثيرات على طول الفيديو كأنك عم تلعب بالصور. هالشي بيسهّل على أي حدا يضيف لمسة إبداعية على محتواه بدون ما ينتظر وقت طويل. ممكن تشوف هالتقنية بالمستقبل على تطبيقات البث الحي أو الفلاتر اللي بتشتغل مباشرة على هاتفك.
video editing streaming diffusion real-time AR hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

تحويل النماذج بهجينة انتباه هجينة

Morphing into Hybrid Attention Models
الفريق اللي بيقودها Disen Lan وزملاؤه قدموا طريقة جديدة اسمها FlashMorph لاختيار طبقات الانتباه في الـTransformer. الفكرة إنّو كل طبقة انتباه كامل بتتحول لفرع انتباه خطي، وبنجمّع كلّها مع بعض ونختار الطبقات اللي بنخليها كاملة حسب ميزانية محددة. بعد ما بنجمّع البوّابات، بنحوّل النموذج للهيكل الهجين وبنعمل distillation وتدريب على سياق طويل. النتائج بتظهر إنّو FlashMorph بتعطي أداء قوي على استرجاع النصوص الطويلة وبنفس الوقت بتقلّل تكلفة الاختيار مقارنةً بالطرق السابقة.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة تشتغل أسرع على نصوص طويلة من غير ما تخسر دقة الفهم، وهذا مهم لتطبيقات الدردشة والبحث.
🌱 شو إلك منها؟
تخيّل إنّك عم تقرأ كتاب ضخم، FlashMorph بتساعد الحاسوب يقرأه أسرع وبنفس الفهم. يعني ممكن تشوف شات بوتات تردّ أسرع وتفهم سؤالك الطويل من غير ما يتعب. هالتحسين بيظهر في خدمات مثل المساعدات الرقمية اللي بنستعملها يوميًا.
attention transformers efficiency hybrid models layer selection arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

تحويل الكلام الطبيعي لمواصفات زمنية استراتيجية بالـ LLMs

Translating Natural Language to Strategic Temporal Specifications via LLMs
الفريق قدم إطار يترجم أوصاف المتطلبات الإستراتيجية المكتوبة بلغة طبيعية إلى صيغ ATL/ATL* باستخدام LLMs. لأن ما فيه مجموعة بيانات جاهزة، هم جمعوا إشي جديد موثَّق من خبراء وصقلوا نماذج وزنها صغير (3‑7B) عبر fine‑tuning. التجربة على مجموعة اختبار أظهرت إن النموذج المدرب وصل لدقة معنوية 0.84، تقريباً نفس أداء الـ few‑shot APIs التجارية، وبنفس الوقت بيشتغل محلياً. كمان حطوا الأداة داخل مدقق منطق استراتيجي موجود لتسهيل على غير الخبراء يحددوا خصائص استراتيجية بطريقه طبيعية.
ليش بتهمّك؟: هالطريقة بتقرب كتابة المواصفات الرسمية من الناس غير المتخصصين وبتسرّع التحقق من الأنظمة المتعددة الوكلاء.
🌱 شو إلك منها؟
تخيل إنك بدك تتأكد إن نظام ذكي بيشتغل صح، هالأداة بتساعدك تكتب المطلوب بلغة بسيطة وتحوّله لقواعد يقدر البرنامج يتبعها. يعني زي ما بتكتب أمر للثلاجة لتبرد، بس للأنظمة الذكية. ممكن تشوف هالشي بأدوات التحقق من السلوك اللي بتستخدمها الشركات.
LLM formal verification ATL multi-agent systems arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

Video-MME-Logical: اختبار تشخيصي للمنطق الزمني بالفيديو

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
الفريق قدموا benchmark جديد اسمه Video-MME-Logical عشان يختبر قدرة MLLMs على التفكير بالمنطق الزمني بالفيديو، مش بس يحددوا أشياء بالفريم الواحد. الصندوق بيشتغل على خمس عمليات منطقية: تتبع الحالة، العد المتسلسل، ترتيب الزمن، الفضاء الديناميكي، وتركيب البنية. كل فئة فيها مهام دقيقة مصممة بحالات كائنات وانتقالات وتبعيات زمنية مُتحكم فيها، وبيسمحوا بتقييم الصعوبة عن طريق تغيير أفق الزمن وتعقيد التفكير. كمان بيقدروا يشوفوا إذا الموديل بيفهم الخطوات الوسطية قبل ما يطلع الجواب النهائي.
ليش بتهمّك؟: هالورقة بتظهر قديش MLLMs بعدهم بعيد عن الفهم الحقيقي لتغيّر المشاهد بالفيديو، وبتعطينا طريقة واضحة لتقويتهم.
🌱 شو إلك منها؟
تخيل إنك عم تشوف فيديو وتحتاج تفهم كيف الأشياء بتتحرك وتتغيّر مع الوقت، هالتقنية بتساعد الكمبيوتر يقدر يعمل هالشي. يعني بدل ما الكمبيوتر بس يحدد شي بالفيديو، بيصير يقدر يشرح لك شو صار بالضبط، زي ما بنقعد نحكي قصة فيديو مع بعض. ممكن تشوف هالقدرة بالمستقبل بأدوات مثل المساعدين الذكيين اللي يشرحوا لك فيديوهات تعليمية أو رياضية خطوة بخطوة.
video reasoning multimodal benchmark MLLM temporal logic hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

ما يهم: الترتيب ما يغيّر النتيجة – تحسين نموذج التضمين للبيانات المهيكلة

Field Order Should Not Matter: Permutation-Invariant Embedding Model Fine-Tuning for Structured Metadata Retrieval
الفريق Solatorio وزملاؤه بيشتغلوا على استرجاع البيانات المهيكلة، ولقوا إن ترتيب الحقول في النص اللي بنحوّل فيه السجلات بيأثر على جودة البحث بعد ما بنعمل fine‑tuning. اقترحوا طريقة جديدة اسمها PI‑FT، بتخلّي كل مرة نعيد ترتيب الحقول عشوائيًا مع حذف بعض الحقول، فالمعنى بيرتبط بالعلامات مش بالمكان. هالتغيير ما بيكلف غير سطرين بالكود، وبقرب الدقة للنتيجة الأصلية ويقلل خسارة الدقة من 7.4 نقطة لـ 0.2 نقطة على مقياس nDCG@10. كمان قدموا benchmark اسمه DevDataBench يغطي 15 لغة ويختبر كل مؤشر ببياناته.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج البحث تكون ثابتة مهما غيرنا ترتيب الحقول، فبنقدر نستخدمها بأمان على بيانات عامة كثيرة.
🌱 شو إلك منها؟
تخيّل إنك عم تدور على إحصائية معينة من قاعدة بيانات ضخمة، وما يهم إذا كان ترتيب الأعمدة مختلف، النموذج رح يلاقيها بسرعة. هالشي بيسهّل على الناس الحصول على معلومات دقيقة بدون ما يضطروا يظبطوا البيانات يدوياً. ممكن تشوف الفائدة بهالخدمات اللي بتعطيك إحصائيات أو تقارير آلية على الويب.
retrieval fine-tuning embeddings multilingual benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

الكلام أبلغ من الكود: دراسة تأثير الانحيازات الإدراكية على كشف الثغرات بالـ LLM

Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection
الفريق قدم أول إطار منهجي يخلّي الكود ثابت ويغيّر بس السياق حوالينه لتفعيل ثلاث انحيازات إدراكية: تأثير الهالة عبر اسم المؤلف، وتأثير الإطار عبر هدف المهمة وعواقبها، وتأثير التثبيت عبر نتائج تحليل سابقة. قيموا ثمانية نماذج LLM بثلاث لغات برمجة، ولاحظوا إن كل النماذج عرضة لهالانحيازات، أعلى نسبة للانحياز الإطاري 33.2%، يليه التثبيت 23.5% والهالة 18.4%. التحليل أظهر إن الثغرات اللي بدها استدلال دلالي أكتر عرضة للانحياز مقارنةً اللي بتنعرف بنمط بسيط، وحتى ممكن يغيّر النموذج قراره من "آمن" لـ "معرض للثغرة" بدون ما يحدد الثغرة فعلياً. كمان أظهروا هجوم أسود‑صندوق يقدر يخفّي حتى 97% من الثغرات المكتشفة مسبقاً.
ليش بتهمّك؟: هالنتيجة بتبين إن أدوات الفحص الآلي للبرمجة المبنية على LLM ممكن تنخدع بسهولة، فبدنا نعيد التفكير بأمان الكود اللي بنعتمد عليه هالأدوات.
🌱 شو إلك منها؟
تخيل إن برنامج بيحاول يلقط الأخطاء بالبرمجة، بس إذا غيرنا طريقة شرح المشكلة أو حطينا اسم مؤلف مختلف، ممكن ينسى يكتشف العيوب. زي ما ممكن القاضي يتأثر باسم المحامي، هالأدوات ممكن تتأثر بكلامنا. يعني لو عم تستخدم أداة فحص كود على الكمبيوتر أو بالموقع، ممكن ما تحس إن فيها ثغرات لأن الطريقة اللي انت عرّفت فيها المشكلة أثرت على النتيجة.
LLM code vulnerability detection cognitive heuristics security AI safety arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

توليد قرارات موثوقة تحت عدم اليقين

Uncertainty-Aware Generation and Decision-Making Under Ambiguity
الباحثين قدموا خوارزميات بتاخد عدم اليقين بالحسبان، مبنية على نظرية بايز وقرارات تجنّب المخاطر، وجربوها على مهمات التدريس الآلي ومراجعة الأقران. الخوارزميات بتستخدم conformal prediction لتعطي ضمانات على الاستراتيجية أو الدرجة، وبتحسب عدم اليقين قبل ما تولد رد أو تقييم. التجارب ورّيت إنه القواعد المتجنبة للمخاطر ممكن تقلل الأداء إذا كان الغموض عالي، بينما الطرق البايزية عادةً بتعطي نتائج أحسن.
ليش بتهمّك؟: هالطريقة بتخلي مخرجات الـ LLMs موثوقة أكتر، خصوصًا بالمهمات اللي فيها رأي شخصي أو تقييم.
🌱 شو إلك منها؟
تخيل إنك عم تستعمل برنامج لتصحيح واجب أو لتقييم مقال، وبدك تكون متأكد إنه النتيجة مش بس حظ. هالخوارزمية بتعطيك ثقة أكبر إنه التقييم أو النص اللي بيطلع من البرنامج ما بيتقلب. ممكن تشوفها بأدوات مراجعة تلقائية أو شات بوتات بتستعملها لتقليل الأخطاء.
LLM uncertainty decision-making Bayesian risk-averse arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

AsyncOPD: شو يعني Stale بالتقطير على‑السياسة؟

AsyncOPD: How Stale Can On-Policy Distillation Be?
الباحثين قدموا أول دراسة منهجية لتأثير الـ stale بالـ asynchronous on-policy distillation، خصوصاً لما بنستعمل teacher‑weighted forward KL أو student‑weighted reverse KL. لقوا إن الـ forward KL بيتحمل الـ stale أكتر، بينما الـ reverse KL بيصير ضعيف، وحاولوا يطبقوا طرق من الـ asynchronous RL لكن ما حسّنوا النتيجة غير طريقة بسيطة تعيد حساب الـ reverse KL وقت التعلم. كمان حددوا إن تخزين teacher‑scores بكمية محدودة بيسبّب توازن بين الانحياز والتباين، فاقترحوا استخدام multi‑sample Monte Carlo لتقليل التباين مع الحفاظ على صحة التقدير، وفتحوا كود AsyncOPD اللي يسرّع التدريب من 1.6 إلى 3.8 مرة مع الحفاظ على الدقة.
ليش بتهمّك؟: هالنتائج بتخلّي تدريب نماذج اللغة الكبيرة يكون أسرع وأرخص بدون ما نخسر جودة الأداء.
🌱 شو إلك منها؟
بتخيل إنه بدال ما ينتظر الكمبيوتر يطلع كل رد من النموذج خطوة خطوة، هالنظام بخلّي العملية أسرع بكتير، زي ما بنستنى طلبية توصيل ونستلمها فوراً. يعني إذا كنت عم تستخدم تطبيقات ترجمة أو كتابة نصوص ذكية، ممكن تلاحظ استجابة أسرع وأقل استهلاك للطاقة. هالتحسينات ممكن تنحط بخدمات السحابية اللي بنستعملها كل يوم.
distillation LLM asynchronous training RL efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

جسر بين VideoQA ومهام الوكلاء عبر استخراج الإطارات المفتاحية

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
الفريق قدم benchmark جديد اسمه VG-GUIBench لحتى نقيس إذا الوكلاء القائمين على MLLM بيقدروا يتبعوا شروحات الفيديو ويكملوا مهام GUI. كمان طوّروا خوارزمية TASKER لاستخراج الإطارات المفتاحية، بتاخد بعين الاعتبار صلة الإطار بالمهمة وحركة المشهد. التجارب ورجعت إنّو TASKER حسّن الأداء على Benchmarks مثل EgoSchema وNExT‑QA بنسبة ملحوظة. الكود والبيانات متوفرة على GitHub.
ليش بتهمّك؟: هالورقة بتظهر إنه استخراج إطارات مفتاحية ذكي بيقدر يرفع مستوى الفهم الفيديوي ويقرب بين الأسئلة التفاعلية والمهام العملية للروبوتات.
🌱 شو إلك منها؟
تخيل إنك تشوف فيديو تعليمي وتقدر الآلة تستخلص أهم اللقطات لتنفذ الشغلة بنفسها، زي ما بتختار أهم خطوات طبخة لتسويها بسرعة. هالشي بيساعد التطبيقات اللي بتحتاج تفهم فيديو وتنفذ أوامر، مثل المساعدات الرقمية أو برامج التدريب الذاتي. ممكن تشوفه قريبًا بخدمات تترجم الفيديوهات لتعليمات عملية على هاتفك أو حاسوبك.
VideoQA keyframe extraction multimodal benchmark agents hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

جدار لغوي: هندسة الدفاع في توجيه الأنظمة المتعددة الوكلاء

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing
الفريق قدم طريقة جديدة لتوجيه المهام بين الوكلاء بالاعتماد على اختبار قدراتهم فعلياً بدل ما يعتمدوا على أوصاف نصية أو تمثيلات ثابتة. الطريقة سموها ANTAP، بتستدعي كل وكيل لتجربة سريعة وتحوّل النتائج لمعاملات رياضية بنظام مشترك، وبعدين بتاخد قرار التوجيه عبر إسقاط جبري غير نصي. التجارب أظهرت إن هالنهج بيقلل نجاح هجمات التلاعب بالأوصاف لأقرب للصفر مقارنةً بالطرق القديمة اللي وصلوا فيها لأكثر من ٦٧٪. كمان بيقلل نسبة نجاح هجمات التضمين المتكيّفة بحوالي ٢٠٪.
ليش بتهمّك؟: هالطريقة بتحسّن أمان وتدقّق توجيه المهام بالأنظمة اللي فيها وكيلين كثير، فبتقلل فرص الاختراق.
🌱 شو إلك منها؟
تخيّل إنك عم تستخدم تطبيق بيساعدك تنجز شغلات مع مجموعة روبوتات أو خدمات ذكية. هالطريقة بتتأكد إن كل خدمة فعلاً قادرة على الشغلة المطلوبة قبل ما تعطيها المهمة، فبتمنع أي حيلة أو خديعة ممكن يخلّوا الخدمة تتصرف غلط. يعني رح تلاقي التطبيقات أأمن وأسرع، حتى لو حدا حاول يخلّيه يشتغل بطريقة غير صحيحة.
multi-agent systems routing security LLM AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

MultiHashFormer: نموذج لغوي هاشي فعال

MultiHashFormer: Hash-based Generative Language Models
الفريق قدم MultiHashFormer، إطار جديد بيسمح للنماذج اللغوية تستخدم هاش لتقليل حجم المعلمات. كل كلمة بتنولد توقيع هاش فريد عبارة عن تسلسل قصير من أرقام هاش من دوال مستقلة، وHash Encoder بيضغط هالتوقيع لصورة مخفية بتعالجها Transformer decoder. بعدين Hash Decoder بيطلع توقيع الكلمة الجاية وبنرجعه للنص. التجارب على نماذج 100M، 1B، و3B بتظهر إنه المتحكم بيتفوق على الـTransformer التقليدي وبيقدر يضيف لغات جديدة بدون ما يضيف معلمات.
ليش بتهمّك؟: بقلل عدد المعلمات بدون ما يخلّص الأداء، يعني نماذج أصغر وأرخص للتدريب والتشغيل.
🌱 شو إلك منها؟
تخيل إنك عندك تطبيق ترجمة أو كتابة نصوص يشتغل بسرعة وبكلفة أقل، هالنموذج بيخلي هالشي ممكن لأنه ما بيحتاج مساحة تخزين كبيرة للكلمات. كأنك عم تستبدل مجموعة كتب ضخمة بملف صغير فيه رموز مختصرة. رح تشوف هالتحسينات في تطبيقات الهواتف أو المواقع اللي بتعتمد على الذكاء الاصطناعي.
hashing language models parameter efficiency multilingual transformer hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

Flux‑GS: تجميع الطاقة بالـ Monte Carlo لتصوير 3D Gaussian على الموبايل

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting
الفريق قدم Flux‑GS، طريقة Gaussian Splatting بتشتغل بالوقت الحقيقي وبتقلل الحمل على الموبايلات. استعملوا Monte Carlo Specular Energy Aggregator ليجمعوا طاقة الإضاءة اللامعة ضمن مساحة مخفية صغيرة، وبهالطريقة حافظوا على تفاصيل الإضاءة حتى بأحزمة SH منخفضة. كمان أضافوا وحدة Attribute‑Conditioned SH Enhancement بتعدل تمثيل الـ SH الأول قبل الاستدلال بدون ما تزيد تكلفة. وأخيرًا، استبدلوا طريقة الكثافة الأحادية‑رؤية بآلية Multi‑view Alpha‑based Densification وPruning لتقليل عدد الـ Gaussians وتضمن التناسق بين المشاهد المتعددة.
ليش بتهمّك؟: هالطريقة بتخلّي تطبيقات الواقع المعزز والـ VR على الموبايل تشتغل بسرعة أعلى وبجودة بصرية أقرب للواقع.
🌱 شو إلك منها؟
بتخيل إنك بتلعب لعبة ثلاثية الأبعاد على موبايلك وتلاحظ إن الرسومات صارت أ smoother وأسرع، هالتحسين بيخلي هالشي ممكن بدون بطء أو استهلاك بطارية عالي. الفكرة تشبه لما نضغط صورة عشان تصغر حجمها بس تظل واضحة، بس هون بنضغط بيانات الإضاءة لتقليل الحمل. رح تشوف هالتحسين بالمجالات اللي بتستعمل الواقع المعزز أو الفيديوهات ثلاثية الأبعاد على الموبايل.
3D rendering Gaussian Splatting mobile efficiency Monte Carlo hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

WorldEvolver: نموذج عالم ذاتي‑تطوّر لتخطيط وكلاء LLM

Self-Evolving World Models for LLM Agent Planning
الفريق قدم WorldEvolver، إطار نموذج عالم بيقدر يحدّث سياق الاستخدام وقت الاختبار من غير ما يغيّر وزن النموذج ولا الوكيل. بدنا نوضح إنه بيشتغل بثلاث مكوّنات: الذاكرة الوبقية (Episodic Memory) اللي بتسترجع انتقالات فعلية لتوليد محاكاة، والذاكرة الدلالية (Semantic Memory) اللي بتستخرج قواعد إرشادية من فرق التوقعات والنتائج، وميزة الفطنة الانتقائية (Selective Foresight) اللي بتفلتر التوقعات ذات الثقة القليلة قبل ما تدخل عقل الوكيل. جربوا الإطار على ALFWorld وScienceWorld، ولقوا إنه حقق أعلى دقة توقع على Word2World وأعلى نسبة نجاح للوكيل على AgentBoard مقارنةً بالبدائل.
ليش بتهمّك؟: هالطريقة بتخلي وكلاء LLM يخططوا بأمان أكتر لأنهم يعتمدوا على توقعات موثوقة بدل ما يضيعوا وقتهم على قرارات غير دقيقة.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع مساعد ذكي، وهو يقدر يتخيل النتيجة قبل ما يعمل خطوة، فبيساعدك تتفادى الأخطاء. هالشي بيشبه لما نخطط لرحلة ونشوف الخريطة قبل ما نطلع. ممكن تشوف هالتقنية قريبًا في تطبيقات مثل المساعدين الصوتيين أو الروبوتات المنزلية.
world models LLM planning agent self-evolving arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

تعاون جماعي بدون وفاء فردي في LLM agents

Collective cooperation without individual fidelity in LLM agents
الفريق جربوا LLM agents كوكيل اجتماعي على تجربة Prisoner's Dilemma الكبيرة اللي شارك فيها بشر. لقوا إن النموذج بيقدر يخلق ديناميكيات تعاون على المستوى الكلي زي ما بنشوف مع البشر، بس على مستوى الفرد ما بيطابق التنوع ولا قواعد القرار. حتى لما حطوا شوية وكلاء عشوائيين، تحسينوا شوي بس ما حلّوا الفجوة. النتيجة إن المخرجات الجماعية ممكن تبين بشرية حتى لو السلوك الفردي مختلف تماماً.
ليش بتهمّك؟: المقال بيفتح عيوننا إنه لازم نفحص الوكلاء الذكائيين مش بس على النتايج الكبيرة، بل كمان على التفاصيل الفردية قبل ما نستخدمهم لتوقع سلوك البشر.
🌱 شو إلك منها؟
تخيلوا برنامج ذكاء صناعي بيحاكي كيف بنلعب لعبة التعاون مع الجيران، وبيطلع النتيجة كأنها بشرية، بس كل شخص فيه بيعمل شي مختلف عننا. هالشي مهم لأنه إذا بنعتمد على هالبرامج لتوقع سلوك الناس، ممكن نتوقع غلط. يعني ممكن تشوفوا هالتقنية بألعاب أو تطبيقات اجتماعية، بس لازم ننتبه إنه ما تعكس كل تفاصيل سلوك الإنسان.
LLM agents social simulation cooperation benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

Poller: هل الـLLMs بتقدر تقيم فهم الشعر؟

Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?
هالورقة بتقدّم طريقة جديدة اسمها Poller لتقييم فهم الشعر الصيني باستخدام الـLLMs. الفكرة إنه بنخلّي الـLLM يلعب دور الشاعر ويعطي تقييم من منظور الشاعر، يعني بيقرب من الحكم البشري. جرّبنا الطريقة على أكتر من نموذج LLM وعلى تمان أبعاد متخصصة، ولاحظنا إنه الخطأ بين تقييم الـLLM والبشر انخفض كثير، خصوصاً بأبعاد التقنية البلاغية وإعادة الإحساس.
ليش بتهمّك؟: هالطريقة بتخلّي تقييم الشعر آلي وموثوق، فبدنا نقدر نقيّم كمية كبيرة من النصوص بسرعة.
🌱 شو إلك منها؟
تخيل عندك برنامج بيكتب شعر وبدك تعرف إذا شعره فعلاً بيوصل المشاعر. مع Poller، الذكاء الاصطناعي بيقيم شعرّك كأنه شاعر حقيقي، فبتعرف إذا الشِعر مقبول ولا لا. ممكن تشوف هالشيّ في تطبيقات كتابة الشعر أو منصات تعليم الأدب.
LLM poetry evaluation NLP benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

TACO: تحسين الائتمان المدعوم بالأدوات للوكيل

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
الفريق قدم طريقة جديدة اسمها TACO لتقييم كل نداء أداة بيعمله الوكيل المتعدد الوسائط. الطريقة بتستعمل قناتين للميزة: الأولى بتقيس تأثير كل نداء على الإجابة عبر فرق بين النتيجة مع وبدون الأداة، والثانية بتوزع الفضل على النتيجات النهائية بس للنداءات المسؤولة. هيك بنقدر نميز بين النداءات المفيدة واللي بتضل إشي ولا بتضل مضللة، من غير ما نحتاج حكم خارجي. التجارب على مجموعات اختبار مختلفة أظهرت تحسين ثابت بالدقة وتعلم الوكيل يستدعي الأدوات بس وقت ما تساعده.
ليش بتهمّك؟: لأنها بتخلي الوكلاء يختاروا الأدوات بذكاء، يعني بنقلل الأخطاء ونرفع الدقة في التطبيقات الواقعية.
🌱 شو إلك منها؟
تخيل إنه برنامج بيساعدك تحل أسئلة صعبة على صورة، وبيستعمل أدوات داخلية بس لما تكون فعلاً مفيدة. هالطريقة بتخلي البرنامج يتأكد إنه كل خطوة بتضيف فائدة، مش بس يضيف شغلات بلا فايدة. هالشي بنشوفه ممكن يطور تطبيقات التعليم أو المساعدة الذكية اللي بنستعملها يوميًا.
agents multimodal RL tool-use credit-optimization hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

توقع صعوبة الأسئلة البشرية عبر حلقات التفكير بالـ LLM

Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
الفريق Wang وزملاؤه قدموا طريقة اسمها Epi2Diff بتستغل traces التفكير اللي بتطلع من Large Reasoning Models. هالطريقة بتحوّل أجزاء الـ trace إلى سلاسل إبيسوود (episodes) بتعكس حالات حل المشكلات، وبتستخرج منها ميزات بتقيس المجهود والانتقالات. الجمع بين هالمميزات والتمثيل الدلالي للأسئلة بيخلّي التنبؤ بصعوبة العنصر البشري أدق وأكتر قابلية للتفسير. التجارب على أربع مجموعات بيانات تعليمية، خصوصاً تصنيفات مبنية على SAT، أظهرت إنه Epi2Diff يتفوق على نماذج أصغر ومقارنات fine‑tuning التقليدية بنسبة تقريباً 8%.
ليش بتهمّك؟: هالورقة بتعطي طريقة عملية لتقدير صعوبة الأسئلة بدون الحاجة لتدخل بشري مكلف، وبتساعد صانعي الاختبارات يبنوا قياسات عادلة أكتر.
🌱 شو إلك منها؟
بتخيل إنك عم تحضر اختبار وتلقى أسئلة صعبة أكتر لأنه بتحتاج تفكير أعمق وتكرار، هالطريقة بتقدر تتوقع هالصعوبة من غير ما تحتاج خبراء يراجعوا كل سؤال. يعني ممكن تستخدمها لتصميم اختبارات أو تطبيقات تعليمية تعطيك أسئلة بمستوى مناسب لإلك. رح تشوف هالتقنية خلف تطبيقات التعليم الذكي اللي بتقترح لك تمارين حسب مستواك.
LLM difficulty prediction education reasoning interpretability hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

DOPD: تقطير مزدوج على‑السياسة

DOPD: Dual On-policy Distillation
الفريق اللي قدم DOPD بيقترح طريقة جديدة للتقطير على‑السياسة، يسموها advantage‑aware dual distillation. الفكرة إنه كل توكن بياخد إشراف إما من المعلم المميز أو من الطالب المميز حسب فرق الـ advantage والاحتمالات، بهالطريقة بنقلوا قدرة حقيقية وبنقلل الوهم بالامتياز. التجارب على نماذج اللغة الكبيرة ونماذج الرؤية‑اللغة بيّنت إنه DOPD بتتفوق على الـ OPD العادي وبنفس الوقت بتتحسن بالاستقرار والقدرة على التعلم المستمر ومهام خارج التوزيع.
ليش بتهمّك؟: هالطريقة بتساعد الباحثين يطوّروا نماذج أقوى بأقل أخطاء من توجيه المعلومات المميزة.
🌱 شو إلك منها؟
تخيل إنه برنامج محادثة أو تطبيق يترجم الصور يشتغل أسرع وأدق لأنّه تعلم من معلم عنده معلومات إضافية، بس ما بيضلّ يخلط بين اللي يقدر يتعلمه واللي ما يقدر يكرره. هالتحسين بيظهر في خدمات مثل المساعدات الذكية أو تطبيقات القراءة التلقائية للصور، فبتشوف ردود أدق وأسرع من برامج الذكاء الاصطناعي اللي بتستعملها كل يوم.
distillation on-policy LLM VLM efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 7
On-Policy Distillation
هالطريقة بنقل فيها المعرفة من نموذج بيتعلم على نفس السياسة (on‑policy) إلى نموذج أصغر أو أبسط، يعني بنخلي الـteacher يعلّم الـstudent مباشرةً خلال التدريب. بنستعملها مش لتقليل حجم النموذج بس كمان لتسريع التعلم.
SEAL-0
SEAL-0 إطار عمل لتقليل الأخطاء وتعزيز الأمان بالنماذج، بنسمعه عشان بيحافظ على موثوقية النموذج.
terminal-use agents
terminal-use agents هم وكلاء AI بيقدروا يتعاملوا مع سطر الأوامر (الترمنال) ويشغلوا أوامر، بنسمع عنهم لأنو بنقدر نستعملهم عشان ما نكتب الكود إيدياً.
diffusion
diffusion هو مفهوم بنستخدمه بنماذج توليد الصور، بيبدأ بصورة عشوائية وبعدين يضيف خطوات تصحيح تدريجية عشان يوصل للصورة المطلوبة.
AR-oriented mask cache
AR-oriented mask cache هو تخزين مؤقت للأقنعة مخصص لتطبيقات الواقع المعزز، بيساعدنا نسرّع المعالجة لأن القناع جاهز ومهيأ
Linear Attention
linear attention طريقة تركيز بتقلل التعقيد من O(n^2) لـ O(n)، فبتخلي المعالجة أسرع ومش بتستهلك كتير موارد.
distillation
تقنية بنأخذ فيها نموذج ذكاء اصطناعي كبير وقوي ونعلّم نموذج أصغر يحاكيه، عشان نحصل على أداء شبه نفس الشي بحجم أقلّ وسرعة أسرع.
🤖 موديلز 4
mixture-of-experts
نموذج بيقسم الشغل بين مجموعة خبراء صغار، كل خبير بيشتغل على إشي معين عشان يسرّع الأداء ويعطي نتائج أدق.
Claude Code
نموذج من Anthropic بيفهم ويكتب كود برمجي، احنا بنستعمله عشان يسرّع كتابة الإشي البرمجي
bidirectional foundation model
bidirectional foundation model هو موديل أساسي بيقدر يقرأ النص من اليمين للشمال والعكس، يعني بيشتغل بطريقتين عشان يفهم السياق أحسن.
FlashMorph
FlashMorph هو موديل لتوليد النصوص بسرعة، احنا بنستعمله عشان يخلق محتوى سريع وبجودة معقولة.
📏 مقاييس 2
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
execution-based scoring protocol
execution-based scoring protocol هو معيار بيقيس أداء النموذج بناءً على تنفيذ المهام الفعلية، مش بس على أساس التوقعات.
🗂️ بيانات 1
synthetic long-context retrieval data
synthetic long-context retrieval data مجموعة بيانات مصطنعة فيها نصوص طويلة بنستعملها لتدريب نماذج تسترجع معلومات من سياق واسع.
كل المصطلحات ←
العدد السابقشو في AI؟ | 29 يونيو — قوانين تعاون الوكلاء وتوقع صعوبة الأسئلة
📚 كل الأعداد