📡 أحدث عدد

شو في AI؟ | تجميع الأسبوع 5 سبتمبر — نماذج 3D متعددة الوسائط

أسبوعي مكثّف 📅 2026-09-05
هلقيت هالأسبوع مجموعة أوراق تركّز على تحسين كفاءة النماذج وتوسيع قدراتها على الفهم الثلاثي الأبعاد والوسائط المتعددة. الفريقين اللي قدموا Compile by Training وBCIT بيورّجوا إنو في طرق جديدة لتوليد موديلات صغيرة محلية وتحديد متى نعيد استعمال خبرة الـ LLM القديمة. بالمقابل، نماذج مثل Puffin‑World وScal3R وWorldReward بتخلّينا نشوف دمج الفهم الفيزيائي مع توليد المشاهد ثلاثية الأبعاد وصناعة مكافآت بصرية أكتر واقعية. من ناحية تحسين البنية، CORE وGated DeltaNet بيظهروا كيف التقطير والكمّية القليلة للوزن ممكن يحافظوا على جودة التمثيل حتى بالموديلات الكبيرة. وبالإضافة لهالشي، RealSWE وPACE وRoboTok بيفتحوا باب لتقييم أكثر واقعية للوكالات البرمجية والروبوتات عبر بيانات من الحياة اليومية، وVibeVoice‑ASR‑Streaming بيضيف قدرة التعرف على الكلام وتحديد المتكلم في الوقت الحقيقي.
#1

Compile by Training: تحويل مواصفات اللغة الطبيعية إلى وظائف عصبية محلية

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
الفريق قدم طريقة اسمها compile by training، بتحوّل الوصف النصّي للوظيفة إلى نموذج عصبي صغير يشتغل محليًا. وقت التجميع، نماذج معلمة (teacher models) بتولّد أمثلة مخصّصة، وبنستغلها لتدريب adapter صغير يشتغل كمفسّر للوظيفة. النتيجة إنو الوظيفة بتشتغل بدون الحاجة للمعلمين، وبتقدر تنحفظ وتُنسق مثل أي برنامج. على benchmark اسمه FuzzyBench-Hard، وصلت الدقة الدلالية لـ 83.6%، مع إنو وقت التجميع أقرب للدقيقة بدل ثواني للكمبايلر السريع.
ليش بتهمّك؟: هالطريقة بتقلل الاعتماد على الخدمات السحابية وتخفض التكلفة والوقت لكل استدعاء للوظيفة.
neural functions compilation adapters benchmark AI services hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

متى نوقف إعادة الاستخدام: نقل الخبرة الشرطي للـ LLM بعد التدريب

Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
الفريق قدم طريقة جديدة اسمها Boundary-Calibrated Intervention Transfer (BCIT) لتقرر إيمتى نعيد استعمال تجارب التدريب القديمة للـ LLM. الفكرة إنو كل تجربة سابقة إلها سياق خاص، ولازم نتأكد إنو السياق الحالي متطابق قبل ما نعيد استخدامها. BCIT بتفحص الشروط، وتمنع التحديثات اللي فيها تعارض واضح، وبتجرب تدريب محدود لتأكد من الفعالية. التجربة على نموذج 4B بينت إنو الطريقة بتقلل التحديثات الضارة وبتعطي جودة أعلى للنتيجة النهائية بنفس الميزانية.
ليش بتهمّك؟: هالطريقة بتوفر حساب كبير للوقت والطاقة لما نطور نماذج اللغة بشكل مستقل وتلقائي.
LLM post-training transfer learning autonomous systems hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

Puffin-World: نموذج موحد لتوليد وفهم العوالم الثلاثية الأبعاد

Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
الفريق قدم Puffin-World، بنية موحدة بتجمع الفهم الفيزيائي، المحاكاة المكانية، وتوليد وإعادة بناء العوالم ثلاثية الأبعاد بدون ما تعتمد على وحدات خارجية. النموذج بيشتغل بثلاث حالات عالمية أصلية: الفيزياء (مجال الجاذبية وخط العرض)، الهندسة (العمق)، والمظهر (الصورة)، ومع تمثيل Omni-Camera بيدعم مهام متنوعة وحركات مرنة. كمان بيضيف طريقة لنقل الديناميكيات الفيزيائية عبر الإطارات المستقبلية، وبيضمن إن توليد المشهد يكون ثابت بصريًا ومتسق فيزيائيًا. لتدريب النموذج على سيناريوهات معقدة، بنوا مجموعة Puffin-16M اللي فيها 15 مليون ثلاثية رؤية‑لغة‑كاميرا ومليون مسار حركي.
ليش بتهمّك؟: هالورقة بتفتح باب لتطبيقات واقعية بتحتاج توليد عوالم ثلاثية الأبعاد متناسقة فيزيائيًا، مثل الروبوتات التفاعلية أو الألعاب.
multimodal 3D generative vision-language simulation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Scal3R: طريقة جديدة لإعادة بناء 3D بسرعة وكفاءة

Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
فريق Lin وزملاؤه قدموا Scal3R، طريقة بتعيد صياغة عملية reconstruction على الإنترنت لتستعلم الوضعيات النسبية من عدة إطارات سابقة بدل ما تعتمد على إطار أول ثابت. بيضيفوا توكنات خفيفة وزنها ~1% من البارامترات وبيحقنواها في شبكة أساسية مجمدة عبر asymmetric attention، وبيستفيدوا من نظام pose-graph optimization مع إغلاق الحلقة لتقليل الانجراف. النموذج وصل للتقارب خلال 8 ساعات على GPU وحدة، وقلل متوسط ATE بأكتر من 60% على KITTI مقارنةً بالbaseline، وكمان حقق أفضل أداء على Virtual KITTI، Sintel، TUM‑Dynamic، ScanNet، و7‑Scenes.
ليش بتهمّك؟: هالطريقة بتخلّي تطبيقات الواقع المعزز والروبوتات تشتغل بدقة أعلى وبسرعة أكبر حتى على فيديوهات طويلة.
3D reconstruction pose estimation online learning multi-reference scalability hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

CORE: تحسين الفهم التركيبي في تمثيلات MLLM عبر تقطير الـ Reranker

CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation
فريق Song وزملاؤه اقترحوا طريقة CORE لتقوية قدرة نماذج الـ MLLM على الفهم التركيبي. بيولّدوا قوائم مرشّحات فيها خمس مستويات من المطابقة وبيستعملوا هدف Rank‑KL لتعليم نموذج الـ embedding ينسخ حكم الـ Reranker الدقيق. بالمقارنة مع طرق التعلم المتباينة، بيظهر Rank‑KL أقوى أداء، وCORE‑RERANKER‑8B يحقق 82.7% متوسط على ثلاث مجموعات اختبار، متفوقاً على Jina‑Reranker بـ10.7 نقطة. كمان CORE‑EMBED‑8B يطلع بأفضل متوسط (0.666) بين كل نماذج الـ embedding اللي جربوها، والنتايج بتنقل للـ MCMR بدون ما تضرّ استرجاع COCO وFlickr30K.
ليش بتهمّك؟: هالطريقة بتخلّي أنظمة البحث تفهم الفروقات الدقيقة بين الصور اللي فيها نفس العناصر لكن بترتيب صفات مختلف، فبتحسّن تجربة المستخدم.
multimodal retrieval ranking distillation embedding arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

WorldReward: نموذج مكافأة للـ World Models المشروطة بالكاميرا

WorldReward: Reward Modeling for Camera-Conditioned World Models
الفريق قدم WorldReward، نموذج مكافأة مبني على VLM بيفحص إذا الفيديو المتولد يطابق الأوامر ويظل بصريًا عالي الجودة. النموذج بيقسم الفيديوهات لقطع متوافقة مع الأفعال، وبعدين بيصوت على كل قطعة لتحديد تفضيلات الفعل والجودة. تدربوا على مجموعة بيانات مكوّنة من تفضيلات مُولدة بأداة VLM ومراجعة بشرية، وعملوا Bench اسمه WorldReward-Bench لتقييم توافق النموذج مع تفضيلات الناس. النتائج بتظهر إن WorldReward يتفوق على GPT‑5.5 ويقوي جودة التنفيذ البصري عند تدريب HY‑WorldPlay 1.5.
ليش بتهمّك؟: لأنو بيخلّي الأنظمة اللي تولد فيديوهات تفاعلية تكون أقرب للواقع وتنفذ الأوامر بدقة أعلى، وهذا مهم لتطبيقات الواقع الافتراضي والروبوتات.
reward modeling world models video generation VLM RL hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

ليش Gated DeltaNet بيفضل 4‑Bit Quantization

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
الفريق اللي بيقودو سيرجي كوزيف ودافيد مايبورودا جربوا يضغطوا كل الطبقات الخطية بالموديل الهجين 27B، بما فيها Gated DeltaNet، باستخدام طريقة NVFP4 ب‑4‑bit للوزن و‑4‑bit للتفعيل. لقوا إن النموذج بيقارن مع BF16 تقريبًا على مجموعة من القياسات مثل perplexity وMMLU‑Pro وغيرهم، مع تقليل حجم الذاكرة لحد 17.5 GiB وزيادة سرعة التحميل. الدراسة بتشرح أربع آليات بتخلي الـgate وما يتأثر كثير بالخطأ، وكمان إن الضوضاء ما بتتراكم عبر السياق الطويل. النتيجة إنو بنقدر نضغط كل شي ونظل نرسل مقاييس KV‑cache بدون ما ينعكس على الأداء.
ليش بتهمّك؟: هالطريقة بتخلي تشغيل موديلات ضخمة أسرع وأرخص على الأجهزة المتوسطة بدون ما يضيعوا الدقة.
quantization LLM efficiency AI GDN arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

RealSWE: تقييم تركيبي للوكلاء البرمجيين على طلبات المستخدم الواقعية

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
هالورقة بتقارن بين طلبات المستخدمين الواقعية والـ benchmarks المتعارف عليها، وبتعرّف تصنيف معلومات بست فئات وأربع أبعاد للستايل اللغوي. بعدين بنوا RealSWE، مجموعة من 381 مهمة مشتقة من SWE-bench، كل وحدة فيها نفس المهمة الأساسية بس بنوع مختلف من المعلومات والستايل. جربوا سبع LLMs ولاحظوا إن الطلبات الواقعية بتقلل نسب النجاح بحوالي 6.4% وبتغيّر ترتيب النماذج، وكمان لقوا إن إضافة سلوك مرغوب ودافع بيحسّن الأداء كثير.
ليش بتهمّك؟: لأنها بتظهر إن تقييمات الـ benchmarks الحالية ما بتعكس طلبات المستخدمين الحقيقية وبتعطي توجيهات عملية لتحسين أداء الوكلاء البرمجيين.
coding agents evaluation LLM benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

تقطير نية السلوك لنماذج Vision-Language-Action

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
الفريق Lee وزملاؤه قدموا طريقة جديدة اسمها Intention Distillation (INDI) لتقوية الموديلات اللي تحوّل السياق البصري‑اللغوي إلى تصرفات روبوتية. الفكرة إنو المعلم VLM المجمد يفسّر مقطع من الملاحظة والتعليمات ويولد تمثيل نية وسلوك، وبعدها الموديل الأساسي يستخدم هالتمثيل لتوجيه توقعات الحركة. التجارب على SimplerEnv-Bridge وRoboCasa Kitchen أظهرت تحسين واضح بنسبة 20% تقريباً على نجاح المهام، وكمان تحسينات ملحوظة بالمواقف الواقعية.
ليش بتهمّك؟: بتخلي الروبوتات تفهم نية التعليمات وتنفّذها بدقة أعلى، فبيقللوا الأخطاء بالمهمات المعقّدة.
VLA intention distillation robotics multimodal learning benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

VibeVoice-ASR-Streaming: نظام تحويل الكلام إلى نص مع تعيين المتكلم بالوقت الحقيقي

VibeVoice-ASR-Streaming Technical Report
الفريق قدم VibeVoice-ASR-Streaming، أول نموذج مبني على LLM بيقدر يشتغل بث مباشر لتحديد الكلام ومن هو المتكلم بنفس الوقت. النموذج بيقسم الصوت لقطع ثابتة وبضيف شوية صوت قدّام وبيستغل النص السابق، فبيقدر يطلع "مين قال شو" أول ما يجي الكلام، من غير ما نحتاج مرحلة diarization منفصلة. بحجم 7B، حقق أدنى متوسط WER/CER على خمس مجموعات تقييم، وكمان كان الأفضل أو متساوي الأفضل في تعيين المتكلم على 12 من 13 إعداد. الباحثين نزلوا وزن النموذج 1.5B و7B مع كود الاستدلال.
ليش بتهمّك؟: هالطريقة بتخلّي المساعدات الصوتية ترد بسرعة وبشكل دقيق على كل متكلم، يعني تجربة أحسن للمستخدم.
ASR streaming speaker-attribution LLM speech-recognition hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

PACE: كشف الصراعات المخفية بطلبات المستخدم

PACE: Towards Surfacing Hidden Conflicts in User Requests
الفريق قدموا PACE، مجموعة بيانات جديدة بتقيس إذا طلبات المستخدمين فيها تعارض مع معلوماتهم الشخصية أو أحداث حياتهم. النموذج الجديد PaceMaker بيشتغل كإطار عمل متعدد الوكلاء، كل وكيل بيفعل دور معين مثل إعادة صياغة السؤال، استعراض رسومات المعرفة، وتصفية النتائج لتحديد إذا الطلب متعارض. التجربة أظهرت إن PaceMaker بيسترجع الأدلة السياقية وبيقرر بدقة أعلى إذا الطلب مناسب أو لا، مقارنةً بالطرق السابقة.
ليش بتهمّك؟: لأن المساعدين الذكيين لازم يرفضوا طلبات غير مناسبة قبل ما يسببوا مشاكل أو مخاطر للمستخدم.
conflict detection dataset multi-agent personalized assistants retrieval hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

RoboTok: محرك بيانات إنترنت لتعلم الروبوتات من عروض البشر

RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning
Howard Qian وزملاؤه قدموا RoboTok، محرك بيانات على مستوى الإنترنت بيستقبل فيديو إنسان عم يشتغل بيديه وبعدين يلاقي فيديوهات تانية على الويب فيها حركات مشابهة لتدريب سياسات روبوتية دقيقة. النظام بيتعلم مساحة حركة مخفية من مسارات يد ثلاثية الأبعاد ضمن إطارات مرجعية متركزة على الفاعل، وبهالطريقة بيقارن السلوكيات رغم اختلاف زوايا الكاميرا أو مظهر المشهد أو تغطية الفاعل. هالمساحة الضاغطة بتخلي البحث سريع وتحديث الفهارس مستمر على مجموعات فيديو ضخمة. النتائج أظهرت إن RoboTok يجيب عروض أكثر صلة ويقوي نجاح الروبوت بالمهمات، فصار الويب مصدر إشراف مستمر لتعلم الروبوتات.
ليش بتهمّك؟: الورقة بتفتح باب استغلال مليارات الفيديوهات على الإنترنت لتقوية تعلم الروبوتات بدون ما نحتاج نجمع بيانات مكلفة من الصفر.
robotics data-retrieval manipulation internet-scale learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
العدد السابقشو في AI؟ | تجميع الأسبوع 29 أغسطس — تطور وكلاء الذكاء
📚 كل الأعداد