📡 أحدث عدد

شو في AI؟ | 26 يونيو — تحسين كفاءة MLLM وتتبع متعدد المشاهد

يومي 📅 2026-06-26
سلام 👋 مرحبا، هالعدد بيقدّم لمحة سريعة عن أهم الأبحاث بالذكاء الاصطناعي، من تحسين كفاءة الـ MLLM لتوليد فيديو رباعي الأبعاد.
#1

TOPS: تحسين كفاءة الـ MLLM عبر تقليم الرموز البصرية

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
الفريق قدم طريقة جديدة لتقليل عدد الرموز البصرية بالـ MLLMs من غير ما يحتاجوا يدربوا نموذج جديد. الطريقة، اللي سماوها TOPS، بتبني ما يسموه Token Optimal Preservation Sets وبتعتمد على ثلاث مبادئ أساسية: صلة المهمة، تغطية المعلومات، وتنوع الدلالات. هالنهج ما بيحتاج تعديل على النموذج الأصلي، وبيشتغل مع أي MLLM. التجارب على 7 نماذج خلفية و14 benchmark أظهرت إنه TOPS يقدر يشيل أكثر من ¾ من الرموز مع الحفاظ أو حتى تحسين الأداء.
ليش بتهمّك؟: لأنه تقليل الرموز البصرية بيقلل استهلاك الطاقة وبيسرّع استجابة الـ MLLM، وهاد مهم لتطبيقات الوقت الحقيقي.
🌱 شو إلك منها؟
بتخيلوا إنه هالتقنية بتخلي التطبيقات اللي بتستخدم الصور والنصوص تشتغل أسرع، زي المساعدات الذكية على الموبايل أو أدوات الترجمة الفورية. يعني بدل ما الجهاز يشتغل ببطء مع كل صورة، بيقلل عدد العناصر اللي لازم يحسبها، وبيصير الردّ أسرع وأقل استهلاك للبطارية. ممكن تلاحظوا هالشي إذا استعملتوا تطبيقات تصوير ذكية ولا أدوات تعديل صور تعتمد على الذكاء الاصطناعي.
visual-token-pruning MLLM efficiency multimodal inference arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

ViQ: تمثيلات بصرية كوانتية متوافقة مع النص بأي دقة

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
الفريق قدم ViQ، إطار جديد بيوزع الصور كإشارات كوانتية متوافقة مع النص، وبيحافظ على تفاصيل الصورة ومعانيها بنفس الوقت. الطريقة بتشتغل على مرحلتين: تدريب مسبق متماشي مع اللغة بيقوي الفهم الدلالي، وبعدين بضغط المميزات عبر تعلم تمثيل قريب. كمان بيقدر يتعامل مع أي دقة أصلية للصور، يعني ما في داعي نعيد تحجيمها. التجارب أظهرت إنه ViQ يقدر يواكب أحدث نماذج الرؤية-النص ويعطي تسريع بين 20% و70% حسب حجم النموذج وطريقة التدريب.
ليش بتهمّك؟: ViQ بقلل استهلاك الموارد وبيسرّع تدريب النماذج المتعددة الوسائط، فهاد بيفتح باب لتطبيقات أذكى وأسرع على الأجهزة المحدودة.
🌱 شو إلك منها؟
تخيّل إنك بدك تبعت صورة على الموبايل وتكون مضغوطة بس ما تفقد تفاصيلها أو معناها، هالطريقة بتعمل هالشي وتخلي التطبيقات تشتغل أسرع. يعني ممكن تشوف تحسين بالبحث عن صور أو ترجمتها للغة تانية بدون ما يطيق الجهاز. هالتحسين رح ينعكس على الخدمات اليومية مثل المساعدات الصوتية أو تطبيقات الفوتوشوب على الإنترنت.
multimodal quantization vision-language efficiency representation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

MVTrack4Gen: تتبع نقاط متعددة المشاهد لتوليد فيديو رباعي الأبعاد

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
الفريق قدم MVTrack4Gen، إطار تدريب بيركّز على تتبع النقاط عبر مشاهد متعددة عشان يضيف إشراف هندسي وحركي لنماذج diffusion اللي بتولد فيديو من زاوية جديدة. لقوا إن طبقات الـ attention بتعطي إشارات مطابقة قوية، ولما هالإشارات بتتلخبط بيصير الفيديو مش متناسق بالحركة. فبنوّجه هالإشارات لراس تتبع متعدد المشاهد وبندرب النموذج مع هدف تتبع النقاط. النتيجة إن النموذج بيحافظ على الحركة بالمنظر المرجعي وبيطابق الهندسة عبر الزوايا.
ليش بتهمّك؟: هالطريقة بتخلّي توليد الفيديوهات من زاوية جديدة أكثر دقة بالهندسة وحركة المشاهد، فبتقربنا من تطبيقات الواقع المعزز.
🌱 شو إلك منها؟
تخيل إنك عم تشوف فيديو من زاوية وحدة، وبعدين بدك تشوفه من كل الاتجاهات كأنك بتلف حوله. هالتقنية بتخلي هالإشي ممكن بدون ما تحتاج كاميرات كتير، يعني ممكن تشوف المشهد من كل الجهات على موبايلك. ممكن تلاقي هالشي بألعاب الواقع الافتراضي أو تطبيقات تعديل الفيديو.
video generation diffusion multi-view geometry computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

تدريب واعٍ بالنوايا يحسّن أمان الـ LLM

Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes
الفريق Ferrao وزملاؤه قدموا مجموعة بيانات اسمها AIMS فيها 1,724 سؤال صعب عن السلامة مع وصف النية والعلامة الضارة. استخدموا AIMS لتدريب مصنّفات السلامة بطريقة واعية بالنية عبر fine‑tuning، preference learning، reasoning distillation، وreinforcement learning. النتائج تبين إنّ إعطاء النموذج إشارة واضحة للنية يرفع الدقّة على خمس benchmarkات سلامة، خصوصًا لما استُخدم GRPO لتقويّ النية. كمان النماذج الواعية بالنية وصلت لأفضل توازن بين سرعة الاستدلال ودقة الـ F1.
ليش بتهمّك؟: هالطريقة بتخلي نماذج اللغة أأمن وأدق بتحديد المحتوى الضار.
🌱 شو إلك منها؟
بتساعد الأنظمة اللي بتشتغل على الدردشة أو المساعدة الرقمية تعرف إذا المستخدم ناوي يسبب ضرر أو لا، زي لما تحكي مع مساعد صوتي وتطلب شي غير مناسب، النظام رح يرفض بطريقة أذكى. يعني بدال ما يخلّي الأخطاء تتسرب، بيحميك قبل ما يصير. ممكن تشوف هالتحسينات في تطبيقات المراسلة أو المساعدات الذكية اللي بتستعملها كل يوم.
LLM safety intent classification AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

DanceOPD: توليد صور بقدرات متعددة

DanceOPD: On-Policy Generative Field Distillation
الفريق اللي تحت قيادة Wei Zhou قدم طريقة جديدة لتدريب نماذج توليد الصور بحيث تقدر تعمل النص إلى صورة وتحرير محلي وعالمي بنفس الوقت. الطريقة اسمها DanceOPD وتعتمد على توجيه كل عينة لمجال قدرة معين وتدريب النموذج على تقليل فرق السرعة بين الطالب والموجه. بهالطريقة بيتم دمج القدرات المختلفة بدون ما يضايقوا بعض، وكمان بيشتغل مع إرشادات زي classifier‑free guidance. التجارب أثبتت إن النموذج بيحافظ على جودة الصورة الأصلية ويقوي كل قدرة من القدرات.
ليش بتهمّك؟: هالطريقة بتخلينا نقدر نستخدم نموذج واحد لتوليد وتعديل الصور بدقة أعلى وبجهد تدريب أقل.
🌱 شو إلك منها؟
تخيل إنك تقدر تكتب وصف لصورة وتطلع لك صورة، وبنفس الوقت تعدل جزء منها أو تغير الإضاءة من غير ما تنقص جودتها. هالشي ممكن يطلعك بأدوات تعديل صور أونلاين أسرع وأسهل، مثل التطبيقات اللي بنستعملها على الموبايل. يعني كل ما تحتاجه لتصميم صورة أو تعديلها بيصير بضغطة زر، بدون الحاجة لبرامج معقدة.
image-generation flow-matching multi-capability diffusion computer-vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

Causal-rCM: طريقة موحدة لتوليد الفيديو اللحظي والنماذج التفاعلية

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
الفريق قدم Causal-rCM، وهو إطار موحد بيجمع بين teacher-forcing وself-forcing لتسريع تدريب نماذج الفيديو المتسلسلة باستخدام diffusion. استغلوا كمان kernel خاص اسمه FlashAttention-2 JVP ليخلّوا التدريب أسرع بـ10 أضعاف مقارنةً بالطرق التقليدية. النتيجة إنه النموذج Wan2.1-1.3B وصل لأعلى درجة على benchmark VBench‑T2V مع خطوة أو خطوتين بس، وتطبيقه على Cosmos 3 بيخلّي النموذج يقدر يولّد مشاهد تفاعلية بناءً على أفعال المستخدم.
ليش بتهمّك؟: هالطريقة بتقربنا من توليد فيديو لحظي بجودة عالية وبدون ما نحتاج موارد ضخمة، فمفيد للبحث والتطبيقات العملية.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع صديق وتستقبل فيديوهات حية بجودة عالية فورًا، أو ألعاب بتولد مشاهدها حسب تحركاتك بلا تأخير. هالتقنية بتخلي هالأشياء ممكنة لأنها بتسرّع عملية توليد الفيديو وتقلل الحاجة لسيرفرات ضخمة. رح تشوفها قريبًا بخدمات البث الحي أو التطبيقات الترفيهية اللي بتعتمد على الذكاء الاصطناعي.
video generation diffusion autoregressive world models distillation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

قدّيش تاريخيّة الإيطاليّة مفاجئة للـ LLMs؟

How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation
الفريق قدم إطار تشخيصي بيفصل صعوبة النصوص التاريخية لأربع أبعاد: تكلفة الـ tokenization، الـ surprisal (عدم اليقين التنبئي)، الصمود الدلالي، وحساسية السياق. جربوا الإطار على ثلاث مجموعات بيانات: نصوص إيطالية من القرن الـ17، رواية "I Promessi Sposi" من القرن الـ19 كتحكم عالي التعرض، وكتب روسية من القرن الـ18 كاختبار ضغط إملائي. لقوا إن الـ tokenization بيزيد بنسبة 25‑30% لكل من الإيطالية القديمة والروسية، بس الـ surprisal إيطالية الـ17 أعلى بمرتين ونص مقارنةً بالمعاصرة، بينما الروسي ما زاد كتير. ومع هيك، تشابه الـ embeddings ظل عالي (>0.85) لكل المجموعات، يعني الفهم الدلالي ثابت. وأخيرًا، إضافة موجه بسيط بوقت تاريخي قللت الـ surprisal حوالي 60%، وهي طريقة موحدة لكل النماذج.
ليش بتهمّك؟: هالنتيجة بتخلينا نعرف كيف نستخدم LLMs بالمكتبات الرقمية للوثائق التاريخية بأمان، خصوصًا إذا بدنا نولد نصوص أو نبحث فيها.
🌱 شو إلك منها؟
الذكاء الاصطناعي أحيانًا بيصعب يتعامل مع الكتب القديمة لأن الكلمات بتكون مكتوبة بطريقة مختلفة، بس لسه بيقدر يفهم المعنى. إذا عطينا البرنامج إشارة صغيرة عن الفترة الزمنية للنص، بيصير الفهم أسهل بكتير. هالتحسين ممكن تشوفه بأدوات البحث على الإنترنت أو التطبيقات اللي بتقرا كتب قديمة وتساعدك تلاقي المعلومات بسرعة.
language models tokenization historical text evaluation mitigation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

JetSpec: كسر سقف تسريع فك الترميز التخميني

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
الفريق قدم طريقة جديدة اسمها JetSpec لتسريع LLMs باستخدام speculative decoding. الطريقة بتدمج كفاءة مسودة واحدة‑forward مع تحكم سببي على كل فرع من الشجرة، يعني بتولد شجرات مرشحة بتتوافق مع طريقة النموذج الأصلية. النتيجة إنه مع ميزانية مسودة أكبر بيصير في قبول أطول للرموز وبالتالي سرعة أعلى بالعملية. التجارب على نماذج Qwen3 أثبتت إنه JetSpec يطلع أسرع بكتير من الطرق السابقة على مهام رياضية وبرمجية وحوارية.
ليش بتهمّك؟: JetSpec بيفتح باب لتسريع تطبيقات LLMs الكبيرة بدون ما يضيع موارد المعالجة.
🌱 شو إلك منها؟
تخيّل إنك عم تقرأ رسالة طويلة وتحتاج تكتب رد سريع، JetSpec بيخلي النموذج يكتب الرد أسرع بكتير من قبل. يعني بدال ما تستنى دقيقة لتوليد كل كلمة، بتوصل للنتيجة بأقل وقت. هالسرعة ممكن تشوفها في خدمات الدردشة أو المساعدين الذكيين اللي بتستعملهم كل يوم.
speculative decoding LLM acceleration parallel drafting performance hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

ليش RL بينهار بأدوات متعددة وكيف الإشارات الإشرافية بتصلّحه

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
الفريق اللي بيقود البحث اكتشف إنه تدريب نماذج اللغة الكبيرة (LLMs) على استعمال الأدوات عبر التعزيز (RL) ممكن يطيح فجأة ويخرب هيكل استدعاء الأدوات، رغم إنه القدرة على الاستخدام نفسها ما اختفت. السبب هو ارتفاع غير متوقع بكمية توكنات التحكم، اللي بتخرب التنسيق. جربوا مجموعة إشارات إشرافية، من التدريب خارج‑السياسة إلى توجيه تلميحات، وخلطوا التدريب الإشرافي (SFT) مع الـRL. النتيجة إنه التدريب المتداخل حسّن الاستقرار، بس الأداء انخفض لما يجي تنسيق أو محتوى مختلف عن اللي تدربوا عليه.
ليش بتهمّك؟: هالنتائج بتساعدنا ندرّب نماذج أكثر استقرارًا وفعالية لما تحتاج تنفّذ مهام معقدة بتستدعي أدوات متعددة.
🌱 شو إلك منها؟
تخيّل إنّو عندك برنامج بيساعدك تحجز تذاكر أو يكتب إيميلات، بس فجأة يوقف يشتغل لأنّه "انقلب". هالبحث بيورجي كيف نضيف إشارات بسيطة للبرنامج ليتعلم يتصرف بثبات، حتى لو تغيرت الظروف. يعني ممكن تشوف تطبيقات أذكى وأكتر موثوقية على هاتفك أو على الإنترنت.
RL tool-use LLM supervision stability hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

رسم خريطة شبكات النخب السياسية بأوروبا عبر خط أنابيب استخراج الكيانات والعلاقات المتعدد اللغات

Mapping Political-Elite Networks in Europe with a Multilingual Joint Entity-Relation Extraction Pipeline
الفريق اللي هو Kirill Solovev و Jana Lasser قدموا خط أنابيب مفتوح الوزن يشتغل على نصوص إخبارية متعددة اللغات لاستخراج الكيانات والعلاقات معًا. الخط يدمج NER على أساس الـ span مع ثلاث مراحل ربط للمنشورات بمعرّفات Wikidata، وبعدين نموذج mixture‑of‑experts يطلع علاقات موجهة وموقعة بحسب أونطولوجيا محددة. التقييم على مجموعة معيارية فيها 3491 علاقة بيّن إن الدقة النصية تتراوح من 68.2% (صارمة) لحد 93.7% (مرنة). وبعدين طبقوه على حالتين: في النمسا أعادوا مسار حياة حزب سياسي كامل، وفي بولندا كشفوا شبكة الصراعات والروابط الاقتصادية بين الأحزاب.
ليش بتهمّك؟: هالطريقة بتخلينا نرسم خريطة دقيقة لعلاقات النخب السياسية من غير ما نضطر ندوّن يدويًا، وبتفتح باب دراسات مقارنة أوسع وأسرع.
🌱 شو إلك منها؟
تخيل إنك تقدر تشوف مين بيتعاون مع مين في السياسة بس من خلال قراءة الأخبار، زي ما بنشوف شجرة عيلة. هالشي بيساعد المواطن يفهم أكتر مين بيأثر على قرارات الدولة، وبيظهر في تطبيقات تحليل الأخبار أو منصات الشفافية اللي بتعتمد على هالبيانات.
entity-relation extraction multilingual knowledge graph political analysis LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

CARVE: نموذج تكراري واعي بالمحتوى وكفاءة بالقيمة

CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention
الفريق اللي ورا CARVE لاحظ إنّ الأنظمة التكرارية القديمة ما بتستشير الذاكرة قبل ما تنسحب معلومات، فبيصيروا ينسوا إشي مهم. هالمشكلة حلّوهم إنّهم يخلوا عملية المسح تشتغل بس على محور المفتاح، ويستغلوا ناتج الذاكرة الموجود على الـGPU كإشارة للمسح، وبستبدلوا كل مشروع كتابة لكل قيمة بمتغيّر واحد بسيط لكل رأس. التجربة على 1.3 مليار معلمة وعلى 100 مليار كلمة أظهرت إنّ CARVE يحقق تحسين بسيط على الـperplexity ويقود كل النماذج التكرارية على تسع اختبارات للمنطق العادي، وكمان يحقق أفضل نتيجة على كل اختبار RULER مع استهلاك أقل للذاكرة والوقت.
ليش بتهمّك؟: بيخلّي النماذج التكرارية أقوى وأسرع مع استهلاك أقل للموارد، يعني ممكن نستخدمها بأجهزة أقل قوة بدون ما نخسر الدقة.
🌱 شو إلك منها؟
تخيّل إنّ برنامج يقرأ قصة ويتذكر تفاصيلها بدون ما ينسى شي مهم، وبسرعة أكبر. هالنظام بيشتغل هيك، فبتصير التطبيقات اللي تحكي معك أو تساعدك بالكتابة أذكى وأسرع، حتى على الموبايل. ممكن تلاحظ الفرق لما تستخدم شات بوت يجاوب بسرعة أكبر وبفهم أعمق للنصوص.
recurrent attention language modeling efficiency benchmarks arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

OpenRCA 2.0: تحليل السبب الجذري بخطوات واضحة

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
الفريق اللي بيقود البحث، Aoyang Fang وزملاؤه، قدموا بروتوكول تسمية اسمه PAVE بيستغل تدخلات معروفّة لتتبع مسار السبب لحد ما يوصل للعرض الظاهري. بهالطريقة بيشتغلوا على تقييم LLM agents بطريقة "من السبب للنتيجة" بدل ما يحاولوا يربطوا الأعراض بالسبب بالعكس. النتيجة إنهم جمعوا 500 حالة لتكوين مجموعة OpenRCA 2.0، أول benchmark ببيانات سببية خطوة بخطوة للـLLM agents. التجربة على 11 نموذج متقدم تبين إن نسبة استرجاع السبب الجذري بالكامل ما بتوصل غير لـ20.7 %، بينما التعرف على سبب واحد صحيح بيصير بـ76 % لكن ربطه بالمسار السببي بيقل لـ61.5 %.
ليش بتهمّك؟: هالورقة بتكشف الفجوة بين تقييم النتائج بس وبتعطي معيار واضح لتقييم قدرة الـLLM على التفكير السببي خطوة بخطوة، وهاد مهم لتطوير أنظمة تشخيص موثوقة.
🌱 شو إلك منها؟
تخيل إنك عم تحاول تعرف ليش المكيف ما بيبرد الغرفة؛ هالطريقة بتساعد الكمبيوتر يلاقي السبب خطوة بخطوة مش بس يجاوب بنعم أو لا. يعني إذا كان عندك مشكلة بالإنترنت أو بالموبايل، ممكن تستفيد من أدوات تشبه هالمقاربة لتحديد السبب الحقيقي بسرعة. هالشي رح يبين حاله بأدوات الدعم الفني أو التطبيقات اللي بتحلل الأعطال تلقائيًا.
LLM RCA benchmark causality evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

RSPC: معيار لنمذجة الإجهاد والحالات النفسية في العلاقات التي تتم عبر الوسائط الرقمية باستخدام تعليقات الأطباء النفسيين

RSPC: A Benchmark for Modeling Stress and Psychiatric Conditions in Digitally Mediated Relationships using Psychiatrist Annotations
هالورقة قدمت مجموعة RSPC، مجموعة فيها 1,799 مشاركة من Reddit عن علاقات عن بُعد، وطبّقوا عليها تشخيصات من أطباء نفسيين تشمل القلق والاكتئاب. إشي حطوا فيه ثلاث مهمات: تصنيف الاضطرابات، كشف محفّزات الضغوط العلائقية، وتحديد مرحلة العلاقة. جربوا سبع نماذج transformer و5 large language models، ولاّقوا إنه Claude-3-Haiku بيجيب أحسن نتيجة لتصنيف الاضطرابات (Macro-F1=0.538) وGPT-4o بيقود بأقوى نتيجة لكشف المحفّزات (Macro-F1=0.519). هالنتايج بتبيّن إنه كل عيلة نماذج عندها قوة خاصة حسب المهمة.
ليش بتهمّك؟: هالنتيجة بتخلينا نطوّر نماذج تفهم الصحة النفسية ضمن سياق العلاقات، مش بس الفرد لحاله.
🌱 شو إلك منها؟
تخيلوا إنه تطبيقات الدعم النفسي تقدر تفرّق بين القلق اللي بيجي من علاقة عن بُعد وبين القلق العادي، وبهالطريقة تعطي نصايح أدق. يعني إذا كنتوا عم تحكوا مع صديق على موبايل وتحتاجوا نصيحة، هالتقنية ممكن تشتغل ورا الكواليس لتقرا مشاعركم وتفهم السياق. هالشي بيظهر هلق بتطبيقات الدردشة أو المنصات اللي بتعطي دعم نفسي.
mental health dataset benchmark NLP relational arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

OPID: تقطير المهارات داخل التعلم المعزز للوكيل

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
الفريق قدم إطار OPID اللي بيسحب إشارات المهارات مباشرة من مسارات الوكيل اللي بيشتغل عليها حالياً. بيقسم الإشارات لهيكليات مهارات: مهارات على مستوى الحلقة بتحدد قواعد عامة، ومهارات على مستوى الخطوة بتعطي توجيه لقرارات حاسمة. لما يلاقي قرار مهم، النظام بيستعمل مهارة الخطوة، وإلا بيرجع لمهارة الحلقة كدليل افتراضي. هالإشارات بتندمج مع مكافآت النتيجة لتدريب الوكيل، وبيظهر تحسين ملحوظ بالأداء والكفاءة على بيئات ALFWorld وWebShop وأسئلة البحث.
ليش بتهمّك؟: الطريقة بتعطي الوكيل إشارات تعلم أدق، فبيصير يتعلم أسرع ويعطي نتائج أقوى.
🌱 شو إلك منها؟
تخيل إنه مساعدك الذكي بيتعلم من تجاربه السابقة زي ما نتعلم من رحلاتنا اليومية، فبيصير يعرف يختار أشياء أذكى لما يشتري أونلاين أو يجاوب على أسئلتك. هالتحسين بيخلي الخدمات الذكية تكون أسرع وأكثر دقة، وبتشوف الفرق وانت تستخدم تطبيقات التسوق أو البحث على الإنترنت.
RL skill distillation agentic reinforcement learning ALFWorld hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

مولدات بولتزمان الأوتورجريسية (Autoregressive Boltzmann Generators)

Autoregressive Boltzmann Generators
الفريق بقيادة Danyal Rehman بيقدّموا إطار جديد اسمه Autoregressive Boltzmann Generators (ArBG) لتوليد عينات توازن حراري للجزيئات بطريقة أسرع وأكتر مرونة من الطرق التقليدية. ArBG ما بيعتمد على الـ normalizing flows، فبتهرب من قيود الانعكاسية وبتسمح بتدخلات تسلسلية وقت الاستدلال. التجارب بتبين تحسين واضح على كل الـ benchmarks، خصوصاً على أنظمة الببتيدات الكبيرة مثل Chignolin. كمان أطلقوا نموذج Robin بـ 132 مليون باراميتر بيقلل خطأ الطاقة في الأنظمة الصغيرة بأكثر من 60٪.
ليش بتهمّك؟: هالطريقة بتخلّي محاكاة الجزيئات أسرع وأدق، فبتفتح باب لتصميم أدوية وعلاجات أسرع.
🌱 شو إلك منها؟
تخيّل إنك بدك تحضّر أكلة معقدة وتحتاج وقت طويل لتطبّخ المكونات؛ هالطريقة بتعطيك المكوّنات جاهزة بسرعة، فبتقّص وقت التجارب بالمختبر. يعني بدال ما ننتظر أيام لتلاقي جزيء مناسب، بنقدر نلقاه بوقت أقصر. ممكن تشوف أثرها بأدوات تصميم الأدوية على الإنترنت أو تطبيقات البحث العلمي اللي بتستعمل نماذج الذكاء الاصطناعي لتوليد جزيئات جديدة.
generative models Boltzmann generators autoregressive molecular simulation AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

LingxiDiagBench: إطار متعدد‑الوكلاء لتقييم LLMs في الاستشارة النفسية الصينية

LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis
المشكلة إنه عدد الأطباء النفسيين قليل والتشخيص بيعتمد على المقابلات، فصعب نحصّل تقييم ثابت. الباحثين حطّوا LingxiDiagBench، benchmark كبير بيشتغل كأنّه مجموعة من الوكلاء بتقّيم LLMs على استشارة نفسية متعددة الجولات بالصيني، ومعاه مجموعة بيانات LingxiDiag-16K فيها 16,000 حوار صناعي متطابق مع سجلات طبية حقيقية وبتمثل 12 فئة من تصنيفات ICD-10. التجارب بيّنوا إنه LLMs بتجيب دقة عالية لتصنيف الاكتئاب‑القلق الثنائي (92.3٪) لكن بتقع كتير لما يجي يتعرف على التزامن أو على التشخيص التفريقي بـ12 فئة (28.5٪). كمان استشارة الديناميكية بتعطي أداء أسوأ من التقييم الساكن، والـLLM‑as‑a‑Judge ما بيقيس جودة الاستشارة بدقة.
ليش بتهمّك؟: هالنتيجة بتفرجينا إنه LLMs لسا ما جاهزة تستبدل طبيب نفسي بالاستشارة المتعددة الجولات، ولازم نطوّر استراتيجيات جمع معلومات أحسن.
🌱 شو إلك منها؟
تخيل إنك تحكي مع برنامج ذكي لتقييم صحتك النفسية، بس البرنامج ما بيفهم كل تفاصيل حالتك، فبيطلع بنتائج غير دقيقة. هالورقة بتوضح إنه هالتقنية لسا محتاجة تحسين لتقدر تساعد الناس فعلياً، مثلاً بتطبيقات الدردشة اللي بنستعملها عشان نعرف إذا بنحتاج استشارة طبيب. إذا فيك تشوف هالتقنية بتظهر بأدوات مثل تطبيقات الصحة الرقمية، هالنتائج بتخلينا ننتبه إنه ما نثق فيها كلياً لحد ما تتحسن.
LLM benchmark mental health multi-agent Chinese hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

Qwen-Image-Agent: جسر الفجوة السياقية لتوليد الصور الواقعية

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
الفريق قدم Qwen-Image-Agent، إطار وكيل موحد بيجمع بين التخطيط، التفكير، البحث، الذاكرة والتغذية الراجعة لتقريب الفجوة بين طلب المستخدم وسياق التوليد المطلوب. بيعتبروا مدخل المستخدم سياق جزئي وبيبنو السياق الكامل عبر Context-Aware Planning لتحديد النقاط الناقصة، وContext Grounding لجمع المعلومات من التفكير والبحث والذاكرة. جربوا النموذج على IA‑Bench، Mindbench وWISE‑Verified، وطلعوا بأداء أحسن من الأساسيات ووصلوا لأحدث النتائج.
ليش بتهمّك؟: بيدعم توليد صور أقرب لاحتياجات المستخدم الفعلية، خصوصًا لما يكون الطلب غير واضح أو يحتاج معلومات حديثة.
🌱 شو إلك منها؟
تخيل إنك بدك صورة لشي معين، والنظام بيطلب منك تفاصيل أكتر أو حتى بيدور على معلومات جديدة ليعطيك نتيجة أقرب لخيالك. هالشي بيساعدك تحصل على صور دقيقة بدون ما تحتاج تكون خبير في أوصاف الصور. ممكن تشوف هالتقنية بأدوات التصميم أو التطبيقات اللي بتولد صور من النصوص على الموبايل أو الويب.
image generation multimodal agent benchmark context hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

أفق التحقق: ما في رصاصة سحرية لمكافآت وكيل البرمجة

The Verification Horizon: No Silver Bullet for Coding Agent Rewards
الباحثين بيقولوا إنه مع تطور الfoundation models وصاروا يقدروا يولدوا حلول برمجية معقّدة بسهولة، صار التحقق من هالحلول هو الأصعب. بيحدّدوا جودة إشارات التحقق بثلاثة أبعاد: القابلية للتوسع، الإخلاص، والصلابة، وبيقدّموا أربع تصاميم للمكافأة لتقليل الreward hacking وتحسين جودة الإنجاز. التجارب على مجموعة من الbenchmarks الداخلية والعامة بتظهر إنه تعديل التحقق بشكل موجه بيقلل الغش وبيرفع جودة النتيجة.
ليش بتهمّك؟: لأنه إذا ما صرنا نتحقق من الكود بشكل موثوق، رح يظل في فجوة بين نية المستخدم والنتيجة الفعلية للوكيل، وهذا بيعرقل تطبيقات الذكاء الاصطناعي العملية.
🌱 شو إلك منها؟
تخيل إنه عندك برنامج بيساعدك تكتب رسائل إلكترونية، بس ما في طريقة تتأكد إنه الرسائل صحيحة ومطابقة لطلبك؛ هالمشكلة نفس اللي عم يواجهه الباحثين مع الوكلاء البرمجيين. إذا قدروا يطوّروا طريقة تحقق ذكية، رح يضمنوا إنه الأدوات الرقمية تعطيك نتائج دقيقة بدل ما تخدعك. هالتحسين رح ينعكس على أي تطبيق تستخدمه يوميًا، من المساعدات الذكية للبرمجة إلى أدوات الدعم الفني.
coding agents verification reward design benchmarks AI safety hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

تخصيص البتات للـ KV‑Cache مع RoPE

RoPE-Aware Bit Allocation for KV-Cache Quantization
فريق Liang وزملاؤه قدموا طريقة جديدة اسمها Block‑GTQ لتوزيع البتات على الـ KV‑cache بطريقة RoPE‑aware. هالطريقة بتحسب طاقة كل بلوك من RoPE وبتعطيه عدد البتات المناسب لتقليل الخطأ، فبتقلل MAE بـ 32‑80٪ مقارنةً بالـ TQ‑MSE العادي. النتائج بتبين إنه النموذج بيصير أفضَل على مهام الفهم والاستدلال مع سياقات طويلة، وكمان بيقلل استهلاك الذاكرة وبيسرّع التنفيذ على بطاقات GPU.
ليش بتهمّك؟: لأنّ تحسين ضغط الـ KV‑cache بيسمح للـ LLM يشتغل بذاكرة أقل وبسرعة أعلى، وهذا مهم لتطبيقات النصوص الطويلة على الأجهزة المتوسطة.
🌱 شو إلك منها؟
مع التقنية الجديدة، ممكن تشغّل نموذج كبير على حاسوبك الشخصي وتقرأ مقالات أو كتب طويلة من غير ما يوقف أو يبطئ. يعني كأنك عم تحط كل الكتب على رف واحد بدل ما تشتت الرفوف. هالشي بيوصلنا لتطبيقات مثل المساعدات الذكية اللي بتفهم سياق محادثة طويلة بدون ما تحتاج سحابة قوية.
quantization KV-cache RoPE efficiency LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

إطار تحكم قابل للتفسير (XCF) مع شرح فازي ودعم وكيل LLM

Explainable Control Framework (XCF) based on Fuzzy Model-Agnostic Explanation and LLM Agent-Supported Interface
فريق Yin وزملاؤه قدموا إطار تحكم جديد اسمه XCF بيقدر يفسّر سلوك المتحكمات حتى لو كانوا من الصناديق المغلقة. الطريقة الأساسية هي HFMAE‑C، نظام فازي بيستبدل المتحكم ويطلع قواعد IF‑THEN تشرح كيف قررت الأوامر وتحدد شو حالة النظام إلها وزن أكبر. كمان ضافوا واجهة مدعومة بوكيل LLM بتفهم طلبات المستخدم وتكتب التقارير بلغة طبيعية. جربوا الطريقة على نظام البندول المقلوب وروبوت Turtlebot، وطلعت أحسن من الطرق التفسيرية التقليدية.
ليش بتهمّك؟: هالطريقة بتخلّي المهندسين يطلعوا على قرارات المتحكم بسهولة، فبيقدروا يطوّروا الأنظمة بأمان أكبر.
🌱 شو إلك منها؟
تخيّل إنك عم تستعمل جهاز تحكم للسيارة أو للروبوت، وبدك تعرف ليش هو بيتحرك بهالطريقة. هالإطار بيشرح لك القرار بخطوات بسيطة زي قواعد «إذا… إذاً…»، وبساعدك تفهم إذا في شي غلط. ممكن تشوف هالشرح من خلال تطبيقات الذكاء الاصطناعي على موبايلك أو موقع إلكتروني.
explainable AI fuzzy logic control systems LLM robotics arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 9
Token Optimal Preservation Sets
مجموعة الـ tokens اللي بنحافظ عليها بأفضل شكل خلال التدريب أو الاستنتاج، عشان ما نضيع معلومات مهمّة من النص
visual token pruning
عملية تقليل عدد الـ visual tokens اللي بنستعملها بالموديل، بنشيل الـ tokens اللي ما إلها فائدة عشان النموذج يشتغل أسرع
hallucination
يعني النموذج بيخترع معلومات مش موجودة أصلاً وبيقدمها وكأنها حقيقية! إشي خطير لأنه الكمبيوتر بيكون واثق من إجابة غلط.
pretrained language model
موديل لغة مدرب مسبقاً على كمية هائلة من النصوص، احنا بنستفيد منه عشان يقدر يفهم ويولّد نصوص بدون ما نحتاج ندربه من الصفر
quantization
الـ quantization هو تحويل القيم العائمة للوزن إلى أعداد صحيحة أصغر، يعني بنقلل الدقة شوي عشان النموذج يشتغل على أجهزة أقل قدرة.
multi-view tracking
تقنية بتتبع نفس الشي من أكتر من زاوية أو كاميرا، عشان نضمن المتابعة تكون دقيقة حتى لو تغيّرت الرؤية
geometric consistency
تأكد إن الشكل والمسافات بين العناصر تظل ثابتة عبر الإطارات أو المشاهد، مش لازم يتغيّروا عشوائياً
point-tracking objective
هدف التدريب اللي بيخلي النموذج يتعلم يتبع نقاط معينة بالصورة عبر الزمن، عشان يقدر يحدد الحركة بدقة
DPO
طريقة تدريب حديثة بدل ما نعلم النموذج على إجابات صح وخطأ بشكل منفصل، احنا بندربو يختار بين إجابتين ويفضّل الأحسن منهن مباشرة.
🤖 موديلز 4
LLaVA-NeXT
موديل جديد اسمه LLaVA‑NeXT بيجمع بين الفهم النصي والرؤية، بدنا نستخدمه لتوليد ردود فيها صور وفيديوهات
ViQ
ViQ هو موديل بيشتغل على تحسين جودة الفهم البصري، بيستغل تقنيات الـ quantization لتقليل حجم الموديل بدون ما يضيع الدقة
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
diffusion model
diffusion model نموذج توليدي بيضيف ضوضاء للصورة خطوة بخطوة وبعدين يزيلها، عشان يخلق صور جديدة واقعية.
🗂️ بيانات 1
AIMS
AIMS dataset بيجمع فيديوهات مع أوامر فعلية لتدريب نماذج vision-language-action، احنا بنستعمله عشان نطور أنظمة تفاعلية بتفهم وتنفذ.
كل المصطلحات ←
العدد السابقشو في AI؟ | 25 يونيو — نظام ذاكرة للوكيل وتصوير دقيق
📚 كل الأعداد