📡 أحدث عدد

شو في AI؟ | 17 يوليو — تطور الوكلاء المتعددين

يومي 📅 2026-07-17
سلام 👋 هلقيت هالعدد بيغطي أحدث التطورات بالوكيل الذكي وتطبيقاته المتعددة. رح نعرضلكم نماذج مفتوحة، معايير تقييم، وتقنيات تدريب بتقوي أداء الوكلاء.
#1

دليل Harness: تنظيم وتعديل أنظمة الوكلاء المتطورة

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
الفريق قدم طريقة جديدة لتوثيق سلوكيات الـ harness تبع الوكلاء، يعني الكود اللي بيبني الـ prompts ويدير الحالة. الطريقة بتشتغل على تحليل ثابت للكود وبمساعدة LLM بترتب السلوكيات وتربط كل سلوك بمكانه بالمصدر. كمان أضافوا تقنية اسمها Behavior-Guided Progressive Disclosure (BGPD) اللي بتقود الوكلاء من الفكرة العامة للسلوك لتفاصيل التنفيذ وتتحقق من المواقع المقترحة. التجارب على طلبات تعديل من مشروعين مفتوحين ورجعت إنو التخطيط بمساعدة الدليل حسّن تحديد السلوكيات وخطط التعديل وصار يستهلك أقل توكنات للبلانر.
ليش بتهمّك؟: هالطريقة بتقصر الوقت والجهد لتعديل أنظمة الوكلاء المعقّدة، فبصير أسهل نضيف ميزات أو نصلّح أخطاء.
🌱 شو إلك منها؟
تخيّل إنك عندك برنامج مساعد ذكي، وبدك تغير طريقة شغله، هالدليل بيساعد المطوّر يلاقي بسرعة وين الكود اللي لازم يتغيّر، متل ما تلاقي وصفة معينة بكتاب طبخ. هالشي بيسهّل تحديث التطبيقات اللي بنستعملها يوميًا مثل المساعدات الصوتية أو الروبوتات المنزلية.
agents code analysis LLM software engineering hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

Boogu-Image-0.1: نموذج مفتوح لتوليد وفهم الصور المتعدد الوسائط

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
الفريق قدم Boogu-Image-0.1، عائلة نماذج مفتوحة المصدر بتجمع الفهم والتوليد المتعدد الوسائط، فيها إصدارات Base, Turbo, Edit, وEdit‑Turbo. النموذج بيقدّم توليد صور بجودة عالية من النص، تحرير سريع بناءً على تعليمات، وحتى عرض نص صيني‑إنجليزي. بالرغم من إنو تدرب على 208.6 مليون صورة بس بتكلفة تقريباً 400 ألف دولار، إلا إنه بيقارن أو يتفوق على نماذج مفتوحة تانية وبيقرب من الأنظمة المغلقة القوية. كل الكود والأوزان نزلوا تحت رخصة Apache 2.0 لتقوية المجتمع المفتوح.
ليش بتهمّك؟: هالورقة بتفرجي إنه ممكن نحقق أداء قوي لتوليد وتحرير الصور حتى بموارد حسابية محدودة، وبتفتح الباب للباحثين والمطورين يشتغلوا على مشاريع مشابهة بدون ما يدفعوا مبالغ ضخمة.
🌱 شو إلك منها؟
تخيّل إنك تكتب وصف بسيط وتطلع صورة كأنها من خيالك، أو تعدّل صورة موجودة بمجرد توجيه بسيط، كل هالشيء صار أسهل وأرخص بكتير. هالتقنية ممكن تساعد المصممين، صانعي المحتوى، وحتى المستخدمين العاديين يخلقوا صور مميزة للمنشورات أو الهدايا. رح تشوفها قريباً بأدوات تعديل الصور على الويب أو تطبيقات السوشيال ميديا.
multimodal open-source text-to-image image editing generation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

تدريب وسط للـ Coding Agent بـ Function‑Aware Fill‑in‑the‑Middle

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
الفريق شاف إن حلقة action‑observation‑continuation للـ coding agents تشبه استدعاء دالة بالبرمجة، فاستغلوا هالترابط ب‍self‑supervised objective اسمه function‑aware fill‑in‑the‑middle (FIM) لتدريب وسط على موديلات Qwen2.5‑Coder‑Instruct (7B/14B) وQwen3‑8B. بعد ما عَمِلوا mid‑training على 2.6 B‑token من كود بايثون، شافوا تحسين واضح على benchmarks مثل SWE‑Bench وSWE‑Bench‑Lite، وكمان ما ضاعوا الأداء على مهام غير برمجية مثل tau‑bench وBFCL.
ليش بتهمّك؟: هالطريقة بتعطي الـ coding agents قدرة أحسن على دمج نتايج الأدوات الخارجية داخل التفكير، فبتصير أكثر فاعلية بالبرمجة التلقائية.
🌱 شو إلك منها؟
تخيل إنو برنامج يقدر يكتب كود ويستفيد من نتايج الأدوات اللي بيستدعيها بنفس الوقت، متل ما بنستفيد من محرك البحث فوراً. هالتحسين بيخلي التطبيقات اللي تعتمد على كتابة كود أو تصحيح أخطاء تلقائية أسرع وأدق، فممكن تشوفه بأدوات المساعدة البرمجية أو المنصات التعليمية اللي بتساعدك تكتب كود بسهولة.
coding agents FIM pretraining benchmark Qwen hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Ring-Zero: نموذج لغة بـ تريليون بارامتر لتفكير متسلسل

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
الفريق قدم طريقة تدريب جديدة للـ zero RL على نموذج بحجم تريليون بارامتر، وخلصوا إنو هالتحجيم بيزيد كفاءة العينة وأداء النموذج. حطوا تحسينات نظامية مثل clipped importance sampling وتصحيح نسبة التدريب‑الاستدلال وتحكم بالمختلط‑الدقة لتفادي مشاكل القراءة الزايدة وتكرار الرموز. التجارب بيّنت إنو النموذج بمر بمرحلتين: اكتشاف أولي وبعدين صقل، وبيظهر سلوكيات معرفية متقدمة مثل التحقق الذاتي وتنسيق النص. على سبع benchmarks رياضيّة، Ring‑2.5‑1T‑Zero وصل لأداء منافس.
ليش بتهمّك؟: هالورقة بتفرجي إنو توسيع الـ zero RL لتريليون بارامتر بيقّدر يخلق نماذج تفكّر بطريقة أقرب للإنسان وتقلل الحاجة لتدخل يدوي.
🌱 شو إلك منها؟
تخيل إنو برنامج يقدر يحل مسائل رياضية ويشرح خطواته بدون ما نكتب له تعليمات مفصلة. هالشي ممكن يساعد الطلاب يلاقوا حلول واضحة وسريعة، أو يساعد الشركات يطوّروا أدوات دعم تلقائي. ممكن تشوف هالتقنية قريباً في تطبيقات التعليم أو المساعدة الذكية.
zero RL scaling language models reasoning benchmarks hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

SEED: طريقة ذاتية التطور لتقوية الوكلاء عبر التقطير أثناء التدريب

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
الفريق قدم SEED، إطار بيحوّل مسارات التدريب اللي تمّ إنجازها إلى مهارات نصية بنستخلصها من نفس السياسة. بعدين بيعيد يوزّع هالمهارات على السياسة لتعطي إشارات غنية على مستوى كل كلمة، مع RL التقليدي. التجارب على مهمات نصية وبصرية للوكيل أظهرت تحسين واضح بالأداء وكفاءة العينة، وحتى على سيناريوهات ما شفناها قبل.
ليش بتهمّك؟: بقلل الحاجة لمكافآت نادرة وبيسرّع تعلم الوكلاء، فبيقدروا ينجزوا مهام أطول بأقل تجارب.
🌱 شو إلك منها؟
تخيل إنو برنامج ذكي بيتعلم من شغله نفسه، وبعد ما يخلص شغلة بيستخلص منها خطوات أو قواعد يطبقها بالمستقبل. هالطريقة بتخلي البرنامج يتعلم أسرع، يعني ممكن يلاقي حلول أسرع لأسئلة أو يجيب معلومات من الإنترنت بفعالية أعلى. رح تشوف هالتحسينات بأدوات مثل المساعدات الرقمية أو التطبيقات اللي بتتعامل مع النصوص والصور.
RL agents distillation on-policy SEED hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

SearchOS-V1: إطار تعاوني قوي للبحث المفتوح

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
فريق الباحثين قدموا SearchOS، إطار متعدد الوكلاء بيحوّل تتبع التقدم بالبحث من حالة مخفية لحالة صريحة ومشتركة. بيشتغلوا على تحويل مهمة البحث المفتوح لسؤال يملأ مخطط علاقاتي مع مراجع مثبتة، وبيستخدموا مكوّن اسمه Search‑Oriented Context Management ليحافظ على حالة البحث عبر Frontier Task، Evidence Graph، Coverage Map وFailure Memory. كمان بنوا جدولة pipeline‑parallel بتخلّي الوكلاء يشتغلوا بالتوازي وتعبّي الفجوات اللي ما انغطت، وبيضيفوا Search Tool Middleware Harness لتسجيل الأدلة وتجنّب التكرار. التجربة على مجموعات WideSearch وGISA أظهرت إن SearchOS بيقود كل المقاييس مقارنةً بالأنظمة التانية.
ليش بتهمّك؟: هالطريقة بتقوّي قدرة الوكلاء على جمع معلومات دقيقة بدون ما يضيعوا وقت أو موارد.
🌱 شو إلك منها؟
تخيّل إنك عم تدور على معلومة على الإنترنت وبدك ما تضل تعيد نفس البحث مرة ورا مرة. هالنظام بيحفظ كل خطوة وبيرجعلك بالمصدر مباشرة، فبتلاقي الجواب أسرع وبأدق. ممكن تشوف هالتحسينات في محركات البحث أو التطبيقات الذكية اللي بتساعدك بحلّ أسئلة معقّدة.
search multi-agent LLM information retrieval collaboration hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

VideoChat3: نموذج فيديو عام مفتوح وكفء

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
فريق الباحثين قدموا VideoChat3، وهو نموذج MLLM يركز على الفيديو بشكل كامل ومفتوح. استخدموا تصميمين: الأول يخلّي النموذج أسرع بفضل Inflated 3D Vision Transformer (I3D‑ViT) وAdaptive Frame Resolution للستريمينغ، والثاني يزوّد النموذج ببيانات متنوعة من ثلاث مجموعات تدريبية تغطي الفيديو الأكاديمي، الفيديو الطويل، وفيديو الستريمينغ. النتيجة إنو النموذج يقدر يتعامل مع أنواع فيديو كتيرة وبكفاءة أعلى، ومع 4 بليون باراميتر بس بيتفوّق على النماذج المفتوحة الكبيرة التانية على مجموعة من الـ benchmarks.
ليش بتهمّك؟: هالورقة بتعطي مجتمع البحث أداة مفتوحة، سريعة، وتقدر تفهم فيديوهات متنوعة بدون ما تحتاج موارد ضخمة.
🌱 شو إلك منها؟
تخيّل إنك تقدر تشغّل تطبيق يترجم أو يفسّر محتوى الفيديوهات على هاتفك بسرعة، حتى لو الفيديو طويل أو مباشر، من غير ما يستهلك بطارية ولا يبطئ الجهاز. هالشي ممكن ينعكس على تطبيقات التعليم عن بُعد أو المساعدة في مشاهدة محتوى معقد بسهولة. يعني رح تشوف تحسينات بخدمات الفيديو اللي بتستعملها يوميًا، مثل التطبيقات اللي تشرح فيديوهات على اليوتيوب أو تساعدك بفهم محاضرات مسجّلة.
video understanding MLLM efficiency open-source benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

SynthDocBench: معيار صناعي لفهم المستندات البصرية بطول طويل

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
الفريق قدم SynthDocBench، معيار صناعي بيركّز على فهم المستندات البصرية بطول كبير. بيحكموا على عوامل مثل طول المستند، تعقيد التخطيط، تركيبة الوسائط، ونوع السؤال بشكل مستقل، يعني كل إشي بيتغيّر لحالو. المستندات بتنولد من طرف LLM عبر ستة أنماط تخطيط، ومع 40% تعديل عشوائي لتجنّب استغلال النماذج للارتباطات السطحية. جربوا السبعة نماذج VLMs ولقوا ثلاث مشاكل ما ظهرت بأي معيار تاني.
ليش بتهمّك؟: المعيار بيساعدنا نعرف وين النماذج بتفشل فعلاً، مش بس على أساس شغلات مصطنعة بالاختبارات القديمة.
🌱 شو إلك منها؟
تخيل إنك عندك ملف PDF طويل فيه جداول ورسومات، والنظام اللي بيقراه ممكن يضيع معلومات مهمّة إذا ما كان مدرب على هالنوع من المستندات. هالورقة بتبين إن الأنظمة الحالية ممكن تنسى النصوص بالمنتصف أو ما تفهم الرسومات لو الملف كبير. يعني إذا بتستعمل تطبيقات قراءة المستندات أو التحليل الآلي، هالمشكلة ممكن تأثر على دقة النتائج.
visual-document-understanding benchmark long-context VLM synthetic hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

KnowAct-GUIClaw: مساعد شخصي للواجهة الرسومية بذاكرة متطورة

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
الفريق قدم إطار عمل جديد للـ agents اسمه KnowAct-GUIClaw، بيحل مشكلة التفاعل مع الواجهة الرسومية عبر الأنظمة المختلفة وبيضيف آلية لتطور الذات من خلال الذاكرة. الفكرة إنو الخبرة المتراكمة من تفاعلات المستخدم بتساعد الوكيل يفهم المهمة أكتر ويقسمها بدقة، وبعدها الوكيل الفرعي للـ GUI بيستعمل ذاكرة قابلة للربط ومكتبة مهارات بتتطور ذاتيًا. التجارب على Android, iOS, HarmonyOS وWindows ورجعت إنو النموذج حقق أعلى دقة على benchmark MobileWorld، وتفوق على نماذج إغلاقية مثل Seed-2.0-Pro وGPT-5.5.
ليش بتهمّك؟: هالورقة بتعطيك مساعد ذكي يقدر يتعلم من كل نقرة ويشتغل على كل أجهزتك بدون ما تعيد ضبطه كل مرة.
🌱 شو إلك منها؟
تخيل عندك برنامج يشتغل على موبايلك، لابتوبك، وتابلتك، وكل ما تستخدمه يتذكر كيف سويت الأشياء ويصير أسرع. يعني ما رح تحتاج تعيد إعدادات أو تدخل خطوات معقدة كل مرة؛ هو يتعلم من خبرتك ويقلك شغلة جاهزة. هالشي ممكن تشوفه في تطبيقات المساعدة الشخصية أو أدوات الأتمتة اللي تستخدمها يوميًا.
agents GUI cross-platform self-improvement benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

OvisOCR2: نموذج وثائق بقراءة طبيعية

OvisOCR2 Technical Report
الفريق قدم OvisOCR2، نموذج بقرابة 0.8B بيشتغل كـ parser من أول الصورة لحد ما يطلع تمثيل Markdown بترتيب القراءة الطبيعي، يعني بيقرا النصوص، الصيغ، الجداول، وحتى المناطق البصرية. استعملوا محرك بيانات بيدمج تعليقات وثائق حقيقية مع صفحات صناعية من HTML، وعملوا تدريب شامل فيه supervised fine‑tuning، reinforcement learning على فرع 4B، ثم on‑policy distillation وmodel fusion. على OmniDocBench v1.6 وصلوا لأعلى درجة 96.58، وصاروا المتصدرين على leaderboard اللي كان قبل هيك مملوك للطرق المتسلسلة، وكمان تفوقوا على PureDocBench بـ Avg3 = 75.06.
ليش بتهمّك؟: الورقة بتفرجينا إنو النموذج المتكامل End‑to‑End ممكن يطيق مهام استخراج المستندات بدقة أعلى من الأنظمة التقليدية المتقطعة.
🌱 شو إلك منها؟
تخيل إنك مسك ورقة مطبوعة أو صورة لفاتورة، OvisOCR2 بيحولها فوراً لنص منسق تقدر تعدله أو تنقله على الكمبيوتر، متل ما بتكتب ملاحظاتك على ورقة لكن إلكتروني. هالإستفادة بتسهل على الطلاب والموظفين تنظيم ملفاتهم وتوفير وقت كبير. ممكن تشوف هالتقنية ضمن تطبيقات مسح المستندات أو خدمات تحويل الفواتير للملفات الرقمية.
document parsing OCR multimodal benchmark AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

محاكاة تشكيل التحالفات السياسية بـLLM Agents

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents
الفريق (Van Mulders وزملاؤه) قدّموا إطار عمل متعدد الوكلاء بيخلّي كل حزب يشتغل بشخصية حزبية قوية، مع ربط كل وكيل ببيانات المانيفستو الرسمي عبر RAG. بيستعملوا Supervised Fine-Tuning وDirect Preference Optimization ليعطوا الوكلاء سلوك عدواني يتماشى مع أيديولوجية الحزب، وبنفس الوقت بيضمنوا إن الكلام مبني على مصادر موثوقة. جربوا النظام على انتخابات 2019 الفلمنكية وشافوا كيف الناتج بيطلع واضح: بيحدّد أي حزب كان له الأثر الأكبر على الاتفاق النهائي، مع أدوات لتتبع كل بند لمرجع المانيفستو. النتيجة إنو النموذج بيقدر يحاكي مفاوضات حقيقية ويعطي نظرة شفافة على تشكيل التحالفات.
ليش بتهمّك؟: هالورقة بتعطي الباحثين وصناع القرار أداة شفافة لتقييم توافق الأحزاب قبل ما يصير التفاوض الفعلي.
🌱 شو إلك منها؟
تخيل إنو في برنامج يقدر يحكي مع أحزاب سياسية كأنهم أشخاص، ويشوفوا كيف ممكن يتفقوا على حكومة. هالشي بيساعدنا نفهم إذا في فرصة لتشكيل تحالفات أقوى قبل ما يصير التصويت. ممكن تشوفوا هالتقنية بالمستقبل ضمن تطبيقات تحليل الانتخابات أو منصات استشارات حكومية.
LLM multi-agent political simulation coalition formation RAG arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

AgentCompass: بنية تقييم موحدة للوكالات

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
الفريق قدم لنا AgentCompass، بنية مفتوحة المصدر لتقييم الوكلاء المبنيين على LLMs. بتقسم التقييم لثلاث مكوّنات مستقلة: Benchmark، Harness، وEnvironment، يعني بنقدر نغيّر أي جزء من غير ما نعيد كتابة الكود. كمان فيها محرك غير متزامن يتحمل الأخطاء وأدوات تحليل مسار تفصيلية لتكتشف مشاكل دقيقة مثل reward-hacking. هالبنية تدعم أكتر من 20 benchmark بخمس أبعاد قدرة، وبتسهل على الباحثين يكرروا التجارب ويطوّروا الوكلاء بسرعة.
ليش بتهمّك؟: هالورقة بتسهل كتير على الباحثين يقيّموا الوكلاء بطريقة موحدة وقابلة للتكرار، فبنقلل الجهد والهندسة الزايدة.
🌱 شو إلك منها؟
تخيّل إنك بدك تشوف إذا الروبوت أو المساعد الذكي بيشتغل صح، AgentCompass بيعطيك طريقة سهلة لتجربه وتعرف إذا فيه أخطاء خبايا. يعني متل ما بنجرب أكل جديد قبل ما نطبخه للضيوف، هالأداة بتختبر الوكلاء قبل ما يطلعوا للعالم. ممكن تشوف هالتقنية تتطبق بأدوات المساعدة الشخصية أو الألعاب اللي بتعتمد على ذكاء اصطناعي.
agents evaluation LLM benchmark infrastructure hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

توسيع الـ Tokenizer داخل نموذج LLM

In-Place Tokenizer Expansion for Pre-trained LLMs
الفريق قدم طريقة لتوسيع الـ tokenizer لنموذج مدرّب مسبقاً بدون ما نعيد تدريب كل شي من الصفر. بيستمروا بدمج BPE الموجود على مجموعة بيانات متعددة اللغات، فمعظم الرموز القديمة بتظل مثل ما هي، وكل رمز جديد بيتكوّن من رموز مصدرية معروفة. بنسخوا صفوف الـ embedding القديمة ونبني الصفوف الجديدة بمتوسط الـ embeddings للرموز الفرعية، وبعدين يدربوا النموذج بمرحلتين – تدريب الـ embedding بس، وبعدها استكمال التدريب الكامل. التجربة على نموذج Mixture-of-Experts بـ8 مليار بارامتر أظهرت تقليل عدد الرموز للغة الهندية والفيتنامية بحوالي 2.4‑2.6 مرة، مع تسريع كبير في فكّ الشيفرة على الأجهزة الصغيرة.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج الصغيرة تشتغل أسرع وأقل استهلاك للطاقة للغات اللي ما كانت مدعومة أصلاً.
🌱 شو إلك منها؟
تخيّل إنك عم تستعمل تطبيق ترجمة على موبايلك، والبرنامج يقدر يترجم الكلمات الهندية أو الفيتنامية بسرعة أكبر وبطاقة أقل. هالتحسين بيقلل الوقت اللي بتستناه قبل ما يطلع لك النص المترجم، وبيخلي التجربة أريح. ممكن تحسّ بهالسرعة إذا استخدمت تطبيقات ترجمة أو كتابة ذكية على جوالك.
tokenizer LLM multilingual efficiency Mixture-of-Experts arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

WanSong: نموذج انتشار لتوليد أغاني طويلة

WanSong v1.0 Technical Report
فريق Chen وزملاؤه قدموا WanSong، نموذج يعتمد على diffusion لتوليد أغاني تجارية بطول يصل لخمسة دقايق وبجودة عالية. النموذج بيطلع مسارين صوتيين (صوت المغني والموسيقى الخلفية) بجولة وحدة، من غير ما يحتاج لسلسلة مراحل معقدة. كمان بيستفيد من step‑distillation لتقليل زمن التوليد، وبيسهل عملية fine‑tuning لتخصيص الأغاني حسب الطلب.
ليش بتهمّك؟: هالطريقة بتخلينا نولد موسيقى طويلة وعالية الجودة بسرعة أكبر وبدون تعقيد الأنابيب المتعددة.
🌱 شو إلك منها؟
بتقدر تستخدم هالنموذج لتوليد أغاني جاهزة للمنتجات أو الفيديوهات بسرعة، متل ما بنحكي عن برنامج بيصنع لك لحن خلفية للعيد أو للفلوس. الفكرة متل ما تكون عندك آلة موسيقية ذكية بتعطيك اللحن والآلات مع بعض بلمسة زر. ممكن تشوف هالتقنية تنطبق على تطبيقات الموسيقى على الإنترنت أو برامج تحرير الفيديو اللي بتحتاج صوت خلفي مخصص.
audio generation diffusion music AI foundation models hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

VEXMLM: توسيع مفردات XLM‑R للغات الجعزية

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya
الفريق قدم VEXMLM، نسخة موسّعة من XLM‑R مخصّصة للغتين ساميتين إثيوبيتين: الأمهرية والتغرينية. إشتغلوا على توكنايزر SentencePiece خاص بهاللغات، وزادوا المفردات بـ30,000 كلمة فرعية، وابتدوا تمثيلاتها بمتوسط تمثيلات الكلمات القديمة. بعدين درّبوا النموذج على مهمتين: masked language modeling عالبيانات الجديدة، وبعدين fine‑tuning على أسئلة وإجابات، واكتشاف الكيانات، وتحليل المشاعر. النتايج بينت تحسّن واضح بالمقارنة مع XLM‑R وGlot500، خاصةً على قياس الدقة والـ EM.
ليش بتهمّك؟: الورقة بتظهر كيف توسيع المفردات للغات القليلة الموارد بيحسّن أداء النماذج بشكل كبير، وبيفتح باب لتطبيقات أوسع بأفريقيا.
🌱 شو إلك منها؟
بتخيلوا إذا كان تطبيق ترجمة أو مساعد صوتي يقدر يفهم ويجاوب على أسئلتكم بالأمهرية أو التغرينية بدون ما يضلّ يعلق، هالإضافة بتقرب التقنية من ناس كتير ما كان عندهم هالخدمة قبل. يعني بدال ما تضلوا تدوروا على ترجمة يدويًا، ممكن تلاقوا تطبيق يشتغل معكم بطلاقة. هالشي رح يبان قريبًا بخدمات الموبايل أو المواقع اللي بتدعم لغات أفريقيا.
multilingual low-resource language models African languages tokenization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

تقنية On-Policy Delta Distillation لنقل قدرات التفكير للـ LLM

On-Policy Delta Distillation
الفريق قدم طريقة جديدة اسمها delta signal لتدريب نماذج اللغة بعد التدريب. الإشارة دي بتقيس الفرق بين النموذج المعلم ونموذجه الأساسي قبل ما يتضبط على مهام التفكير، فبتمكّن النموذج المتعلم من يلتقط التغييرات اللي صارت بسبب ضبط التفكير مباشرة. التجارب على اختبارات الرياضيات والعلوم والبرمجة وضحت إن الطريقة تتفوّق على أساليب الـ on-policy distillation التقليدية وتخلّي النماذج توصل لأداء قوي بعد فترة تدريب قصيرة. الكود رح يكون متاح على GitHub.
ليش بتهمّك؟: هالطريقة بتسرّع نقل قدرات التفكير للنماذج الكبيرة بدون ما نحتاج تدريب طويل أو مكلف.
🌱 شو إلك منها؟
تخيّل إنك عندك برنامج يقدر يحل مسائل رياضية أو يكتب كود بسرعة، بس بدال ما يتدرب لساعات طويلة، هالطريقة بتعطيه دفعة سريعة لتعلم هالمهارات. يعني ممكن تشوف تحسين واضح بأداء التطبيقات اللي بتستخدم الذكاء الاصطناعي، مثل المساعدين الرقميين أو أدوات التعليم الإلكتروني، من غير ما يضطروا ينتظروا وقت تدريب طويل.
distillation language models reinforcement learning reasoning OPD2 arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

KeyFrame-Compass: معيار شامل لتقييم توليد الفيديو بشرط الإطارات المفتاحية

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
الفريق قدموا أول benchmark اسمه KeyFrame-Compass لتقويم نماذج توليد الفيديو اللي بتشتغل بإطارات مفتاحية. Benchmark فيه 386 عينة من ثلاث مجالات تطبيقية، مع تنوع في بنية الفيديو، دقة الوصف، صيغ التكييف، وكثافة الإطارات المفتاحية. كمان طوّروا إطار تقييم أوتوماتيكي بيقيس تنفيذ الإطارات المفتاحية عبر ست مقاييس (وجود، دقة، ترتيب زمني، موقع، استمرارية، تميّز) وبنفس الوقت بيقيم جودة الفيديو الكلية باستخدام أحكام MLLM مدعومة بنماذج إدراك متخصصة. التجارب على تسع أنظمة توليد فيديو وضحت إنو في تعارض واضح بين تنفيذ الإطارات بدقة وإنتاج فيديو طبيعي، وإنو الأداء بيوصل لتدهور مع زيادة كثافة الإطارات المفتاحية، وكمان معظم النماذج المفتوحة ما بتفهم إدخال storyboard‑grid كمتسلسل زمني للإطارات.
ليش بتهمّك؟: المعيار بيساعد الباحثين والمطوّرين يحددوا بالضبط وين النموذج بيقع ضعيف بين دقة الإطارات وجودة الفيديو، وبيوجه تحسينات أكتر فاعلية.
🌱 شو إلك منها؟
تخيّل إنك بدك تعمل فيديو من مجموعة صور بتحدد كيف تكون المشاهد؛ هالورقة بتقيس إذا البرامج بتلتزم بالصور اللي حطيتهم ولا لا، متل ما بنقيس إذا السائق بيلتزم بإشارات المرور. هالنتيجة بتخلينا نعرف أي برنامج بيطلع فيديوهات أقرب للواقع، فممكن تستفيد منه إذا بتستعمل أدوات توليد فيديو على الإنترنت لتصميم محتوى سريع.
video generation benchmark keyframe evaluation multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

GigaWorld-Policy-0.5: نموذج WAM أسرع وأقوى للروبوتات

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
الفريق قدم نسخة مطوّرة من الـWAM بتصميم بيركّز على الفعل بس، يعني بستخدم الديناميكيات البصرية بس وقت التدريب وبس ما بيحتاج يولّد فيديوهات وقت الاستنتاج. خلال التدريب، بيستعملوا استراتيجية مختلطة بين Action-Conditioned World Modeling وWAM لتقوية ربط الفعل بالمشهد، وبنفس الوقت عمّلو Mixture-of-Transformers لتقسيم مهمة النمذجة البصرية وتوليد الفعل على خبراء متخصصين. هالشي خفّف الحمل الحسابي وقت الاستنتاج، وصاروا يحققوا زمن استنتاج 85 مللي ثانية على RTX 4090. كمان استعملوا خط أنابيب AutoResearch للبحث الآلي عن إعدادات التدريب، فقلّصوا الوقت والجهد اليدوي.
ليش بتهمّك؟: هالتحسين بيسمح للروبوتات تتفاعل بوقت شبه لحظي، فبيصيروا يقدروا يشتغلوا بمهام واقعية أسرع وأدق.
🌱 شو إلك منها؟
تخيّل روبوت بيتك يقدر يلتقط أوامرك ويتصرف بسرعة ما بتتخيلها، متل السائق اللي بيرد على إشارة المرور فورًا. هالتقنية بتخلي الروبوت يتصرف بوقت قصير، يعني ممكن تشوفه يفتح الباب أو يجيب لك شي من المطبخ بلمحة. رح تصادف هالسرعة بالمساعدات الذكية اللي بتشتغل على هاتفك أو في البيت.
robotics policy learning world models efficiency transformers hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

MultiRef-Compass: معيار شامل لتقييم توليد الصوت والفيديو من مراجع متعددة

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
هالورقة بتقدّم MultiRef-Compass، معيار موحد لتقييم توليد محتوى صوت وفيديو بناءً على أكتر من مرجع وتعليمات نصية. جمعوا 350 عينة من سيناريوهات معقدة، مثل حفظ مواضيع من زوايا مختلفة وربط كائنات متعددة مع بعضها. كمان حطوا بروتوكول تقييم بأربع أبعاد و14 مقياس، ودمجوا مقياس آلي مع MLLM-as-a-Judge لإعادة التقييم. التجارب على 8 أنظمة أظهرت إنو لسا في مساحة كبيرة للتحسين.
ليش بتهمّك؟: المعيار بيساعد الباحثين يقيسوا جودة توليد الفيديو والصوت بطريقة شاملة، فبالتالي يسرّع تطوير نماذج أقرب للواقع.
🌱 شو إلك منها؟
تخيل إنو برنامج يقدر يخلق فيديو وصوت من وصفك ويستند على عدة أمثلة، مثل ما بتشوف فيديوهات تعليمية مدمجة من صور متعددة. هالمعيار بيفحص إذا النموذج بيحافظ على كل التفاصيل وبيخلطها بشكل طبيعي، فبالعالم الحقيقي ممكن يطلع تطبيقات مثل إنشاء محتوى إعلاني أو تعليمي أسرع وأسهل. كمان ممكن تشوف تحسينات بأدوات تحرير الفيديو اللي بنستعملها يوميًا.
multimodal benchmark audio-visual evaluation MR2AV hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

Symbal: كشف الأخطاء المتكررة بالشرح التلقائي للصور

Symbal: Detecting Systematic Misalignments in Model-Generated Captions
الفريق قدم طريقة اسمها Symbal بتستعمل نماذج أساسية جاهزة لتكتشف الأخطاء المتكررة اللي بتظهر بالشرح التلقائي للصور، خصوصًا لما يكون الخطأ مرتبط بميزة بصرية معينة بالصورة. كمان عملوا benchmark جديد اسمه SymbalBench فيه 1.7 مليون زوج صورة‑نص من طبيعة طبيعية وطبية لتقييم هالطريقة. على هالمجموعة، Symbal قدر يحدد الأخطاء المتكررة بـ 63.8٪ من الداتا، يعني تقريبًا أربع مرات أحسن من أقرب طريقة.
ليش بتهمّك؟: هالطريقة بتساعد الباحثين والمطورين يكتشفوا الأخطاء المت systematic بالشرح التلقائي قبل ما يوزعوها للناس، فبتحسن جودة التطبيقات اللي بتعتمد على الصور والنصوص.
🌱 شو إلك منها؟
تخيل إنك عم تشوف صور على الإنترنت مع شروحات مكتوبة، وأحيانًا الشرح ما بيوصف الصورة صح بسبب خطأ متكرر. Symbal بيقدر يلاقي هالأخطاء قبل ما توصل للمتسخدم، فبيخلي المعلومات أكتر دقة. ممكن تشوف هالتحسينات بأدوات مثل تطبيقات البحث بالصور أو منصات التعليم اللي بتعتمد على شروحات تلقائية للصور.
multimodal captioning benchmark auditing vision-language arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 8
static analysis
تحليل ثابت هو فحص الكود من غير ما نشغّله، احنا بنستعمله عشان نكتشف الأخطاء قبل ما يشتغل البرنامج.
Behavior-Guided Progressive Disclosure (BGPD)
BGPD يعني نكشف المعلومات للنموذج تدريجيًا حسب سلوكه، مش كلشي مرة وحدة، عشان ما يشتت انتباهه.
text-to-image generation
text-to-image generation هو عملية تحويل نص لوصف إلى صورة، بنستعمله عشان نخلق صور من خيالنا بناءً على كلماتنا
agentic inference-time scaling
agentic inference-time scaling يعني النموذج بيكبر قدرته على الاستدلال وقت التنفيذ حسب الموارد المتاحة، مش ثابت.
FIM
FIM (Fill‑in‑the‑Middle) هو أسلوب بنعطي فيه للنموذج نص ناقص وبينملو الفراغات، بنستعمله لتكملة الجمل.
zero RL
zero RL هو تدريب النموذج بدون ما نستخدم التعزيز التقليدي، بنعتمد على بيانات ثابتة أو محاكاة، عشان نبسط العملية.
chain-of-thought
chain-of-thought يعني بنطلب من الموديل يفكر بصوت عالي ويحكيلنا خطواته قبل ما يعطي الجواب، وهاد إشي بيحسّن دقة الإجابات كتير خصوصاً في المسائل اللي بدها تفكير.
mixed-precision
mixed-precision يعني إنو بنستعمل أرقام بدقة مختلفة داخل نفس الموديل، مثل float16 وfloat32، لتقليل استهلاك الذاكرة وزيادة السرعة، مش بنضحي بالدقة كثير
🤖 موديلز 3
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
Boogu-Image-0.1
Boogu-Image-0.1 نموذج لتوليد الصور من النص، بدنا نستخدمه لإنتاج رسومات بسيطة بسرعة.
Qwen2.5-Coder-Instruct
Qwen2.5-Coder-Instruct نموذج مخصص لكتابة الكود وتعليمات البرمجة، احنا بنستفيد منه عشان يكتب كود نظيف.
📏 مقاييس 1
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
🗂️ بيانات 2
SWE-bench
يعني قياس نموذجاتك على مهام هندسة البرمجيات الحقيقية، وشو قادر يحل من المشاكل البرمجية بشكل صحيح. بنستخدمه عشان نتفرج إذا النموذج فعلاً نافع للمبرمجين.
LiveCodeBench
منصة اختبار حقيقية بتقيّم قدرة نماذج الذكاء الاصطناعي على كتابة كود برمجي فعلي وتحل مشاكل حقيقية. بنركز عليها عشان فيها أسئلة جديدة باستمرار ومش مجرد مذكرة قديمة.
كل المصطلحات ←
العدد السابقشو في AI؟ | 16 يوليو — نماذج أكثر كفاءة وتخصيص
📚 كل الأعداد