📡 أحدث عدد

شو في AI؟ | 24 يونيو — عالم لغوي للوكيل وتعديل بيانات

يومي 📅 2026-06-24
سلام 👋 هلقيت العدد الصادر 2026-06-24، بنقدملكم ملخص مختصر لأهم التطورات بالذكاء الاصطناعي من نماذج الوكلاء للذاكرة المتقدمة وتقييم الفيديو.
#1

نموذج Qwen-AgentWorld: عالم لغوي للوكيل العام

Qwen-AgentWorld: Language World Models for General Agents
الفريق قدم Qwen-AgentWorld، أول نموذج لغوي بيحاكي بيئات الوكلاء عبر 7 مجالات باستخدام reasoning على شكل chain-of-thought. استُخدموا أكثر من 10 مليون مسار تفاعل حقيقي لتدريب النموذج بثلاث مراحل: CPT لتعميم قدرات النمذجة، SFT لتفعيل توقع الحالة الجاية، وRL لتحسين دقة المحاكاة. لتقييم النموذج، بنوا AgentWorldBench اللي بيقارن 5 نماذج متقدمة على 9 benchmarks، ولقوا إن Qwen-AgentWorld بيتفوق على باقي النماذج. كمان بيشتغل كمحاكي بيئات مستقل أو كـ foundation model للوكيل، وبيحسّن أداء الوكلاء على 7 benchmarks.
ليش بتهمّك؟: هالورقة بتظهر كيف ممكن نستخدم نماذج اللغة لتوليد بيئات محاكاة دقيقة، الشي اللي بيسهّل تدريب وكلاء ذكيين بأقل تكلفة وبسرعة أكبر.
🌱 شو إلك منها؟
تخيل إنه عندك لعبة فيديو بتتوقع كل خطوة بتلعبها وتعطيك نتيجة واقعية، هالنموذج بيعمل هيك بس للروبوتات والبرامج. يعني بدال ما نحتاج نجرب كل شي بالحياة الحقيقية، بنقدر نجرّبه على الكمبيوتر ونشوف النتايج. هالطريقة رح تخلّي التطبيقات اليومية مثل المساعدة الذكية أو الروبوتات المنزلية تتطور أسرع وتشتغل بأمان أكتر.
world models agents RL benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

DataClaw0: تعديل بيانات متعددة الوسائط بذكاء الوكلاء

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams
الفريق قدم فكرة جديدة اسمها Agentic Data Tailoring، يعني بدل ما نترك البيانات غير مرتبة، الوكيل يتدخل ويعيد ترتيبها لتناسب نوايا المستخدمين والمهام اللاحقة. صمموا خط أنابيب من مرحلتين يربطوا توليد النصوص الدلالية بقاعدة حقائق ثابتة، وبهالطريقة جمعوا مجموعة ضخمة من البيانات عبر خمس مجالات. بعدين طوّروا نموذج DataClaw_0-9B ودمجوا Supervised Fine-Tuning مع Group Relative Policy Optimization ليصير يقدر ينسق البيانات بدقة. أخيرًا بنوا معيار DataClaw_0-val لتقيس قدرة النموذج على تحسين البيانات، وأثبتوا فعاليته على توليد فيديو، أسئلة-أجوبة بصرية، وتصفح واجهات المستخدم.
ليش بتهمّك؟: هالورقة بتعطي طريقة ذكية لتقليل الفوضى بالمعلومات المتعددة الوسائط، وبتسرّع تدريب نماذج AI على مهام جديدة بكمية بيانات أقل.
🌱 شو إلك منها؟
تخيّل عندك مجموعة صور وفيديوهات غير مرتبة، هالأداة بتشتغل زي صديق بيفرّز كل شي ويخلي المعلومات أكتر فائدة. يعني بدل ما تقعد تدور على ملف معين لساعات، بتلاقيه بضغطة زر. ممكن تشوف هالتقنية في تطبيقات تنظيم الصور أو مساعدات تحرير الفيديو اللي بتقترح لك محتوى جاهز ومُنظّم.
multimodal data refinement agentic benchmark fine-tuning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

خبرة الاستعلام المجمع (GQE) للـSelf‑Attention

Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention
الفريق Tripathi وزملاؤه قدموا طريقة جديدة اسمها Grouped Query Experts (GQE) لتقليل تكلفة الـself‑attention داخل الـTransformer. الفكرة إنه كل مجموعة استعلام (GQA) فيها راوتر يختار k خبراء من رؤوس الاستعلام لكل توكن، بينما رؤوس المفتاح‑القيمة (KV) بتضل كثيفة. بهالطريقة بيقللوا عدد عمليات الاستعلام الفعّالة للنصوص الطويلة من غير ما يضيعوا الفوايد اللي بتعطيها ذاكرة KV. التجربة على 250 مليون باراميتر وبميزانية 30 مليار توكن أظهرت إنه الدقة بتضل ثابتة مع تقليل نص عدد رؤوس الاستعلام النشطة.
ليش بتهمّك؟: بـ30٪ توفير بالحسابات يعني نماذج أسرع وأرخص لتطبيقات النصوص الكبيرة.
🌱 شو إلك منها؟
تخيّل إنك عم تشتغل على مشروع كبير وتقدر توظّف نص عدد العمال وتخلص الشغل بسرعة. هالطريقة بتخلي الذكاء الاصطناعي يشتغل بأقل جهد، فممكن تشوف تطبيقات أسرع مثل المساعدات الصوتية أو الترجمة الفورية. يعني رح تلاقي الخدمات أحيانًا أريح وأرخص.
efficiency attention mixture-of-experts transformers hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

NatureBench: هل الوكلاء البرمجيين يقدروا ينافسوا أحدث النتائج في أوراق Nature؟

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?
الفريق قدم NatureBench، benchmark بيغطي 90 مهمة مستخلصة من أوراق Nature‑family، هدفه يقيّم إذا الوكلاء البرمجيين يقدروا يتخطوا مجرد إعادة إنتاج ويصلوا للاكتشاف الحقيقي. الـ benchmark مبني على NatureGym، بيوفر بيئة حاوية موحدة لكل مهمة وبيحل مشكلة تجزّء البيئات اللي كانت بتقلل مصداقية التقييمات السابقة. جربوا عشر تكوينات من الوكلاء تحت بروتوكول ما فيه بحث ويب، ولاحظوا إن أقوى نموذج فاق الـ SOTA بس بـ 17.8٪ من المهمات وفق معيار g>0.1. التحليل بيبين إن الوكلاء ينجحوا غالبًا عبر تحويل المهمات العلمية لمشكلات تنبؤ مألوفة، مش عبر اختراع علمي حقيقي.
ليش بتهمّك؟: هالنتيجة بتوضح إنّنا لسا بعيد عن إنه الوكلاء يقدروا يبدعوا علميًا بدون توجيه بشري، وبتحدّينا نطوّر طرق تدريب أقوى.
🌱 شو إلك منها؟
تخيل إنه برنامج كمبيوتري يقدر يقرأ ورقة علمية ويعطيك حل جاهز للمشكلة؛ هالورقة بتوريك إنه هالشي لسا مش متوفر بالكامل. الوكلاء اليوم يقدروا يحوّلوا المشاكل لتوقعات بسيطة، بس ما بيخترعوا حلول جديدة. ممكن تشوف هالتطورات بالمستقبل في أدوات البحث العلمي أو المساعدات الذكية اللي بنستعملها على الإنترنت.
benchmark agents coding scientific discovery leaderboard hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

SHERLOC: تشخيص وتحديد الأخطاء للوكيل البرمجي

SHERLOC: Structured Diagnostic Localization for Code Repair Agents
الفريق Tamoyan وزملاؤه قدموا SHERLOC، إطار شغله من غير أي تدريب إضافي، بيربط LLM يقدر يفسّر مع أدوات خفيفة للملفّات. بيقدر يحدد موقع العطل بدقة عالية (84.33% accuracy@1 على SWE‑Bench Lite) وبسرعة، وبيقلل استهلاك الرموز بحوالي ٣٦٪. كمان لما يضيفوا نتائج SHERLOC للوكيل اللي بيصلّح الكود، بيزيد معدل حل المشاكل بنحو ٦ نقاط مئوية ويقلل الوقت الكلي للمعالجة.
ليش بتهمّك؟: لأن SHERLOC بيقلل الوقت والموارد اللي بيحتاجها الوكلاء لتحديد الأخطاء، بيخلي عملية تصحيح الكود أسرع وأكفأ للفرق التقنية.
🌱 شو إلك منها؟
تخيّل إنّو عندك برنامج فيه عطل، وبدل ما تقعد تدقّق كل سطر، هالإطار يلقاه لك فوراً وبطريقة واضحة. هالشي بيساعد المطوّرين يصلّحوا الأخطاء بوقت أقصر، يعني ممكن تشوف التحديثات تنزل أسرع على التطبيقات اللي بتستعملها يومياً. هالتقنية موجودة خلف أدوات تصليح الكود اللي ممكن تلاقوها على منصات مثل GitHub Copilot أو غيرها.
code repair localization LLM agents SWE-Bench arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

هل إحنا جاهزين لنظام ذاكرة Agent‑Native؟

Are We Ready For An Agent-Native Memory System?
الفريق قدم دراسة تجريبية منهجية لنظام ذاكرة الوكلاء من منظور إدارة البيانات. قسموا الذاكرة لأربع وحدات أساسية: تمثيل وتخزين، استخراج، استرجاع وتوجيه، وصيانة، وجربوا 12 نظام ذاكرة مع اثنين من القواعد المرجعية على خمس مجموعات شغل تشمل 11 مجموعة بيانات. النتائج بتبين إنه ما في نظام واحد بيتفوق على الكل، والفعالية بتعتمد على توافق بنية الذاكرة مع نقطة الضعف بالعمل. كمان حددوا تبادل التكلفة مع الأداء، ولقوا إن الصيانة المحلية أكتر كفاءة من إعادة التنظيم الشامل.
ليش بتهمّك؟: الموضوع مهم لأنه بيساعدنا نبني وكلاء ذكاء اصطناعي يقدروا يتذكروا ويحدّثوا معلوماتهم بكفاءة، ما رح يضيعوا وقت ولا موارد.
🌱 شو إلك منها؟
تخيل إنه المساعد الصوتي يقدر يضلّ يذكر طلباتك القديمة ويحدّثها بسهولة، مثل ما بتتذكر قائمة المشتريات وبتضيف عليها كل ما تحتاج. هالشي رح يخلي التطبيقات اليومية أذكى وتستجيب لاحتياجاتك بسرعة أكبر، وبتشوفه بالمساعدات الذكية اللي بتستعملها كل يوم.
agent memory LLM evaluation data management benchmarks arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

هل السعة الكبيرة بتنقذنا من فقدان البلاستيسية في LLMs؟

Can Scale Save Us From Plasticity Loss in Large Language Models?
الفريق اللي بيقودوا هيرنانديز-غارسيا وفريقه درسوا مشكلة فقدان البلاستيسية، يعني صعوبة النموذج يتعلم معلومات جديدة بعد ما يتعلم سابقة، داخل نماذج Transformer الكبيرة. لقوا إنه حتى بالنماذج من 5 مليون لـ 314 مليون باراميتر بيظهر هالإشكال على مهمة فيتنامية بسيطة، وإنه حجم النموذج بيأخر ظهور المشكلة وفق قانون scaling law شبه خطي. كمان اكتشفوا إنه المشكلة بتظهر حتى لو التدريب ثابت ومتعدد اللغات، مش بس بالمواقف اللي بتتغير فجأة. النتيجة إنه زيادة حجم الباراميتر لحالها ما بتكفي لتقضي على فقدان البلاستيسية نهائيًا.
ليش بتهمّك؟: لأنه إذا ما فهمنا كيف النموذج بيصير أقل قدرة على التعلم مع الوقت، ما رح نقدر نطوّر أنظمة ذكية تتعلم باستمرار بدون ما نتعبها.
🌱 شو إلك منها؟
تخيل إنك عم تتعلم شي جديد كل يوم، بس بعد فترة صعب عليك تلتقط معلومات جديدة. هيك بتصير النماذج الكبيرة، وبيصيروا ما يقدروا يضيفوا معلومات جديدة بسهولة. ممكن تلاحظ هالمشكلة لما تستعمل تطبيقات ترجمة أو كتابة نصوص وتلاقيها ما عم تتحسن مع الوقت.
plasticity scaling language models continual learning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

DREAM: تمثيلات استرجاع كثيفة بنهج التنبؤ التلقائي

DREAM: Dense Retrieval Embeddings via Autoregressive Modeling
الفريق Tang وزملاؤه استكشفوا فكرة إنه نماذج اللغة الكبيرة ممكن تعلّم مُستخرج تمثيلات الاسترجاع بطريقة غير تقليدية. حطوا درجات التشابه بين الاستعلام والوثيقة داخل رؤوس الانتباه في LLM ثابت، ولما النموذج يتنبأ بالكلمة الجاية، بيستفيد من هالدرجات لتعديل المُستخرج. الطريقة بتعطي إشارات تدريب مباشرة للمستخرج من خلال آلية الانتباه، وبتظهر أداء أحسن على مجموعات الاختبار BEIR وRTEB عبر نماذج حجمها من 0.5B إلى 3B بارامتر.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب أنظمة الاسترجاع أسهل وأرخص لأنه ما بدنا نجهّز أزواج إيجابية وسلبية يدويًا، وبترفع جودة البحث.
🌱 شو إلك منها؟
تخيل إنه محرك البحث بيتعلم يطابق سؤالك مع المقالات بس من خلال قراءتها، مش من خلال قوائم مُحددة مسبقًا. هالشي بيخلي النتائج أقرب للي بدك إياه، سواءً كنت تدور على مطعم قريب أو معلومة سريعة على هاتفك. يعني رح تلاقي إجابات أدق وأسرع على التطبيقات اليومية.
dense retrieval LLM autoregressive embedding benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

AI‑PAVE‑Br: استخراج قيم خصائص المنتجات بالبرتغالية باستخدام LLMs

AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach
الفريق قدم AI‑PAVE‑Br، نظام مبني على Large Language Models مخصوص لاستخراج خصائص المنتجات من أوصاف المتاجر البرازيلية بالبرتغالية. كمان شاركوا مجموعة Golden Set، مجموعة بيانات يدويًا منقحة فيها الكيانات والفئات والفرعيات لتدريب وتقييم النماذج. التجارب أظهرت إنه باستخدام prompt engineering، AI‑PAVE‑Br بيضلّق على الـ NER التقليدي بدقة أعلى بكتير. هالإضافة بتعطي حل قوي لسوق غير إنجليزي وبتفتح باب للبحوث المستقبلية.
ليش بتهمّك؟: هالطريقة بتخلّي استخراج بيانات المنتجات أسرع وأدق، وبتساعد الشركات البرازيلية تنظم كتالوجاتها بسهولة.
🌱 شو إلك منها؟
تخيل إنك عم تدور على منتجات على موقع تسوق، النظام بيقدر يلقط كل تفاصيل المنتج مثل اللون والمقاس من الوصف ويصنفها تلقائيًا، فبيسهل عليك تلاقي اللي بدك إياه بسرعة. هالشي ممكن ينعكس على تطبيقات التسوق اللي بتستعملها اليوم، لأنه بيخلي القوائم أضبط وأكتر تنظيمًا.
LLM dataset e-commerce Portuguese PAVE arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

UniDrive: إطار موحد للفهم التفسيري للمخاطر بالقيادة الذاتية

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving
الفريق قدم UniDrive، إطار بيوحد بين تحليل الزمن من فيديوهات متعددة ودقة الصورة العالية من الإطار الأخير، وهيك بيقدر يكتب وصف خطر بالإنجليزي ويحدّد موقعه بصندوق حوالينه. بيستخدموا وحدة gated cross-attention لتوحيد المعلومات، وبتظهر النتائج إنه أحسن من الطرق اللي بتشتغل بصورة وحدة أو بدقة منخفضة على benchmark DRAMA-Reasoning. كمان UniDrive بيظهر قدرة أكبر على رصد أشياء صغيرة، وبيقدر يتعمّم على بيانات جديدة مثل NuScenes و BDD100K.
ليش بتهمّك؟: هالورقة بتعطي نظام القيادة الذاتية قدرة أقوى على تفسير المخاطر، يعني بيصير أكثر أمان وثقة للمستخدمين.
🌱 شو إلك منها؟
تخيل إنك راكب سيارة ذاتية القيادة، وبتشوفها تقول لك: "في خطر من سيارة صغيرة جايه من اليمين" وتوريك مكانها على الشاشة. هالشي بيخلي السائق يطمّن أكتر لأن السيارة ما بتخبي الأخطار وبتوضحها بوضوح. هالتقنية ممكن تظهر قريبًا في تطبيقات الملاحة أو أنظمة مساعدة السائق اللي بنستعملها اليوم.
autonomous driving multimodal grounding risk understanding vision-language arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

تجنّب فخ التأكيد الذاتي: إطار Execute‑Distill‑Verify للوكيل

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning
الفريق قدم طريقة جديدة اسمها EDV، بتقسم عملية تعلّم الخبرة للوكيل إلى ثلاث مراحل: Execute، Distill، Verify. بالمراحل الأولى، بيشتغلوا مجموعة من الوكلاء المتنوعين سوا ليولّدوا مسارات مختلفة، وبعدين وكيل ثالث بيقارن بين هالمسارات ويختار التجارب الأنسب، وأخيرًا مجموعة الوكلاء بتأكد على الاختيارات قبل ما تنحط بالذاكرة. هالطريقة بتقلل من الأخطاء اللي بتصير لما الوكيل يثق بتلخيصه الخاص وتأكد من إن التجارب المضافة صحيحة. التجربة اتقست على ثلاث Benchmarks صعبة وطلعت النتائج أحسن من الطرق السابقة.
ليش بتهمّك؟: EDV بيخلّي الوكلاء يتعلموا من تجاربهم بأمان أكتر، ما بيضلوا يكرّروا الأخطاء اللي بنواها على حالهم.
🌱 شو إلك منها؟
تخيّل إنه برنامج ذكي يتعلم من شغله، بس مرات بيظن إنه شغله صح وهو غلط؛ هالطريقة بتخلي البرنامج يتأكد من شغله مع غيره قبل ما يتذكره. يعني إذا استعملتها، ممكن تشوف تطبيقات ذكية بتتعلم من أخطائها وتتحسن بسرعة، زي المساعدات الصوتية أو الروبوتات المنزلية.
agents self-improvement experience learning benchmarks LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

قوانين التوسّع لتقطيع LLM لمهام محددة

Scaling Laws for Task-Specific LLM Distillation
الفريق Ghita وزملاؤها بيطلعوا قوانين توسّع تجريبية لتقطيع LLM لمهام معينة. بيقيسوا كيف الأداء داخل المجال ومعرفة عامة بيتغيّر حسب حجم الداتا، نسبة الضغط، صيغة الإشراف، وجدولة القطع المتكررة. باستخدام بيانات مالية، قارنوا بين تقطيع يعتمد على اللوجيت وتقنية LoRA تحت قطع هيكلي متكرر، وقدموا خسارة إشرافية مختلطة على طريقة chain-of-thought لتثبيت KL-divergence خلال تتبع التفكير. النتايج بتبين إن جودة المهمة داخل المجال بتنخفض بشكل متوقع مع الضغط، بينما معايير المعرفة العامة بتنهار أسرع، وصيغة الإشراف هي المفتاح لتوازن هالشي.
ليش بتهمّك؟: هالورقة بتعطي نصايح عملية لتقليل حجم LLMات بدون ما نخسر كتير من الدقة، وهاد مهم لتطبيقات بوقت استجابة وتكلفة منخفضة.
🌱 شو إلك منها؟
بتخيلوا إنه عندنا برنامج ذكي بيجاوب على أسئلة مالية، بس هو كبير ومكلف. هالدراسة بتعلمنا كيف نقدر نضغط البرنامج ليصير أصغر وأرخص، زي ما بنقّص الفروع من شجرة ونخلي الفاكهة تبقى. يعني ممكن تشوفوا تطبيقات مالية على موبايلكم تصير أسرع وأرخص.
LLM distillation scaling laws finance compression arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

CineCap: شروحات سينمائية للفيديوهات

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning
الفريق قدم إطار CineCap اللي بيجمع بين reasoning منظم مع spatio-temporal anchors وتدريب reinforcement learning بمكافآت للشمولة والدقة. الطريقة بتربط أوصاف السينمائية الاحترافية بأدلة بصرية واضحة وبتنظمها كأجزاء صغيرة لتدريب supervised fine‑tuning، وبعدين بتستخدم RL لتوازن بين التفصيل والصدق. كمان بنوا CineCap Bench، مجموعة فيها 472 فيديو مع شروحات يدوية لتقييم النموذج. التجارب أظهرت إن CineCap يتفوق على النماذج القوية المتاحة، وبيسجل حالة جديدة في مجال الشرح السينمائي للفيديو.
ليش بتهمّك؟: هالورقة بتخلّي الموديلات تفهم وتوصف تفاصيل التصوير الفيلمي بدقة، الشي اللي بيفتح باب لتوليد فيديوهات بجودة فيلمية وتطبيقات تحليلية أعمق.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يشرح لك كيف تم تصوير مشهد فيلم، من حركة الكاميرا لزاوية اللقطة، كأنو دليل تصوير شخصي. هالشي بيساعد صناع المحتوى أو حتى المشاهدين يفهموا أسرار الإخراج بسهولة. ممكن تشوف هالتقنية بالمستقبل ضمن أدوات تعديل الفيديو أو تطبيقات تعليمية بتشرح الأفلام خطوة بخطوة.
video captioning cinematography multimodal benchmark reinforcement learning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

IV-CoT: توليد صور من نص مع فهم هيكلي مخفي

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
الفريق اللي بيقود Zixuan Li وزملاؤه قدموا طريقة جديدة لتوليد الصور من النص، اسمها IV-CoT. الفكرة إنه بيقسموا استفسارات الصورة لسلسلة تخطيط هيكلي أولاً وبعدين بيمرّوا للجزء اللي بيحدد الشكل والمظهر، وكل هالشي بيصير بتمرير واحد بس. استخدموا إشراف رسومات (sketch) بس وقت التدريب لتعلم التخطيط بدون ما يحتاجوا يرسموا أو يطلعوا نتائج وسطية وقت الاستنتاج. النتيجة إنه النموذج بيحافظ على عدد الأشياء، علاقاتهم المكانية، والخصائص بشكل أحسن من الطرق القديمة على Benchmarks مثل GenEval وT2I-CompBench.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج توليد الصور تلتزم بتفاصيل النص الهيكلية، يعني الصور بتطلع أقرب للخيال اللي بتحكيه.
🌱 شو إلك منها؟
تخيل إنك بدك تولد صورة لتصميم بيت، وتكتب "بيت فيه ثلاث غرف على اليمين ومطبخ كبير قدام". مع IV-CoT الصورة رح تطلع فيها عدد الغرف والمسافات بيناتهم تماماً مثل ما طلبت، مش بس شكل عام. هالشي بيفيدك إذا بتستعمل أدوات توليد الصور لتصميم ديكور أو محتوى إعلاني على الإنترنت.
text-to-image structural reasoning multimodal generation IV-CoT arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

ScaleToT: تعميم التفكير المنظم للـLLM على المستخدمين القليلين النشاط

ScaleToT: Generalizing Structured LLM Reasoning for Billion-Scale Low-Activity User Modeling
الفريق قدم ScaleToT، طريقة بتعلم التفكير المنظم من مجموعة صغيرة من المستخدمين اللي عالجتهم LLM، وبعدين بتعمّمه على مليارات المستخدمين القليلين النشاط. الطريقة بتبني سلاسل حالات المستخدم بنوعيات معينة وبتنقّحها بإجراء Tree-of-Thought الموجه بالانتروبيا. بعدين بتستعمل هالسلاسل لتدريب نموذج طالب على البروفايلات الساكنة عبر supervised fine-tuning وOSIPO، وبنقل تمثيلات التفكير لهEncoder خفيف. التجربة على توقع قيمة العمر (LTV) بالإعلانات أظهرت زيادة 6.738% بـ LT30 مع تقليل تكلفة الحوسبة.
ليش بتهمّك؟: هالطريقة بتخلّي الشركات تتوقع قيمة المستخدمين القليلين النشاط بدقة وبأقل تكلفة، فهالشي بيفتح فرص إعلانية أكبر.
🌱 شو إلك منها؟
تخيل إنه الإعلانات اللي بتشوفها على موبايلك صارت أذكى، لأنها بتعرف قيمتك حتى لو ما كنت كثير تستخدمها. هالشي يعني إعلانات أكتر ملائمة وتكلفة أقل على الشركات. ممكن تلاقي هالتحسينات بالمواقع اللي بتعرض إعلانات مخصصة لك.
LLM user modeling Tree-of-Thought SFT advertising arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

عمق الطبقة مو دايمًا أحسن: تقليل تكلفة التوافق بـ Confident Decoding

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding
الفريق كشف إنه الطبقات المتأخرة من LLMs ممكن تخلّي التوقعات تميل للردود العامة أو اللي بتتماشى مع سياسات التوافق، بينما الطبقات الأولية بتعطي تخمينات أولية والوسطى بتصقل الفهم. قدموا طريقة اسمها Confident Decoding، بتختار طبقة قريبة من الأخيرة لكن مش الأخيرة، عبر بحث عكسي موجه بالـ entropy، وبدون أي تدريب إضافي. النظرية بتوضح إنه هالاختيار هو حل لمشكلة الإيقاف الأمثل، وبيقلل التشويش اللي بيصير بالطبقة الأخيرة مع الحفاظ على جودة التوقع. التجارب على LLMs كثيفة وMixture‑of‑Experts أظهرت تحسين ملحوظ على اختبارات التفكير الصعب مع زيادة زمن بسيطة أقل من 2% وبدون استهلاك ذاكرة إضافي.
ليش بتهمّك؟: لأنّه بنقدر نستخرج قدرات التفكير الأقوى من النماذج المتوافقة بدون ما نضيع وقت أو موارد على الطبقة الأخيرة اللي ممكن تضعف النتائج.
🌱 شو إلك منها؟
تخيل إنه برنامج الدردشة يجاوب أسئلة معقّدة أسرع وأدق، لأنّه بيستخدم الطبقة اللي بتعطيه أحسن تخمين قبل ما يضيف له "تعديلات" غير لازمة. يعني إذا طلبت حل مسألة رياضية صعبة، رح يطلع لك الجواب الصح بلا تأخير كبير. هالتحسين ممكن تشوفه بأدوات الدردشة أو المساعدين الذكيين اللي بتستعملها يوميًا.
LLM decoding alignment reasoning efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

Vera: نموذج طبقي لتعديل الفيديو مع الحفاظ على المحتوى

Vera: A Layered Diffusion Model for Content-Preserving Video Editing
الفريق قدم طريقة جديدة لتعديل الفيديو بدون ما يغيّر الأشياء الأساسية، مثل الشخصيات أو الخلفية. Vera يخلق طبقة تعديل مع قناع شفاف (alpha matte) يخلّينا نركّب الطبقة الجديدة على الفيديو الأصلي. النموذج يعتمد على DiT موسّع بـ Mixture‑of‑Transformers لتنسيق الطبقات مع بعض. التدريب صار على مجموعة بيانات طبقية فيها قناعات دقيقة ومشاهد متنوعة، ونتائج التقييم بتبين إن Vera يحافظ على المحتوى أحسن من باقي النماذج المفتوحة المصدر.
ليش بتهمّك؟: هالطريقة بتخلّي تعديل الفيديو أكثر دقة وبيحافظ على العناصر المهمة، فبصير في تطبيقات إبداعية وإعلانية أضبط.
🌱 شو إلك منها؟
تخيّل إنك بدك تغير لون شعرك بالفيديو بس ما تبي تغير الخلفية، هالنظام بيعمل هالشي بسهولة. كأنه بيلصق طبقة جديدة فوق الفيديو الأصلي بدون ما يخلّط كل شي. ممكن تشوف هالتقنية بالمواقع اللي بتسمح لك تعدل فيديوهاتك قبل النشر على السوشال ميديا.
video-editing diffusion content-preservation layered-model hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

EG-VQA: معيار جديد لتقييم إجابات الفيديو مع دليل زمني موثوق

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence
هالورقة بتقدّم EG-VQA، مجموعة اختبار جديدة لتقييم إجابات أسئلة الفيديو بطريقة بتطلب دليل زمني واضح. كل سؤال بيكون مرفق بقطعة فيديو معينة بتثبت الجواب، وبيتم قياس الدقة باستخدام مقياس EG-F1 اللي بدمج التوافق الزمني والملاءمة الدلالية. التجارب بتظهر إن حتى أقوى النماذج التجارية ما بتقدر تثبت دليل موثوق، فهنا قدموا نموذج EG-Reasoner اللي بيتعلم من إشراف واضح وبيحقق أحسن النتائج بين النماذج المفتوحة.
ليش بتهمّك؟: الموضوع مهم لأنه بيكشف الفجوة بين الإجابة الصح وإثباتها بالفيديو، وبيساعدنا نبني أنظمة أكثر موثوقية وتفسيرية.
🌱 شو إلك منها؟
تخيّل إنك تسأل فيديو عن شي معين، والنظام يجاوبك ويوريك الجزء المناسب من الفيديو اللي يثبت الجواب. هالطريقة بتخليّك تثق أكتر بالنتيجة وتفهم شو الصاير بالفيديو. ممكن تشوف هالتحسينات بأدوات مشاهدة الفيديو الذكية أو المساعدات الرقمية اللي بتستعمل هالتقنية.
videoqa grounding benchmark evidence multimodal arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

LaGO: توجيه الفعل الكامن لتقوية التعلم المعزز الأونلاين

LaGO: Latent Action Guidance for Online Reinforcement Learning
الفريق Liu وزملاؤه اقترحوا إطار LaGO اللي بيستغل LLM مدرب مسبقًا كـlatent action prior لتوجيه تحسين السياسة الأونلاين، بدل ما يستخدموه كمتخّط مباشر. التجارب على benchmarkين، CLEVR‑Robot وMeta‑World، أظهرت إن LaGO يرفع المكافأة ومعدل النجاح مقارنةً بـVanilla PPO. بالذات ارتفع معدل النجاح من 15.1% لـ27.2% على CLEVR‑Robot، ومن 2.7% لـ15.2% على Meta‑World. التحليل بيأكد إن LLM أقوى يعطي إرشاد أقوى، يعني معرفة اللغة ممكن تحسّن التخطيط والقرارات الأونلاين.
ليش بتهمّك؟: هالطريقة بتخلّي الأنظمة التعلمية تستفيد من معرفة LLM لتقليل الأخطاء وتحسين الأداء بسرعة أكبر.
🌱 شو إلك منها؟
تخيّل إن الروبوتات بتستفيد من خبرة اللغة الكبيرة لتعرف شو الخطوة الصح بالوقت الصح، زي ما بنستفيد من دليل الطبخ. هالشي بيخلي الروبوت ينجح بالمهمات أكتر، مثلاً يلتقط الغرض الصح أو يفتح الباب بسهولة. ممكن تشوف هالتطورات قريبًا بخدمات الروبوتات المنزلية أو التطبيقات الذكية اللي بتساعدنا بالمهام اليومية.
reinforcement learning LLM planning online learning robotics arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

SAFARI: تشخيص أخطاء الوكلاء على مدار طويل

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation
الفريق قدم طريقة جديدة اسمها SAFARI لتشخيص أخطاء الوكلاء اللي بيشتغلوا على مهمات طويلة ومعقّدة. بدلاً ما نحمل كل مسار التنفيذ داخل نافذة الذاكرة للـLLM، SAFARI بتستعمل صندوق أدوات خاص وذاكرة قصيرة المدى لتقرأ وتبحث عن أجزاء المسار خطوة بخطوة. هالطريقة بتخلي الدقة ما تتأثر بحدود حجم الذاكرة، وبتظهر تحسين واضح على مجموعات البيانات Who&When وTRAIL GAIA. كمان بتضل دقيقة حتى لما يكون الخطأ بعيد عن نافذة الذاكرة بخمس أضعاف.
ليش بتهمّك؟: هالطريقة بتخلّي تشخيص أخطاء الوكلاء أسرع وأدق، خصوصاً بالمشاريع الكبيرة اللي فيها خطوات كتيرة.
🌱 شو إلك منها؟
تخيل إنك عم تستعمل برنامج ذكي بيساعدك بحل مشاكلك اليومية، بس أحياناً بيغلط وما بتعرف شو السبب. مع التقنية الجديدة، هالبرنامج رح يقدر يكتشف الخطأ بسرعة حتى لو كان بعيد عن ذاكرته. يعني رح تستفيد من أدوات ذكية أكثر موثوقية في تطبيقاتك اليومية مثل المساعدات الصوتية أو الروبوتات المنزلية.
agents fault attribution LLM diagnostic long-context arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 10
chain-of-thought
chain-of-thought يعني بنطلب من الموديل يفكر بصوت عالي ويحكيلنا خطواته قبل ما يعطي الجواب، وهاد إشي بيحسّن دقة الإجابات كتير خصوصاً في المسائل اللي بدها تفكير.
RL
RL يعني Reinforcement Learning، وهو مفهوم بنعلم فيه الموديل يتعلم من خلال التجربة والعقاب عشان يحقق هدف معين، بنسمع عنه لأنه أساس لتدريب الروبوتات والأنظمة الذكية.
AgentWorldBench
AgentWorldBench هو إطار لتقييم وكلاء الذكاء الاصطناعي في بيئات معقدة، بنشوف كيف بتصرف الوكيل مع مهام متعددة.
Agentic Data Tailoring
هيدا أسلوب بنخلي النموذج يختار البيانات اللي بتناسب المهمة بحكم نفسه، يعني احنا بنعطيه القدرة يخصص البيانات لحاله عشان يطلع نتائج أدق.
Supervised Fine-Tuning
تدريب إضافي للنموذج على بيانات مُعلّمة لتخصيصه لمهمة معينة، بنسمع عنها لأنها بتحسن الدقة بعد التدريب الأساسي.
Group Relative Policy Optimization
هالمفهوم يعني طريقة لتدريب السياسات بالمجموعات بحيث كل مجموعة بتحسّن نسبياً عن غيرها، احنا بنستعمله عشان نسرّع التعلم بالـRL ونقلل الفروقات بين الـagents.
self-attention
آلية بتخليّ النموذج يركّز على أجزاء معينة من البيانات اللي إدّاها وينسى الأجزاء الثانية، مثل لما تقرا جملة وتركّز على الكلمات المهمة، بدنا إياها عشان بتحسّن فهم النموذج للعلاقات بين الأشياء.
grouped-query attention
آلية تركيز انتباه بتجمع الاستعلامات المتشابهة مع بعض، عشان نقلل الحسابات ونسرّع النموذج.
NatureBench
NatureBench مفهوم بيحكي عن تقييم النماذج باستخدام بيانات طبيعية أو واقعية، يعني بنقارن الأداء على إشي قريب من الحياة اليومية.
NatureGym
NatureGym هو منصة بتخلينا نجرّب وتدرب نماذج الذكاء الاصطناعي على بيئات طبيعية، بنحاكي الطبيعة لتقييم قدرات النموذج.
🤖 موديلز 4
world model
موديل العالم هو تمثيل داخل الذكاء الاصطناعي للواقع، بيساعد الموديل يتوقع شنو ممكن يصير عشان نخطط أحسن
DataClaw_0-9B
نموذج لغة حجمه 0.9 B بارامتر، صُنع لتوليد نصوص وإكمال مهام، بنسمعه لأنه مفتوح المصدر وبيسهل التجارب
mixture-of-experts
نموذج بيقسم الشغل بين مجموعة خبراء صغار، كل خبير بيشتغل على إشي معين عشان يسرّع الأداء ويعطي نتائج أدق.
coding agents
برامج ذكاء اصطناعي قادرة تكتب وتصحّح الأكواد بحالها من غير ما تحتاج مبرمج بيوجّهها طول الوقت. بنسمع عنها عشان بتحسّن من إنتاجية المبرمجين وبتسرّع عملية التطوير.
كل المصطلحات ←
العدد السابقشو في AI؟ | 23 يونيو — فهم بصري متعدد وتخطيط بعيد
📚 كل الأعداد