📡 أحدث عدد

شو في AI؟ | 22 يوليو — وكيل AI يتعلم من التجربة

يومي 📅 2026-07-22
سلام 👋 بهالعدد بنستعرض أحدث التطورات بالذكاء الاصطناعي، خصوصاً الوكلاء اللي بتعلموا من تجاربهم وتطبيقات الفيديو التوليدي. بدنا نوضح إشي مهم عن تقييم LLMs وتوازن التكلفة بالجودة.
#1

DeepSearch-World: وكيل بحث عميق يتعلم من تجاربه

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
الفريق قدم إطار عمل اسمه DeepSearch-Evolve لتدريب وكلاء ويب يقدروا يتعلموا من خبراتهم بدون ما يحتاجوا معلمين ثابتين. البيئة اللي استعملوها، DeepSearch-World، deterministic وبتسمح بالتحقق من التقدم، والتفكير المرتكز على الواقع، واسترجاع الأخطاء، وتحتوي على 420 ألف سؤال متعدد الخطوات. العملية بتشتغل على توليد مسارات، تصفيتها، خلط البيانات، وتدريب النموذج بشكل متكرر، وبدون ما يستندوا لنماذج أقوى من قبل. النتيجة إن النموذج 9B وصل نسب 31.2% على BrowseComp، 61.5% على GAIA، و93.4% على HotpotQA، وبيظهر إن البيئة القابلة للتحقق بتساعد الوكلاء يتطوروا ذاتيًا على مهام البحث الطويلة.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يتعلموا ويتقوّى من تجاربهم، فبصيروا أقدر على حل أسئلة ويب معقّدة بدون ما نحتاج نجهّز لهم بيانات ضخمة مسبقة.
🌱 شو إلك منها؟
تخيل إنو برنامج على الإنترنت بيقدر يتعلم من أخطاؤه ويصير أحسن كل ما يستخدمه أحد، مثل ما بنتعلم من أخطائنا بالطبخ. هالشي يعني إنو محركات البحث أو المساعدين الرقميين رح يصيروا أذكى ويعطوا إجابات أدق، وبتشوف هالتحسين وانت تستخدم تطبيقات البحث أو الأسئلة على الإنترنت.
agents self-distillation web-search benchmark reinforcement-learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

Mage-Flow: نموذج توليد صور عالي الدقة وكفء

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
فريق الباحثين قدموا Mage-Flow، نموذج توليدي بحجم 4 B بارامتر بيشتغل بكفاءة لتوليد الصور من النص وتعديلها بناءً على تعليمات. النموذج مبني على مكوّنين صمّموهم سوا: Mage-VAE، وهو tokenizer خفيف بيحافظ على جودة الصورة وبسرعة أعلى بكتير، وNative-Resolution Multimodal Diffusion Transformer المدرب بطريقة rectified flow matching. بفضل packing بدقة أصلية ودمج نوى CUDA، التدريب بيصير أسرع بحوالي 2.5 مرة، والنسخة Turbo بتولد صورة بدقة 1024×1024 بأقل من ثانية على بطاقة A100 وحدة. النتايج بتظهر إنو حتى مع حجم صغير، Mage-Flow بيقدر ينافس النماذج الكبيرة على معايير التوليد والتعديل.
ليش بتهمّك؟: الموديل بيوفر قدرة توليد وتعديل صور عالية الدقة بوقت وتكلفة أقل، يعني ممكن نستخدمه بتطبيقات تفاعلية على أجهزة أقل.
🌱 شو إلك منها؟
تخيل إنك تقدر تطلق صورة من وصف بسيط أو تعدل صورة موجودة بخطوات قليلة، وكل هالشي بصير خلال ثانية وحدة على كمبيوتر عادي. يعني ممكن تستعمله لتصميم بوستات على السوشيال ميديا أو تعديل صور عائلية بسرعة، بدون ما تحتاج تنتظر ساعات أو تستأجر خوادم غالية.
image generation diffusion efficient models high-resolution AI editing hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

قوالب النصوص كمسجلات معنوية ضمن Diffusion Transformers

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
الفريق حطّ إطار تفسير سببي للـ DiTs الكبيرة، بيخلط تفكيك الـ attention مع تدخلات موجهة على مجموعات التوكنات، الرؤوس، والطبقات. لقوا إنّو توكنات القالب البنيوية ما فيها معلومات مباشرة من النص، بس بتصير أهمّ نقاط جذب للـ image‑to‑text attention وبتحافظ على هوية الأجسام داخل النموذج، يعني بتشتغل كمسجلات معنوية ضمنية. بناءً على هالنتيجة صمموا قاعدة تقليم بدون تدريب، بتشيل الرؤوس اللي بتركّز على توكنات النص وتقلل 20٪ من FLOPs مع انخفاض بسيط بالـ GenEval. كمان بيّنوا كيف إنّو الحسابات التوليدية بتنظم بين الرؤوس والعمق، من تشكيل الهوية للانتشار والتحسين.
ليش بتهمّك؟: هالنتائج بتخلينا نفهم كيف النموذج بيحافظ على المعنى وبتساعدنا نسرّع توليد الصور بدون ما نخسّر جودة ملحوظة.
🌱 شو إلك منها؟
تخيّل إنّو النموذج عنده دفتر ملاحظات خفي بيسجّل تفاصيل الأشياء اللي بدنا نشوفها بالصورة، وبيستعمله طول ما بيولّد الصورة. إذا حذفنا بعض الصفحات اللي ما بتأثر كثير، بنقصر وقت الانتظار لتظهر الصورة. يعني ممكن تلاحظ تطبيقات توليد الصور تصير أسرع وتستهلك أقل طاقة على موبايلك أو حاسوبك.
diffusion transformer interpretability pruning generative hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

DataFlow-Harness: منصة وكيل كود لتصميم خطوط بيانات قابلة للتعديل

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
المقال بيحكي عن فجوة بين كتابة الكود باللغات الطبيعية (NL2Pipeline) وإنشاء خطوط بيانات ثابتة وقابلة للتعديل. الفريق قدم DataFlow-Harness، منصة بتوجه وكيل لغة كبير يبني DAGs (رسومات بيانية موجهة) عبر تغييرات مكتوبة ومحددة بدل ما يكتب سكريبتات حرّة. المنصة بتجمع بين DataFlow-Skills، طبقة Model Context Protocol اللي بتظهر سجل المشغّلات وحالة الخط، وDataFlow-WebUI اللي بيوحد الحوار النصّي مع محرّر رسومي. على مجموعة اختبار فيها 12 مهمة هندسة بيانات، وصلت نسبة النجاح ل93.3%، وخفضت التكلفة 72.5% والوقت 49.9% مقارنةً بـ Vanilla Claude Code.
ليش بتهمّك؟: هالمنصة بتقّص الوقت والمصاري وبتخلّي الشغل على بياناتنا ثابت وقابل للتعديل بسهولة.
🌱 شو إلك منها؟
تخيّل إنك بدك ترتّب ملفاتك وتحوّلها بطريقة معينة، وهالبرنامج بيساعدك تبني الخطوات كأنك عم تركّب قطع ليغو، وبعدين فيك ترجع وتعدّل أي خطوة إذا احتجت. هالشي بيظهر لك بأدوات مثل خدمات تنظيف البيانات أو إعداد التقارير اللي بتستعملها يوميًا.
LLM data pipelines agents DAG efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

AlayaWorld: نموذج عالم فيديو تفاعلي طويل الأمد

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
الفريق قدم AlayaWorld، نموذج فيديو عالمي تفاعلي يقدر يولّد فيديو بدقة 540p و720p بسرعة 24 إطار بالثانية. النموذج مبني على 15B video diffusion transformer وبيولد أجزاء قصيرة من الفيديو بطريقة autoregressive حسب مسار الكاميرا وتغيّر النص. استخدموا طريقة جديدة لتقليل الانجراف على المدى الطويل وتدريبهم على تاريخ متلفّ، وكمان طوّروا تقنية distillation لتقليل خطوات العينة من 30 لأربعة لكل جزء. على iWorld-Bench، AlayaWorld جاب أحسن نتيجة لتوليد طويل الأمد.
ليش بتهمّك؟: هالورقة بتفتح باب لتصميم عوالم افتراضية تفاعلية بسرعة، يعني ممكن نخلق ألعاب أو محاكاة من نص أو صورة بلا شغل يدوي كتير.
🌱 شو إلك منها؟
تخيل إنك تكتب وصف بسيط وتطلع لك لعبة أو فيديو يتغيّر حسب ما بدك، متل ما بتلعب مع صديق وتتحكم بالمشهد. هالتقنية ممكن تنستعمل لتصميم محتوى تعليمي أو ترفيهي بسرعة، وتظهر بأدوات مثل تطبيقات الواقع المعزز على موبايلك.
video generation diffusion interactive long-horizon world modeling hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

قلّل النسخ، زوّد التثبيت: كيف GEAR يوقف النسخ المتكرّر في التفكير الطويل

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
فريق Fang وزملاؤه اكتشفوا إنو نماذج اللغة الكبيرة بتنسخ نص كتير من المدخل بدل ما تحلّ المشكلة، خصوصًا لما يكون السياق طويل. هالنسخ المتكرّر بيصير أسوأ كل ما طول السياق وزاد الضوضاء اللي ما إلها علاقة بالمهمة. لإصلاح هالمشكلة، قدموا طريقة اسمها GEAR، بتضيف مكافأة على التثبيت بالدلائل المهمة وبتعاقب النسخ من المعلومات غير المفيدة. التجارب على كذا حجم نموذج وbenchmark رجعت تحسين متوسط الأداء بحوالي 4.6 نقطة، وكمان خفّفت من طول التفكير والنسخ الزايد.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج تعطي إجابات أدق وأقصر حتى بأطول النصوص.
🌱 شو إلك منها؟
تخيّل إنك عم تقرأ مقال طويل وتطلب من برنامج يجاوب سؤال، بدل ما يطلعلك جمل مكررة من النص، البرنامج رح يركّز على الفكرة الأساسية ويعطيك جواب واضح. هالشي بيساعدك توفّر وقت وتفهم المعلومات أسرع، وممكن تلاقيه فعّال بأدوات البحث أو المساعدين الذكيين اللي بتستعملها يوميًا.
reinforcement learning grounding long-context LLM reasoning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

FlowMimic: تحرير وتوليد الفيديو بدون أقنعة

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
الفريق Zhang وزملاؤه قدموا طريقة جديدة لتوليد بيانات تعديل الفيديو مباشرةً من عينات تعديل الصور باستخدام حقل تدفق زمني مُحَوَّل للبيكسل‑باري. الطريقة بتعتمد على خسارة تقليد النمط (modality mimic generation loss) وخسارة تقليد تعديل النمط لتقريب سلوك الفيديو والصورة عبر محاكاة متبادلة. كمان ضيفوا مهام حسّية مثل تقسيم التعبير الإشاري مع خسارة على مستوى الإشارة (latent‑level loss) وخسارة على مستوى الانتباه (attention‑level loss) لتخلي النموذج يتعلم تعديل المناطق المطلوبة بدون ما يحتاج أقنعة خارجية. التجربة أظهرت إن النموذج يقدر يتعلم تحرير الفيديو من بيانات بسيطة ومحدودة بس بفعالية.
ليش بتهمّك؟: هالطريقة بتقليل الجهد والوقت لجمع بيانات تعديل الفيديو، وبتفتح باب لتطبيقات تحرير فيديو أوسع وأسرع.
🌱 شو إلك منها؟
تخيّل إنك تقدر تعدّل فيديو مثل ما بتعدل صورة، مثلاً تشيل أو تضيف عنصر من غير ما تحتاج ترسم أقنعة يدوية. النموذج بيشتغل بسرعة وبيصير يقدر يضيف أو يغيّر أشياء بالفيديو مباشرةً من أوامر نصية. هالشي ممكن يطلع بأدوات تعديل الفيديو على الموبايل أو المواقع اللي بنستعملها يومياً.
video editing generative models multimodal flow vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

ConsiSpace: ليش الاتساق الهندسي مهم للفهم المكاني بالفيديو

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
الفريق اقترح ConsiSpace، إطار بيهتم بالاتساق الهندسي لتقوية الفهم المكاني بالفيديو. بنوا ذاكرة geometry-consistent memory فيها توكنات دليل ضمنية وإشارات هندسية واضحة، وبينظّموا الأدلة لتقليل الضياع. بعد التدريب المراقب، استعملوا UC-SSRL لتقوية الاستقرار بين المشاهد المختلفة باستخدام مكافآت للاتساق بالجواب والقياس والطوبولوجيا. التجارب على ثلاث Benchmarks (VSI‑Bench, OSI‑Bench, MMSI‑Video‑Bench) أظهرت تحسين متوسط 12.6 نقطة على أقوى النماذج السابقة.
ليش بتهمّك؟: هالطريقة بتخلي نماذج الفيديو تفهم العلاقات المكانية بدقة أكبر، وبتقوي استقرارها عبر مشاهد متعددة.
🌱 شو إلك منها؟
تخيل إنو برنامج يقدر يقرأ فيديوهات الشوارع ويعرف وين الأشياء متعلقة ببعضها، متل ما بنشوف على خريطة. هالشي بيساعد تطبيقات الملاحة أو الروبوتات لتتحرك بأمان. ممكن تشوف هالتقنية بدعم خدمات التوصيل أو التطبيقات الذكية اللي تفهم المشهد حولك.
video spatial reasoning geometry multimodal reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

Open-AoE: مجموعة بيانات إيغو‑سنتريك للمنوال وتوليتشين لتعلم الروبوتات

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
فريق الباحثين قدموا Open‑AoE، إشي مجموعة بيانات إيغو‑سنتريك للمنوال فيها تقريباً 2000 ساعة فيديو من بيئات طبيعية، جمعوها أكتر من 500 مساهم باستخدام أكتر من 400 موبايل. البيانات فيها توضيحات نصية، أوضاع إيدين مبنية على MANO، مسارات الكاميرا، وإجراءات ذرية محددة زمنياً. كمان ضموا توليتشين بيحوّل التسجيلات الخام لعينات منظمة عبر تقطيع الإجراءات، توضيح دلالي، وإعادة بناء إيدين وكاميرا. وبالإضافة لهالشي، وفّروا أدوات لتصوّر، نقل للروبوتات، وتحويل للبيانات لتدريب سياسات VLA، WAMs، وعوالم نماذج (World Models).
ليش بتهمّك؟: Open‑AoE بِصير جسر سريع بين الفيديوهات اليومية للإنسان وتدريب روبوتات قادرة على تنفيذ مهام من الحياة الواقعية.
🌱 شو إلك منها؟
تخيل إنو الروبوتات بتتعلم من فيديوهات موبايلك اليومية، مش من مختبرات معقّدة. هالمجموعة بتخلّي الروبوتات تفهم إيديك وإيش عم تعمل، فبتصير أقدر تساعدك بالمطبخ أو بالبيت. ممكن تشوف هالتقنية قريباً بتطبيقات مثل مساعدات المنزل الذكي أو الروبوتات اللي بتنظف الأرض.
egocentric dataset robotics embodied AI toolchain hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

AlayaRenderer-Flash: رسام عالمي توليدي بسرعة اللعب

Generative World Renderer at the Speed of Play
الفريق قدم نسخة سريعة من AlayaRenderer اسمها AlayaRenderer-Flash، اللي بتحوّل النموذج الأصلي من 0.56 إطار للثانية لحد 31.54 إطار للثانية. هالنسخة بتشتغل كـ few-step autoregressive streaming model وبتستعمل lightweight distilled codecs لتشفير الإطارات وإعادة بنائها. مع إنها أخف وأسرع، بتحتفظ بواجهة الـ G‑buffer وتوليد النصوص، وبتقدر تشتغل على تدفقات غير محدودة من البيانات.
ليش بتهمّك؟: بتخلّي هالتقنية الألعاب التفاعلية تولد مشاهد واقعية بالوقت الحقيقي بدون ما يبطئوا الأداء.
🌱 شو إلك منها؟
بتخيلوا لعبة بتتغير عالمها حسب حركاتكم وتظل السطوح والألوان ثابتة، متل ما بيصير لما تحطوا مكوّنات لعبة على طاولة وتتحرك بس ما تتغير شكلها. هالشي بيظهر بإنترنت الألعاب أو تطبيقات الواقع الافتراضي اللي بنستعملها كل يوم.
generative rendering real-time AI physics engines computer graphics hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

MeetingToM: اختبار الفهم الاجتماعي للـ MLLMs بالاجتماعات المتعددة

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings
الفريق قدموا MeetingToM، معيار جديد بيقيس قدرة النماذج الكبيرة المتعددة الوسائط على فهم سلوكيات الناس بالاجتماعات اللي فيها أكتر من شخص. التركيز كان على حالات معقدة مثل "pseudo-consensus"، يعني الاتفاق الظاهر اللي ممكن يكون فيه خلاف خاص تحت ضغط الجماعة. التقسيم بهالمعيار بيصعد من توقع الحالة الذهنية لشخص واحد، ليفهم مين موجه الكلام، لحد ما يوصل لتقييم الاتفاق الجماعي. التحليل أظهر إن النماذج الحالية ما بتدمج الإشارات غير الكلامية بشكل كافي، ولا بتفكّ الشكوك بين الظاهر والباطن.
ليش بتهمّك؟: هالورقة بتعطي دليل واضح على وين النماذج المتعددة الوسائط لسا محتاجة تحسين لتفهم التفاعلات الاجتماعية الحقيقية بالاجتماعات.
🌱 شو إلك منها؟
تخيل إنك عم تشوف فيديو لاجتماع وتحتاج تعرف إذا الناس فعلاً متفقين أو في حدا مخفي ضد الفكرة. هالمعيار بيخلينا نطوّر برامج تفهم هالنوع من التوترات وتساعدنا نتجنّب سوء الفهم. ممكن نشوف هالتقنية بالمستقبل ببرامج الترجمة الفورية أو أدوات إدارة الاجتماعات اللي تحسّن التواصل بين الفرق.
multimodal theory-of-mind benchmark meetings social-ai arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

تقييم المقالات وتوليد الملاحظات مع LLM عبر التعلم المعزز

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards
الفريق قدم إطار RLAES اللي بيجمع بين تقييم المقالات وتوليد الملاحظات باستخدام التعلم المعزز. حطوا طريقة جديدة لتقييم جودة الملاحظات اسمها Rubric-based Feedback Evaluation (RFE) فيها 166 بند تقييم ثنائي، واستخدموا LLM كحكم. كمان طوّروا Adaptive Gated Feedback Optimization (AGFO) لتفعيل مكافآت الملاحظات حسب الحاجة، وAdjacent Contrastive Reasoning (ACR) لتحسين معايرة الدرجات. التجارب على معيار ASAP أظهرت إن RLAES‑AGFO وصل لأعلى دقة بين طرق الـLLM (QWK = 0.803) وبنفس الوقت جودة ملاحظات قريبة من GPT‑5.5.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الـLLM تعطي تقييم وملاحظات أدق، وبتقلل من تدهور جودة الملاحظات اللي بصير مع التدريب على التقييم بس.
🌱 شو إلك منها؟
تخيل إنك تكتب مقالة وتلاقي ملاحظات سريعة ومفصلة تشبه اللي يعطيها أستاذك، بدون ما تنتظر تصحيح يدوي. هالشي بيساعد الطلاب يطوروا كتاباتهم بسرعة ويقلل من ضغط المعلمين. ممكن تشوف هالتقنية ضمن تطبيقات التعليم أونلاين أو أدوات تصحيح تلقائي.
LLM reinforcement learning essay scoring feedback generation ASAP arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

الوكلاء في الواقع: من البحث للتطبيق

Agents in the Wild: Where Research Meets Deployment
الفريق اللي بيضم Grace Hui Yang وزملاؤه بيحكي عن الأنظمة الوكيلة المبنية على LLM يلي فيها قدرة على التفكير، التخطيط، التنفيذ، والتنسيق مع أدوات ووكلاء تانيين. الورقة بتوضح إنو هالأنظمة عم تنتقل بسرعة من النماذج التجريبية للانتشار الفعلي بمجالات متل هندسة البرمجيات، الاكتشاف العلمي، والمالية. كمان بيستعرضوا تحديات جديدة بالاعتمادية والسلامة وكيفية التعامل معها عبر أنماط تصميم، قوائم تقييم، وآليات فحص. وفيه دراسات حالة عملية بمجال اكتشاف الأدوية والأنظمة المالية لتوضيح كيف بنقدر نضمن تشغيل آمن وموثوق.
ليش بتهمّك؟: هالورقة بتعطيك خريطة واضحة لتطبيق الوكلاء بأمان بمجالات حقيقية، وبتخفف المخاطر اللي ممكن تواجهها الشركات.
🌱 شو إلك منها؟
تخيل إنو في برنامج بيساعدك تتخذ قرارات مالية أو يلاقي دواء جديد، بس بدون ما يوقع بخطأ كبير. هالمقال بيفسر كيف بنقدر نضيف طبقات فحص وتأكد قبل ما يشتغل البرنامج مع الناس. يعني إذا بتستعمل أي خدمة ذكية، هالتقنيات بتضمن إنو الخدمة تكون أمان وموثوقة.
agents LLM deployment safety evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

AdaFlash: تحسين التوليد التخميني عبر مسودات الانتشار المتكيّفة

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters
الفريق Qian وزملاؤه قدموا AdaFlash، طريقة جديدة لتسريع استنتاج نماذج اللغة الكبيرة. الطريقة بتستغل مسودات الانتشار لكن بتعالج مشكلة التباين اللي بتصير بسبب الانتباه الثنائي الاتجاه، عن طريق تقطير على‑السياسة مع تقليل KL العكسي وتعديل طول السلسلة بشكل ديناميكي. النتيجة إن السرعة بتزيد، خصوصًا لما يشتغل النظام على طلبات كتيرة بنفس الوقت، وبيوصلوا لزيادة تقريبًا 66 % في معدل الإنتاج مقارنةً بأفضل الطرق السابقة.
ليش بتهمّك؟: بتخلّي تطبيقات الدردشة والبحث أسرع بكتير، خصوصًا وقت الضغط العالي.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع شات بوت وتنتظر ردّه، مع AdaFlash الرد بيصير أسرع بكتير حتى لو في ناس كتير عم تستعمله بنفس الوقت. الفكرة متل ما إذا كان عندك فريق يكتب مسودة بسرعة وبعدين بيتأكدوا من صحتها، فبتوصل النتيجة بسرعة. هالطريقة ممكن تشوفها بالمساعدات الصوتية أو التطبيقات اللي بتعتمد على الذكاء الاصطناعي وتحتاج ردّ فوري.
speculative decoding diffusion language models acceleration throughput arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

GigaChat Audio: نموذج لغة صوتية بوعي زمني

GigaChat Audio: Time-aware Large Audio Language Model
الفريق قدم نموذج لغة صوتية بيقدر يجاوب على أسئلة مع توقيتات دقيقة داخل تسجيلات طولها لحد 120 دقيقة. الطريقة بتخلط علامات زمنية دورية مع توكنات الصوت المستمرة، وتستفيد من إشراف صناعي على نطاق كبير عبر خط أنابيب متسلسل. النموذج بيظهر دقة عالية في ربط الكلام بالوقت على مجموعات اختبار قصيرة وطويلة، وكمان بيدعم وصف وتلخيص أجزاء الصوت المرتبطة بالوقت. الباحثين عملوا تجارب تفصيلية ليشوفوا كيف بتأثر تمثيلات الوقت وتكرار العلامات وتجزئة التوكنات على الدقة وتكلفة الحوسبة.
ليش بتهمّك؟: هالورقة بتخلينا نتحكم بالوقت داخل ملفات صوتية طويلة، الشي اللي بيفتح باب لتطبيقات مثل ملخصات الاجتماعات أو البحث داخل محاضرات طويلة.
🌱 شو إلك منها؟
تخيل إنك تقدر تسأل ملف صوتي طويل، مثلاً محاضرة، وتطلع لك الإجابة مع الوقت بالضبط اللي نُطقت فيه. يعني بدل ما تدور يدويًا على المعلومة، النموذج يحدد لك المكان بالثواني. هالشي ممكن يطلعك على تطبيقات مثل محركات البحث داخل البودكاست أو ملخصات الاجتماعات اللي بنستعملها كل يوم.
audio LLM temporal grounding synthetic supervision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

تقييم عام للغش المالي باستخدام LLMs: مهمة جديدة وشاملة

Benchmarking Generalization in Financial Statement Fraud Detection: robust evaluation and novel tasks
الفريق قدم إطار قوي لكشف الغش بالبيانات المالية، بيستغل Large Language Models ليجمع بين الأرقام المالية المنظمة والنصوص الموجودة بتقارير الشركات. حطّوا benchmark جديد اسمه Company-Isolated FSFD (CI‑FSFD) بيقيس قدرة النموذج على التعميم على شركات ما شافها قبل أو فترات مستقبلية. كمان بنوا مجموعة بيانات أمريكية تشمل القوائم المالية، نصوص MD&A، وعلامات الغش، ونشروا إياها للكل. التجربة أثبتت إن دمج النصوص مع البيانات المنظمة يرفع الدقة ويعطي أفضل نتيجة على مهمة CI‑FSFD.
ليش بتهمّك؟: هالورقة بتظهر كيف النصوص داخل التقارير المالية ممكن تنقذ المستثمرين من الوقوع بفخ الشركات المحتالة.
🌱 شو إلك منها؟
تخيل إنو فيه برنامج يقدر يكتشف إذا شركة عم تحاول تخدع المستثمرين من خلال تقاريرها المالية، متل ما يكتشف حارس أمن إذا حدا عم يسرق. هالشي بيساعد الناس اللي بيستثمروا أو بيشتغلوا بالمصارف يحموا أموالهم من الخسارة. ممكن تشوف هالتقنية تنضم لتطبيقات البنك أو منصات الاستثمار اللي بتستخدمها كل يوم.
fraud detection financial statements LLM benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

تحكم وقت الاستنتاج لتقليل التباين اللغوي في إجابات LLMs

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs
الباحث ألكسندر مانيڤ بيستكشف كيف ممكن نضبط نماذج اللغة الكبيرة وقت الاستنتاج عشان ما تعطي إجابات متباينة بين اللغات. جربوا أربع طرق: توجيه الشخصية (persona prompting)، تعديل التمثيلات الداخلية عبر Contrastive Activation Addition، وتعديل وزن النموذج بخفة باستخدام Direct Preference Optimization المدرب على بيانات واقعية. التجارب على Gemma 3 12B Instruct بيّنت إن توجيه الشخصية هو الأقوى، لأنه بيوصل لتوازن بين الفعالية والسلامة ونقل المعرفة للمواضيع الجديدة.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج تعطي إجابات ثابتة بغضّ النظر عن لغة السؤال، وهاد مهم للناس اللي بيستعملوا الذكاء الاصطناعي بأكثر من لغة.
🌱 شو إلك منها؟
تخيّل إنك تسأل سؤال بالعربي وبتلقى إجابة مختلفة عن لما تسأله بالإنجليزي؛ هالتقنية بتقفل الفجوة وتخلي الجواب واحد. يعني إذا بدك تستفيد من تطبيقات ترجمة أو مساعدة ذكية، رح تشوف إجابات أدق وأقرب للواقع. رح تلاقي هالتحسينات ضمن أدوات الدردشة أو المساعدين الرقميين اللي بتستعملها يوميًا.
cross-lingual factual consistency prompting LLM alignment arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

هل الـ LLMs بتحلم بربط الجزيئات؟

Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
الفريق بقيادة Thomas MacDougall وزملاؤه بيستكشف إذا الـ LLMs يقدروا يتعاملوا مع قيود ثلاثية الأبعاد لتصميم جزيئات دوائية. حطوا اختبار اسمه 3D‑Fit لتقييم أداء الـ LLMs مقارنةً بنماذج diffusion المتخصصة، وشملوا قيود مثل الفراجمنتات المربوطة ونقاط الفارماكوفور والتفاعلات الضرورية. النتائج بتظهر إن الـ LLMs لسا متأخرة شوي عن أحسن الطرق، بس بتبين قدرة على معالجة قيود متعددة بنفس الوقت.
ليش بتهمّك؟: هالنتائج بتعطي أمل إنو نماذج اللغة الكبيرة ممكن تصير أداة مفيدة لتصميم أدوية بدقة أعلى وبسرعة أكبر.
🌱 شو إلك منها؟
تخيل إنو برنامج يقدر يقترح أدوية جديدة بناءً على شكل البروتين، من غير ما يحتاج يشتغل على رسومات ثلاثية الأبعاد معقدة. هالفكرة ممكن تخلي عملية اكتشاف الأدوية أسرع وأرخص، وتظهر بأدوات على الإنترنت تساعد الباحثين أو حتى الشركات الصغيرة. يعني ممكن تشوف تحسينات بخدمات الصحة أو تطبيقات صيدلية على موبايلك قريباً.
LLM drug discovery benchmarking spatial constraints diffusion hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

تعلّم مع توجيه خاص: Off-Context GRPO

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
الفريق قدم طريقة جديدة اسمها Off-Context GRPO (OC‑GRPO) لتقوية قدرة نماذج اللغة الكبيرة على حل المسائل الصعبة. الفكرة إنو بنعطي للنموذج إرشاد خاص خلال التدريب، مثل بادئة الحل، بس بنحافظ على الهدف الأصلي من غير هالإرشاد عن طريق تعديل الـ objective بطريقة importance‑corrected. هالتعديل بيخلّي التدريب يظل ثابت وما يضيع مع الإرشاد، وبيوصل النموذج لحلول فيها مكافأة غير صفرية. التجارب أظهرت تحسين بـ 3.9٪ مطلق على benchmarks الرياضيات مقارنةً بـ GRPO العادي، وبكلفة إضافية قليلة.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج تقدر تحل مسائل رياضية معقّدة ما كانت تقدر عليها قبل هيك، فبتفتح باب لتطبيقات أكتر دقّة.
🌱 شو إلك منها؟
بتخيل إنو هالتقنية ممكن تساعد برنامج يشرح لك حل مسألة رياضية معقدة خطوة بخطوة، متل ما معلم يوجّهك ببدية الحل. يعني إذا حطيت سؤال صعب على تطبيق تعليمي، البرنامج رح يقدر يجاوبك بشكل أدق ويقصر عليك وقت البحث. ممكن تشوف هالتحسينات في تطبيقات التعليم أو المساعدة الذكية على الإنترنت.
reinforcement learning reasoning language models GRPO math benchmarks arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

سعر التفكير: موازنة التكلفة والجودة في Reinforcement Learning للترجمة الآلية

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation
الفريق Jungo وزميله An استكشفوا كيف إنو تضمين خطوات التفكير (reasoning trace) داخل ردود النموذج بيأثر على جودة الترجمة. جربوا حذف هالخطوات إما أثناء التدريب أو أثناء الاستنتاج، ولاحظوا إنو وجودها وقت الاستنتاج بيحسن الترجمة. بس هالتحسين بيجي مع زيادة عدد الكلمات المولدة، فصاروا يدرسون التوازن بين استهلاك الموارد وتحسين الجودة.
ليش بتهمّك؟: لأنو إذا قدرنا نرفع جودة الترجمة مع معرفة تكلفة الحوسبة، بنقدر نختار الأنسب لتطبيقات الترجمة الواقعية.
🌱 شو إلك منها؟
لما النموذج يكتب كيف وصل للترجمة قبل ما يعطي النتيجة، النتيجة بتطلع أدق، بس بياخد وقت أطول. متل ما إذا كنت تحكي لحد وتشرح له خطوة بخطوة قبل ما يعطيك الجواب، بتفهم أكتر لكن بتستنى شوي. هالطريقة ممكن تشوفها بأدوات الترجمة اللي بتعتمد على الذكاء الاصطناعي، خصوصًا لما تحتاج ترجمة دقيقة مثل المستندات القانونية.
reinforcement-learning machine-translation cost-quality tradeoff LLM NMT arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 6
self-distillation
تقنية بنعلم فيها نموذج كبير يدرّس نسخة أصغر من نفسه، عشان نحسّن الأداء مش بنحتاج بيانات جديدة
DeepSearch-World
مصطلح بيحكي عن قدرة الـ AI إنو يدور عالمياً على معلومات مع فهم السياق، احنا بنسمع عنه عشان بيساعدنا نلاقي إشي بدقة وسرعة.
rectified flow matching
مفهوم لتدريب نماذج التدفق بطريقة تصحيحية لتقليل الأخطاء، احنا بنستفيد منه عشان التدريب يكون مستقر ومتين.
attention
الـ attention هو آلية بتخلي النموذج يركز على أجزاء معينة من النص وقت ما بيولد أو يفهم، يعني بنقول له يركز على الإشي المهم.
pruning
الـ pruning يعني بنقص حجم النموذج عن طريق حذف الوصلات أو النيورونات اللي ما إلها تأثير كبير، عشان النموذج يصير أخف وأسرع.
DAG
Directed Acyclic Graph، بنستعمله لتصميم عمليات التعلم أو تدفق الشغل بدون دورات، احنا بنعتمد عليه عشان نوضح الاعتمادات.
🤖 موديلز 5
Mage-VAE
نموذج توليدي يعتمد على الـ Variational Autoencoder لتوليد محتوى سحري، بدنا نستخدمه عشان يخلق صور أو نصوص بجودة عالية.
diffusion transformer
هالنموذج بدمج فكرة الـ diffusion مع بنية الـ transformer، يعني بيستفيد من قوة الـ transformer لتوليد محتوى بصورة تدريجية، بنسمع عنه لأنه بيعطي نتائج أقوى بالـ generative tasks
Turbo
نموذج اسمه Turbo لأنه بيشتغل بسرعة عالية مع جودة مقبولة، بنستعمله عشان نحتاج ردود سريعة مش بطئ.
DiT
DiT هو اختصار لـ Diffusion Transformer، نموذج بيستفيد من بنية Transformer لتوليد صور عبر عملية الانتشار.
DataFlow-Harness
إطار بيستغل تدفق البيانات لتسريع عملية التعلم وربط المصادر بسهولة، بدنا نستخدمه عشان نحسن كفاءة التدريب.
🗂️ بيانات 3
BrowseComp
benchmark بيقيس قدرة الأنظمة على التصفح والبحث بدقة وسرعة، بنستعمله عشان نقارن بين النماذج مش بس نعرف الأداء.
GAIA
نظام أو إطار عمل بيجمع بيانات من مصادر مختلفة لتدريب نماذج AI، بنسمع عنه لأنه بيساعد نخلق نماذج أوسع وأدق.
GenEval
GenEval هو مجموعة بيانات بتقييم جودة النصوص المولدة، بدنا نقارن بين نماذج توليد النص.
كل المصطلحات ←
العدد السابقشو في AI؟ | 21 يوليو — LLMs تتوسع بالفيديو والوسائط
📚 كل الأعداد