📡 أحدث عدد

شو في AI؟ | 21 يوليو — LLMs تتوسع بالفيديو والوسائط

يومي 📅 2026-07-21
سلام 👋 في عدد اليوم بنستعرض أحدث التطورات بالذكاء الاصطناعي، خصوصاً كيف الـLLMs عم تتعمق بالوسائط المتعددة والفيديو. رح نركز على تقنيات تحويل الموارد، التوجيه الزمني، والاختيار الانتقائي لتشغيل النماذج على الأجهزة الصغيرة.
#1

RESOURCE2SKILL: تحويل الموارد المتعددة الوسائط لمهارات قابلة للتنفيذ

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
الفريق قدم إطار RESOURCE2SKILL اللي بيحوّل الفيديوهات التعليمية، المستودعات، المقالات، والملفات المرجعية لمهارات تنفيذية للبرمجيات. المهارات بتنظم بقاعدة بيانات شجرية اسمها Skill Wiki، كل مدخل فيها نص منظم، كود، أمثلة بصرية، وبيانات تعريفية. التجارب على سبع مجالات إبداعية أظهرت إن الوكلاء اللي بيستعملوا هالمهارات ارتفعوا بالنتيجة بحدود 11.9 نقطة مقارنةً بالوكلاء اللي ما عندهم مهارات.
ليش بتهمّك؟: الورقة بتفتح باب لاستفادة الوكلاء من كل أنواع المحتوى البشري، مش بس النصوص، وهاد بيعني أداء أقوى وتطبيقات أوسع.
🌱 شو إلك منها؟
تخيل إنو برنامج يساعدك يكتب كود أو يضبط إعدادات جهازك بناءً على فيديو تعليمي شفته على اليوتيوب. هالمشروع بيخلي البرنامج يتعلم من الفيديوهات نفسها، مش بس من شرح مكتوب. يعني ممكن تشوف تحسينات بخدمات الدعم أو الأدوات اللي بتستعملها يوميًا، لأن البرنامج رح يكون أذكى ويعرف يطبق الخطوات تلقائيًا.
multimodal skill acquisition agent AI knowledge distillation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

TimeLens2: توجيه زمني عام للفيديو بالـ MLLMs

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
الفريق قدم نموذج TimeLens2 اللي بيقدر يحدّد فترات الدليل داخل الفيديوهات مهما كان طولها أو نوعها أو طريقة السؤال. النموذج بيتعامل مع مجموعة من الفواصل الزمنية كـ set وبيستفيد من إشراف مبني على اقتراحات من النصوص وتوافق بين وكلاء مختلفين. كمان صمموا مكافأة جديدة اسمها temporal Wasserstein reward بتحسب المسافة بين توزيعات الفواصل وبتعطي تغذية راجعة دقيقة حتى لو عدد الفواصل مختلف. التجارب على سبعة benchmarks أظهرت إن النسخ 2B، 4B، و8B من TimeLens2 تتفوّق على كل النماذج اللي حجمها مماثل وتوصل لأعلى درجات mIoU.
ليش بتهمّك؟: هالشي بيسهّل على التطبيقات تفهم متى صار الحدث داخل الفيديو، مش بس شو صار.
🌱 شو إلك منها؟
تخيل إنك عم تشوف فيديو طويل وبدك تعرف متى ظهر مشهد معين، هالنظام بيدلك على الدقايق بالضبط. يعني إذا حابب تلاقي لحظة معينة ببرنامج تعليمي أو فيلم، ما رح تدور يدوي. هالتقنية ممكن تنستخدم بأدوات البحث داخل الفيديوهات على يوتيوب أو منصات التعليم.
video temporal grounding multimodal LLM benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

SWE-Pruner Pro: كيف الـLLM بيعرف شو يقصّ

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
الفريق اكتشف إنّ الوكيل نفسه بيحمل تمثيلات داخلية بتدلّ على أهميّة كل سطر من كود الأدوات. فطوّروا SWE-Pruner Pro، وهو رأس صغير بيحوّل هالتمثيلات لتصنيف "keep" أو "prune" لكل سطر، مع تضمين طول السطر كـ embedding. التجربة على نموذجين مفتوحين و٤ benchmarks أظهرت إنّه بيوفر لحد 39% من توكنات الـprompt والـcompletion بدون ما يضعّف جودة الشغل.
ليش بتهمّك؟: هالطريقة بتقلل استهلاك الموارد وبسرّع استجابة الوكلاء البرمجيين.
🌱 شو إلك منها؟
بتخلي التطبيقات اللي بتكتب كود أو بتساعد بالمبرمجين تشتغل أسرع وتستهلك أقل. يعني إذا كنت عم تستعمل أداة بتكمل الكود، رح تلاحظ إنّها ترد بسرعة أكبر. هالشي بيظهر لك بالمتصفحات أو IDEs اللي فيها ميزات الذكاء الاصطناعي.
code pruning LLM coding agents efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

EvolvingWorld: إطار مفتوح لتطوير شخصيات وعالم قصصي تفاعلي

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
الفريق قدم إشي اسمه EvolvingWorld، بيشتغل كمنصة ومقارنة لتطوير الشخصيات والعالم مع بعض بعالم أدبي تفاعلي. النظام بيقسم الشغل على وحدة تمثّل الشخصيات وتطوّر ملفّاتهم، ووحدة تانية مبنية على LLM بتحافظ على حالة العالم وتولّد المشاهد. الإطار مفتوح يعني فينا نطبّقوا على قصص مختلفة، ومعاه 7 مهام تدريبية لتوليد المشاهد وتحديث الحالة. التجارب بيّنت إنو بيحسّن المحاكاة على المدى الطويل وبيخلي القصة أكتر استمرارية وتماسك.
ليش بتهمّك؟: هالورقة بتعطي طريقة عملية لتوليد قصص تفاعلية طويلة بدون ما يضيع السياق أو تطور الشخصيات.
🌱 شو إلك منها؟
بتخيل إنك عم تقرأ قصة وبتقدر تشوف الشخصيات تتغيّر مع الوقت وكأنها عم تعيش معك. الفكرة متل لعبة قصصية بتتطور حسب قراراتك، وبتظهر أكتر بالمنصات اللي بتخلّي القارئ يشارك بالقصة. يعني إذا استعملت تطبيق بيستعمل هالتقنية، رح تحس إن القصة بتصير أكتر حيوية وشخصياتها بتتصرف بطبيعية.
interactive-fiction agents world-model benchmark LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

SelectInfer: تحميل واستخدام الخلايا العصبية بصورة انتقائية للـLLMs على الأجهزة الصغيرة

SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs
الباحثين قدموا إطار عمل اسمه SelectInfer بيشتغل على مستوى الخلايا العصبية داخل الـLLM. بيحدّدوا الخلايا المهمة للمهام باستخدام أداة profiling قبل ما يشتغل النموذج، وبعدين بيحمّلوها وبس بيحسبوا الخلايا الضرورية وقت التشغيل. هالطريقة بتقلل استهلاك الذاكرة والعمليات بدون ما تضعف الدقة. التجارب على كذا مجموعة بيانات بيّنت إنو فيه تخفيض كبير بالموارد مع الحفاظ على الأداء.
ليش بتهمّك؟: هالطريقة بتخلّي تشغيل نماذج اللغة الكبيرة على الهواتف أو الأجهزة الصغيرة صارت ممكنة عمليًا.
🌱 شو إلك منها؟
تخيّل إنك بدك تستعمل تطبيق ترجمة أو كتابة نصوص ذكي على موبايلك وما يبطئ أو يستهلك بطارية كتير. SelectInfer بيقلل استهلاك الذاكرة والسرعة، فبتستمتع بخدمات ذكية أسرع وأقل استهلاكًا للطاقة. ممكن تشوف الفرق إذا استخدمت تطبيقات تعتمد على LLMs على جهازك اليومي.
LLM model compression edge computing inference neural networks arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

توليد بيانات صناعية بلا بيئة للـ API‑Calling Agents

Environment-free Synthetic Data Generation for API-Calling Agents
الفريق بقيادة Seanie Lee قدم طريقة توليد بيانات صناعية للـ API‑Calling agents من غير ما يحتاجوا بيئات تنفيذية. بيعتمدوا على LLM بيشتغل كـ نموذج عالم رقمي يولّد مهام وإجابات API على طول، مع وكيل معلم بيحلّ المهام ومحكّم LLM بيفلتر النتائج. التجربة على Benchmarks AppWorld وOfficeBench أظهرت تحسين واضح بالأداء بعد ما ندرب النماذج على هالبيانات.
ليش بتهمّك؟: هالطريقة بتقليل الجهد والموارد المطلوبة لتدريب وكلاء يتعاملوا مع واجهات برمجة التطبيقات، وبتفتح الباب لتوسيعهم على أي نظام API بسهولة.
🌱 شو إلك منها؟
بتخيل إنو بدال ما نحتاج نجهّز بيئات معقدة عشان ندرّب برنامج يتعامل مع تطبيقات، هالطريقة بتخلق بيانات وهمية من غير ما نشتغل على كل برنامج بحد ذاته. يعني متل ما بنصنع تمارين رياضية على ورق بدل ما نحتاج نروح الصالة الرياضية. هالشي ممكن يخلّي التطبيقات الذكية تتطوّر أسرع وتساعدنا بحلول أسرع على الهواتف أو المواقع اللي بنستعملها كل يوم.
synthetic data API LLM agents benchmarking hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

وصول بلغة طبيعية للبيانات المتخصصة: إطار لتوليد استعلامات LLM

Natural Language Access to Domain-Specific Metadata: A Reusable Framework for LLM Query Generation
الفريق Fitch وزملاؤه قدموا نظام NLKGQ اللي بيسمح للباحثين يطرحوا أسئلة طبيعية على أرشيفات متخصصة، والنظام يترجم هالأسئلة لاستعلامات SPARQL باستخدام LLM من غير ما يحتاجوا لتدريب إضافي أو تحسينات. الطريقة تعتمد على بناء أونتولوجيا OWL تمثل مفردات المجال، وبعدين تنقل البيانات لknowledge graph. التجربة على أرشيف تصوير دماغي كبير وصلت لأعلى دقة (100٪) على أسئلة تم إعدادها مع خبراء، وبيّنوا إن وضوح أسماء الكيانات أهم من اختيار النموذج أو صياغة الطلب.
ليش بتهمّك؟: هالطريقة بتخلّي الباحثين يقدروا يستخرجوا معلومات من قواعد بيانات معقّدة بسرعة وبأمان، من غير ما يكتبوا استعلامات معقّدة أو يشاركوا بيانات حساسة.
🌱 شو إلك منها؟
تخيّل إنك تقدر تسأل حاسوب عن أي شي ببيانات طبية أو علمية وتاخد الجواب فورًا، متل ما تسأل صديقك عن عدد المرضى بدراسة معينة. هالشي بيصير ممكن لأن النظام يحوّل كلامك العادي لاستعلامات قاعدة بيانات، وبيظهر لك النتائج على موقع أو تطبيق تستخدمه يوميًا.
LLM SPARQL ontology knowledge graph metadata arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

HOMIE: تخصيص الفيديو بتركيز على الإنسان والشيء

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
الفريق قدم طريقة جديدة لتخصيص الفيديوهات بحيث يظل شكل الإنسان ثابت ويتفاعل مع الأشياء بدقة، حتى لو كانت الأشياء مجرد شعارات أو مفاهيم مجردة. الطريقة بتستغل MLLM لتستخرج علاقات مرجعية من النصوص وتدمجها مع تمثيلات VAE داخل self-attention. كمان ضافت embedding خاص بتمييز إشارة الموداليتي لتربط بين صور المرجع داخل نفس الشخص. التجارب أظهرت إن HOMIE وصل لأفضل أداء على مجموعة مهام HOCVP.
ليش بتهمّك؟: هالطريقة بتخلّي الفيديوهات المخصصة تكون أقرب للواقع وتعبّر عن التفاعل الحقيقي بين الإنسان والشيء.
🌱 شو إلك منها؟
تخيل إنك تقدر تعدّل فيديوهاتك بحيث تظهر أنت بتستعمل أي شعار أو أداة تحبها وتظل الحركة طبيعية، متل ما بتشوف في الإعلانات. هالشي بيسهّل على الناس يضيفوا لمستهم الشخصية على محتوى الفيديو بسهولة، وبيظهر بأدوات تعديل الفيديو اللي بنستعملها يوميًا.
video generation personalization multimodal MLLM VAE hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

SGA: وحدة التحقق الهندسي للڤيديوهات التعليمية

SGA: Plug&Play Geometric Verification for Educational Video Synthesis
الفريق Lopez وزملاؤه قدموا Symbolic Geometric Agent (SGA)، وحدة plug‑and‑play بتدخل على كود الأنيميشن اللي بتولده الـLLMs وبتنفّذ جزء منه لتستخرج symbolic scene graph. إذا اكتشفت تعارضات مكانية، SGA بيعمل تعديل مستهدف لتصحيح المشهد. كمان عرّفوا Manim Visual Quality Score (MVQS) كمؤشر بدون رندر لتقويم سلامة التوزيع المكاني. التجارب على benchmark MMMC‑Code بينت إن SGA وصل لأعلى MVQS بـ73.11، يعني تحسين نسبته 16.1% عن النسخة الأصلية.
ليش بتهمّك؟: هالطريقة بتخلّي الأنيميشن التعليمي يطلع بدقة هندسية أعلى، فالمستخدمين بيفهموا الشروحات بشكل أوضح وأسرع.
🌱 شو إلك منها؟
بتخيل إنك عم تتعلم رياضيات من فيديوهات مصنوعة آليًا، مع SGA الفيديو بيكون واضح وما فيه تشويش أو تداخل بأجزاء الرسم. يعني القاعدة الهندسية بتضل ثابتة، متل ما بتشوف خريطة واضحة على الجوال. هالتحسين بيظهر بأدوات التعليم الأونلاين اللي بتستعمل أنيميشن لتوضيح المفاهيم.
LLM animation geometric verification education Manim arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

LLMs والأنظمة الذكية للشبكات: دليل للمعمارية والتطبيقات

LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications
الفريق بيشرح كيف صارت الـLLMs والأنظمة الوكيلة (agentic AI) تتخطى مهام النص وتقدر تستخدم أدوات خارجية لتخطط وتسترجع وتنفّذ بذكاء بمجال الشبكات الذكية. بيطرحوا مبدأ التصميم "solver‑grounded" يعني إنو النتيجة الرقمية ما تننشر إلا إذا جت من أداة موثوقة وتجاوزت فحص واضح. عرضوا أربع دراسات حالة: توقع طاقة الرياح، جدولة شحن السيارات الكهربائية، تحليل تدفق الطاقة، وتشخيص الأعطال، وكل وحدة قارنوا فيها نسخة بس الـLLM مع نسخة فيها أداة موثوقة. النتائج بتبين إنو الأنظمة الوكيلة بتقود وتفسّر، والأدوات الموثوقة بتحسب، وبوابة التحقق بتقرر شو يننشر.
ليش بتهمّك؟: هالورقة بتبيّن كيف نضمن إنو الأنظمة الذكية تعطي نتائج دقيقة وآمنة بدل ما تعطي أرقام غير واقعية.
🌱 شو إلك منها؟
تخيل إنو عندك برنامج بيتحكم في كهربا البيت، وبيستعين بأدوات موثوقة ليعطيك قرارات دقيقة لتوفير الطاقة. هالفكرة بتخلي النظام يشتغل بأمان وما يعطيك نصايح غير صحيحة. ممكن تشوف هالتحسينات في تطبيقات الطاقة المنزلية أو خدمات شركات الكهرباء.
LLM agentic AI smart grid power systems evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

Apple-π: معيار لتقييم التفكير بالفيديو وفق القوانين الفيزيائية

Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
هالورقة بتقدّم Apple-PI، أول معيار بيركّز على القوانين الفيزيائية لتقييم نماذج توليد الفيديو. المعيار فيه ثلاث قطع: Orchard، مجموعة 400 فيديو بتغطي عشر مهام ميكانيكية كلاسيكية، وبروتوكول بثلاث مراحل (Perception, Formulation, Deduction) بيستعمل chain-of-frames على أول إطارات موضحين إنفوغرافيك، وكمان مجموعة تقييم بتخلط scoring من MLLM مع قياسات موضوعية مبنية على القوانين. التجربة على 11 نموذج فيديو ورجعت إنو أحسن نموذج وصل بس 0.473، وبيّنوا إنو فيه عائق من Perception لحد Deduction، وصعوبة بنقل القوانين المتعددة، وفجوة Sim-to-Real.
ليش بتهمّك؟: لأنو هالمعيار بيفكّك أخطاء النماذج خطوة بخطوة، بيساعد الباحثين يطوّروا نماذج فيديو تفهم القوانين وتطبّقها، مش بس تعطي مظهر صحيح.
🌱 شو إلك منها؟
تخيل إنو عندك برنامج يقدر يتوقع كيف رح تتحرك الأشياء بالفيديو، متل لعبة أو تطبيق تعليمي، هالمعيار بيأكد إنو البرنامج ما بيخترع حركات غير منطقية. يعني إذا استعملته، ممكن تشوف تطبيقات تعليمية أو ألعاب تكون أكثر واقعية وتعلمك القوانين بسهولة. ممكن تلاقي هالتحسينات قريباً بألعاب الهواتف أو برامج التعليم عن بُعد.
video generation physics benchmark multimodal evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

VDAR‑Router: توجيه LLMات حسب صعوبة السؤال

VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval
الفريق قدم VDAR‑Router، إطار توجيه ما بيعتمد على تحليل صعوبة السؤال. أول شي بيولّد تحليل صعوبة واضح، بعدين بيسترجع أمثلة سابقة إلها نفس الصعوبة. بناءً على هالأمثلة بيقدّر أي نموذج LLM أنسب وبعدين بيختار النموذج حسب دالة مكافأة بتوازن بين الأداء والتكلفة. التجارب على ثلاث مجموعات بيانات بيّنوا إنو VDAR‑Router بيحقق توازن أحسن بين التكلفة والأداء مقارنةً بالطرق السابقة.
ليش بتهمّك؟: هالطريقة بتساعد المطوّرين يختاروا النموذج الأنسب لكل سؤال بدون ما يضطروا يدربوا نظام جديد، فبنوفر وقت وفلوس.
🌱 شو إلك منها؟
تخيّل إنك عم تسأل سؤال معقد على تطبيق ترجمة أو مساعدة ذكية، النظام بيعرف إنو السؤال صعب وبيحوّله لنموذج أقوى، بس بدون ما يرفع السعر. يعني بتستفيد من إجابات أدق وبنفس التكلفة تقريبًا. ممكن تشوف هالشيّ في خدمات الدردشة أو المساعدين الصوتيين اللي بتستعملها يوميًا.
LLM routing retrieval cost-performance benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

تحسين السياسة بالتحكم بالمجموعة للانتروبيا (GEPO)

Group Entropy-Controlled Policy Optimization
الفريق قدم طريقة جديدة اسمها GEPO لتعديل سياسات التعلم المعزز للـ LLMs. الفكرة إنو بيستعملوا إنتروبيا المجموعة من عينات مُجمّعة لتشكيل المزايا بطريقة غير متماثلة حسب مستوى الاستكشاف. هالطريقة بتخفّف المزايا الإيجابية بالمجموعات اللي فيها إنتروبيا قليلة وبتحافظ على المزايا السلبية بالمجموعات اللي فيها إنتروبيا عالية، مع حدود متكيّفة من إحصائيات سابقة. التجارب على نموذجين أساسيين عبر 13 معيار مختلفة بين الرياضيات والفيزياء والبرمجة أظهرت إنو GEPO يتفوّق على GRPO وطرق التحكم بالإنتروبيا التانية.
ليش بتهمّك؟: GEPO بيساعد نماذج اللغة الكبيرة تتعامل مع مهام متنوعة بدون ما يضيعوا على الاستكشاف أو يبالغوا فيه، فبيحسّن الأداء العام.
🌱 شو إلك منها؟
تخيّل إنّو برنامج ذكي بيتعلم من أسئلة كتيرة، من رياضيات لبرمجة، وبدون ما يركّز على موضوع واحد بس. GEPO بيخلّي البرنامج يظل "فضولي" على كل المواضيع، فبيعطيك إجابات أدق سواءً كنت عم تحل مسألة رياضية أو تكتب كود. هالتحسين رح تشوفه بأدوات الدردشة أو المساعدين الذكيين اللي بتستعملهم يوميًا.
reinforcement learning entropy LLM policy optimization GEPO hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

التعلم المعزز المقطّر لتقوية LLM بعد التدريب

Distilled Reinforcement Learning for LLM Post-training
الفريق اقترح طريقة جديدة اسمها Distilled RL بتدمج إشراف المعلم داخل هدف reinforcement learning لتعطي إرشاد أدق وتنتقل معرفة جديدة من نموذج المعلم للطالب. الطريقة فيها ثلاث مكوّنات: عينة أهمية عكسية مع تقليم، إعادة ضبط العينات السلبية، وتطبيع هندسي على مستوى السلسلة. التجارب أظهرت إنو Distilled RL يرفع أداء النموذج على قياسي pass@1 وpass@k مقارنةً بالـ reinforcement learning التقليدي وOPD، سواء كان التقطير داخل نفس العائلة أو بين عائلات مختلفة.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة تتعلم أسرع وتستفيد من معلمين أقوى، فبتحسّن جودة الردود والمهام المعقّدة.
🌱 شو إلك منها؟
تخيّل إنّو المساعد الصوتي على موبايلك يقدر يحلّ أسئلة أكتر بدقة وبسرعة، لأنّه تعلم من نموذج أذكى بطريقة أذكى. يعني لما تسأل عن شي معقّد، رح يجاوبك بشكل أوضح. هالتقنية ممكن تشوفها قريباً في تطبيقات الدردشة أو المساعدات الذكية.
LLM reinforcement learning distillation post-training hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

بحث المتجهات كمطابقة أقرب جار: تعلم سياسات مع RAG في الاستدلال السببي

Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
الفريق Kato قدم طريقة خطوة واحدة وطريقتين خطوة لتعلم السياسات باستخدام Retrieval‑Augmented Generation. بالطريقة ذات الخطوتين، البحث بالمتجهات يجيب أدلة قريبة من الفعل المطلوب ضمن فضاء التضمين، والمولد بيقدّر النتائج المتوقعة أو الفروقات، وبعدين قاعدة plug‑in بتختار الفعل الأنسب. هالطريقة بتربط بين البحث المتجهاتي ومطابقة أقرب جار في الاستدلال السببي، وبتفصل الندم إلى ندم توليد المرشحين وندم الاختيار داخل المرشح، وبتعطي حدود للندم الثاني باستخدام ضمانات أخطاء التنبؤ لمقدّرات أقرب جار وtransformers.
ليش بتهمّك؟: هالورقة بتخلّي تعلم السياسات يكون أكثر دقة بإنه يدمج معلومات من حالات مشابهة بشكل ذكي، وبتقلل الأخطاء بالقرارات.
🌱 شو إلك منها؟
متل ما بنستشير جيراننا قبل ما نقرر شي، النموذج بيستدعي قصص مشابهة من قاعدة بيانات ليقرر أحسن خطوة. هالشي ممكن يطلع بأدوات توصية أو تطبيقات صحية بتاخد قرارات مبنية على تجارب ناس تانية مشابهة.
RAG policy learning causal inference nearest neighbor transformers arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

تقييم LLMs على قيم إندونيسيا: مجموعة أسئلة Pancasila-Dilemmas

Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila
هالبحث بيقدّم مجموعة أسئلة اسمها Pancasila-Dilemmas فيها 1,834 سؤال من أخبار إندونيسيا، مصنّفة حسب خمس قيم من البانكاسيلا: الدين، الإنسانية، الوحدة، الديمقراطية، والعدالة الاجتماعية. الباحثين اختاروا سيناريوهات فيها معضلات عشان يختبروا إذا ردود الـLLMs بتتماشى مع القيم الإندونيسية. جابوا إجابات من 5 مواطنين إندونيسيين، وجربوا 50 نموذج LLM مفتوح ومغلق. النتائج ورّت إن كل النماذج حققت أقل من 0.5 PMS و0.72 MVAS، خصوصاً كان عندهم صعوبة بالأسئلة عن الدين والوحدة.
ليش بتهمّك؟: هالنتيجة بتبيّن إن الـLLMs لسا ما عم تلتقط قيم إندونيسيا، فهاد مهم لتطوير نماذج تتصرف بشكل ملائم بالمنطقة.
🌱 شو إلك منها؟
إذا بدك تشوف شات بوت أو تطبيق ذكاء اصطناعي يجاوب بطريقة تحترم العادات والقيم الإندونيسية، هالدراسة بتفرجينا إنه لسا في شغلة. متل ما بنقارن بين أطباق المطبخ، لازم نختبر إذا النموذج بيعرف يطبّق القيم المحلية. هالمعلومات رح تننشر بأدوات وخدمات بتستهدف المستخدمين بإندونيسيا.
LLM dataset value alignment evaluation ethics arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

نقدر نكسر حلقة الذات للـ LLMs؟ التحكم الدقيق بالتفكير عبر توجيه التفعيلات

Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering
الباحثين اكتشفوا إنو بعض الـ LLMs بيقعوا بحلقة ذاتية طول ما بيحاولوا يجاوبوا، وبيصرفوا كل التوكنات بلا فائدة. اقترحوا طريقة اسمها SOPHIA، بتدخل خلال الاستدلال وتغيّر التفعيلات لتوجيه النموذج من حالة لحالة ثانية وتمنع الوقوع بهالحلقة. الطريقة بتستعمل بنوك من متجهات التوجيه مبنية على حالات مخفية، وبالوقت الحقيقي بتحدد الحالة الحالية وتسترجع المتجه المناسب. التجارب أظهرت إنو هالتدخل بيقلل استهلاك التوكنات وبيحسّن دقة الإجابة.
ليش بتهمّك؟: هالتحكم الدقيق بيخلي النماذج تعطي إجابات أسرع وأدق بدل ما تضيع وقتها بحلقات لا تنتهي.
🌱 شو إلك منها؟
تخيل إنو برنامج ذكي يضلّ يكرر نفس الجواب وما يقدر يكمّل، هالطريقة بتخليه يقدر يكمّل الشغل بلا ما يعلق. يعني لو عم تستخدم مساعد صوتي أو أداة كتابة، رح تلاحظ إنو الردود تصير أسرع وأوضح. هالتحسين ممكن تشوفه بالمحادثات اليومية مع تطبيقات الذكاء الاصطناعي.
LLM reasoning activation steering self-loop control arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

تحسين Rubric‑based RL بالتقطير الذاتي

Enhancing Rubric-based RL via Self-Distillation
الفريق اللي بيقود البحث قدم طريقة جديدة اسمها Criterion‑Distilled Policy Optimization أو CriPO. الطريقة بتستخدم التقطير الذاتي لتصحيح نقطتين مهمتين: أولاً، بتضيف سلوكيات ما كانت موجودة بالمحاكاة (Unexplored Criteria) عبر معلم ذاتي يحقن المعايير المفقودة، وثانياً، بتصحح المعايير اللي تم ضغطها (Suppressed Criteria) عن طريق تعديل المكافآت السلبية لتصير إيجابية. هالخطوة بتخلي النموذج يتعلم من كل المعايير بدون ما يخلط بين التدريب والاستدلال، وبيوصل لأداء أقوى بأقل عدد من خطوات التدريب.
ليش بتهمّك؟: الطريقة بتخلي نماذج اللغة تتعلم أسرع وتغطي كل معايير التقييم، فبتعطي نتائج أدق بالمجالات الصعبة.
🌱 شو إلك منها؟
تخيل إنو برنامج الذكاء الاصطناعي بيكتب لك إجابة على سؤال طبي أو علمي، وبيقدر يضيف كل النقاط المهمة حتى اللي ما كان يعرفها قبل. يعني بيصير أذكى وأسرع بكتير، وبتشوف هالتحسينات في التطبيقات اللي بتستعمل الذكاء الاصطناعي للرد على استفساراتك.
RL self-distillation LLM rubric optimization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

AdaHome: مساعد ذكي للبيت بـ Small Language Models

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models
الفريق Lim وزملاؤه قدموا AdaHome، مساعد بيت ذكي بيشتغل على نماذج لغة صغيرة محلية بدل السحابة. النظام فيه إطار تخطيط واعٍ للنية بيرسل الأوامر إما لتوليد سريع أو لتفكير خفيف حسب التعقيد. لما يجي أمر محتاج تفسير، بيستخدموا استراتيجية Chain-of-Draft لتقرّر بسرعة وبثبات. كمان فيه آلية تكيّف تفضيلات بتتعلم من ردود المستخدم بدون تعديل النموذج أو إضافة موجهات جديدة.
ليش بتهمّك؟: هالطريقة بتخلّي المساعدات المنزلية أسرع، أأمن، وتستمر تتعلم من تفضيلاتنا بدون ما نرسل بياناتنا للإنترنت.
🌱 شو إلك منها؟
تخيل إنك تحكي للغسالة أو الإضاءة وتلقى الرد فورًا وبنفس الخصوصية، متل ما بيصير مع الجيران بس أسرع. النظام بيتعلم شو بتحب من إضاءة أو حرارة ويضبطها لحالك، وما في داعي تشرح كل مرة. هالشي ممكن تشوفه بأجهزة البيت الذكية اللي بتشتغل على الشبكة المحلية وتوفر عليك وقت وخصوصية.
smart home language models personalization low-resource AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

RynnBrain 1.1: نموذج أساسي مدمج أقوى وأكثر تعميمًا

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
فريق الباحثين قدموا RynnBrain 1.1، عائلة نماذج أساسية مدمجة بأحجام 2 بليون، 9 بليون، و122 بليون‑A10 بليون. النموذج تدرب بإطار موحد يجمع بين الفضاء‑الزمان والفيزياء، فصار يدعم الإدراك المدمج، الاستدلال المكاني، التحديد الموقع، والتخطيط. بالمقارنة مع النسخة 1.0، أضافوا توقع نقاط التلامس وتثبيت ثلاثي‑الأبعاد (3D grounding) للنماذج الصغيرة، وصمموا RynnBrain‑VLA بفضاء فعل موحد لكل تجسيد وتغطية خاصة. النماذج نجحت على روبوتات Unitree G1 وAstribot‑S1 وTianji‑Wuji وحققت أرقام قوية على معايير VSI‑Bench، MMSI، وRefSpatial‑Bench، وتفوقت على النماذج التجارية في تجارب الروبوت الفعلية.
ليش بتهمّك؟: هالورقة بتخلّي الروبوتات تفهم وتنفذ مهام معقدة بالمحيط الحقيقي بشكل أدق وأسرع.
🌱 شو إلك منها؟
بتخيل إنو الروبوتات المنزلية رح تصير تقدر تمسك الأغراض وتضعّها بمكانها من غير ما تخرب أو تضيع. متل ما بنحط إيدنا على كوب ونحطّه على الطاولة، الروبوت رح يقدر يعمل هالشيّ بسهولة. رح تشوف هالتقنية يومًا ما على تطبيقات الذكاء الاصطناعي بالمنازل أو بالمصانع الصغيرة.
embodied AI foundation model robotics multi-modal benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 6
Skill Wiki
Skill Wiki هو قاعدة بيانات أو موقع بيجمع مهارات الذكاء الاصطناعي، بنستعمله عشان نعرف إيش المهارات المتاحة وكيفية استخدامها.
multimodal
النموذج بيقدر يتعامل مع أكتر من نوع بيانات، مثل النص والصورة مع بعض، هالشي بيسمح له يفهم إشي أكتر تعقيداً
online acquisition
online acquisition يعني جمع البيانات أو التعلم من الإنترنت مباشرةً، بنستفيد منه عشان النموذج يتعلم إشي جديد بدون ما نوقف التدريب.
temporal Wasserstein reward
temporal Wasserstein reward هو مقياس بيستخدم مسافة Wasserstein عالزمن لتقييم جودة التوليد، بنستعمله عشان النموذج يضل ينتج نتائج متسقة مع الوقت.
temporal IoU
temporal IoU هو نسبة التشابه بين أطر زمنية متتالية، بنقيس فيه قدّيش الحركة أو الكائنات بتتطابق عبر الزمن.
MiMo-V2-Flash
MiMo-V2-Flash مجموعة اختبارات سريعة لتقييم أداء النماذج على مهام متعددة، بنقيس فيها السرعة والدقة مع بعض.
🤖 موديلز 6
MLLMs
يعني نماذج ذكاء اصطناعي متقدمة بتشتغل مع أنواع معلومات مختلفة زي النصوص والصور والفيديو وأصوات في نفس الوقت. بنسمع عنها عشان هيدول النماذج بتفهم وتحلل معلومات معقدة أكتر من اللي بتشتغل على نص بس، وبتساعد في تطبيقات ذكية أكتر كفاءة.
Qwen3-VL
Qwen3-VL هو نموذج متعدد الوسائط بيقدر يفهم النص والصورة مع بعض، بنستعمله عشان نحل مشاكل الفهم البصري-النصي.
SWE-Pruner Pro
SWE-Pruner Pro أداة لتقليل وزن النموذج عن طريق حذف الوصلات غير المهمة، بنستعملها عشان النموذج يصير أخف وأسرع.
Character Agent
Character Agent نموذج بيحاكي سلوك شخصية معينة، بنستعمله عشان نخلق حوارات أو ألعاب فيها شخصيات تتصرف بطريقتها.
world model
موديل العالم هو تمثيل داخل الذكاء الاصطناعي للواقع، بيساعد الموديل يتوقع شنو ممكن يصير عشان نخطط أحسن
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
📏 مقاييس 1
accuracy
مقياس بيقيس نسبة الإجابات الصحيحة من إجمالي الأسئلة، عشان نعرف قديش النموذج دقيق
🗂️ بيانات 1
SWE-bench
يعني قياس نموذجاتك على مهام هندسة البرمجيات الحقيقية، وشو قادر يحل من المشاكل البرمجية بشكل صحيح. بنستخدمه عشان نتفرج إذا النموذج فعلاً نافع للمبرمجين.
كل المصطلحات ←
العدد السابقشو في AI؟ | 20 يوليو — نموذج متعدد الوكلاء 20
📚 كل الأعداد