مرحبا 👋 في هذا العدد بنستعرض أحدث الأبحاث والتقنيات بالذكاء الاصطناعي، مع تركيز على التقطير الذاتي وتطوير الوكلاء
#1
ResearchStudio-Reel: أوتوماتيكيا تحويل الورقة للملصق والفيديو والمدونة
ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
الفريق اللي قدّمه Lingao Xiao وزملاؤه بيقترحوا نظام اسمه ResearchStudio-Reel يدمج كل خطوات تحويل الورقة العلمية لملصق، فيديو، ومدونة ضمن عملية واحدة. النظام بيستخرج محتوى الورقة مرة وحدة وبعدين يشارك هالمحتوى مع ثلاث مولّدات تنتج كل وحدة منتج قابل للتعديل مثل PowerPoint أو Word. بعدين بيجمعهم بطبقة تفاعلية بتخلي كل جزء يشتغل مع التاني بنقرات بسيطة. التجربة على معيار Paper2Poster أظهرت إن الملصقات اللي بيطلعها النظام أحلى وأدق من الأنظمة السابقة ومعاها جودة عالية للصور والنصوص.
ليش بتهمّك؟: هالورقة بتقصر الوقت والجهد على الباحثين لتوصيل نتائجهم بأكثر شكل جذّاب ومتعدد القنوات.
🌱 شو إلك منها؟
تخيّل إنك تكتب ورقة علمية وتحتاج تحوّلها لملصق يشرح الفكرة، وفيديو قصير يشرحها، ومدونة تفصيلية، كلّها بنقرة زر. هالنظام بيعمل هالشيء أوتوماتيكياً، فبتوفر عليك ساعات من الشغل اليدوي. ممكن تشوف النتيجة مباشرة على موقع أو تطبيق يدمج كل هالعناصر مع بعض.
dOPSD: تحسين التفكير في نماذج اللغة diffusion عبر التقطير الذاتي
dOPSD: On-Policy Self-Distillation for Diffusion Language Models
الفريق Dat وزملاؤه قدموا طريقة dOPSD لتقوية نماذج اللغة diffusion. الفكرة إنه النموذج بيستعمل مسار التشويش الخاص فيه كمرجع للمعلم، بدل ما يعتمد على إشارة خارجية ما بتتوفر وقت الاستنتاج. هالطريقة بتعطي إشراف كثيف على مستوى كل كلمة، وبتقوي قدرته على حل مسائل الرياضيات وتوليد الكود. التجارب على Dream وLLaDA ورجعت إنه dOPSD بتتفوق على أساليب fine‑tuning وRL التقليدية.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج diffusion تتعامل مع أسئلة معقّدة بصورة أحسن، فبتفتح باب لتطبيقات أكتر بذكاء النصوص.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع برنامج يكتب لك حلول رياضية أو كود برمجي بسرعة ودقة أكبر، زي ما بتستفيد من المساعدة الفورية على الموبايل. هالتحسين بيخلي البرنامج يتعلم من نفسه خلال الكتابة، فبيصير أذكى كل ما استخدمته. ممكن تشوف هالتقنية خلف أدوات كتابة الكود أو التطبيقات التعليمية اللي بتعتمد على الذكاء الاصطناعي.
UI-MOPD: تعلم مستمر للوكيل GUI عبر تقطير متعدد المنصات
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
الفريق اللي قادوا الدراسة، Niu Lian وزملاؤه، قدموا Uni-GUI، مجموعة بيانات جديدة فيها تفاعلات GUI عالية الجودة على أكتر من منصة. بعدين طوّروا طريقة UI-MOPD اللي بتستعمل تقطير متعدد المعلمين على‑سياسة (on‑policy distillation) داخل إطار التعلم المستمر، بحيث يختار معلم خاص بالمنصة الحالية وينقل المعرفة للسياسة المشتركة. هالطريقة بتخلي الوكيل يتكيّف مع منصات جديدة من غير ما ينسى القدرات على المنصات القديمة. التجارب على OSWorld وMobileWorld ورّيت إن النجاح وصل لـ 38.2٪ على أول نظام و12.0٪ على الثاني، يعني الطريقة فعّالة بحد ذاته.
ليش بتهمّك؟: هالورقة بتظهر طريقة جديدة لتدريب وكلاء GUI يشتغلوا على أنظمة مختلفة بدون ما يضيعوا اللي تعلموه قبل هيك، وهذا مهم لتطبيقات الأتمتة المتعددة المنصات.
🌱 شو إلك منها؟
تخيّل إنه عندك برنامج بيساعدك تشغّل مهام على الكمبيوتر والهاتف بنفس الوقت، وما بيحتاج يتعلّم كل مرة من الصفر. هالطريقة بتخلي البرنامج يتعلم تطبيق جديد، بس يضلّ يذكر كيف يشتغل على التطبيقات اللي كان يعرفها قبل. ممكن تشوف هالشيّ قدّامك بأدوات أتمتة الروتين اليومي أو مساعدات ذكية على الموبايل والكمبيوتر.
guicontinual-learningdistillationmulti-platformdatasethf
اقرأ المزيد ↗
💬 أضِف تعليقك
#4
Audex: نموذج موحد للصوت والنص
Unified Audio Intelligence Without Regressing on Text Intelligence
الفريق قدم Audex، نموذج لغة كبير موحّد بين الصوت والنص مبني على Nemotron‑Cascade‑2‑30B‑A3B. النموذج يستخدم محوّل Transformer واحد، يحوّل إشارات الصوت لمجال تمثيل النص، ويتعامل مع توكنات النص وتوكنات الصوت المُكمَّدة بنفس الطريقة وقت التوليد. تدربوا على مجموعة ضخمة من بيانات الصوت‑نص (157.4 B توكن صوت و320.5 B توكن نص) عبر مراحل إشرافية، وبعدها استعملوا تقنيات RL وتقطير على سياسات متعددة. النتيجة: أداء قياسي في الفهم الصوتي، التعرف على الكلام والترجمة، تحويل النص إلى كلام وتوليد أصوات، مع الحفاظ على قدرات التفكير والمعرفة للنموذج النصي الأصلي.
ليش بتهمّك؟: الموديل بيوفّر قدرة موحدة تفهم وتولّد صوت ونص بدون خسارة بالذكاء النصي، فهالشي بيقربنا من تطبيقات أكثر تنوعًا وفعالية.
🌱 شو إلك منها؟
تخيل عندك تطبيق يقدر يسمع لك صوتك، يفهم شو قلت، ويعطيك رد صوتي أو نصي بنفس الجودة، كأنك بتحكي مع صديق ذكي. هالنظام بيخلّي الترجمة الفورية أو قراءة النصوص بصوت طبيعي أسهل وأسرع. ممكن تلاقيه قريبًا بخدمات المساعدين الصوتيين أو تطبيقات التعليم اللي بتعتمد على الصوت.
ResearchStudio‑Idea: مجموعة مهارات لتوليد أفكار بحثية مبنية على الأدلة
ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
الورقة بتقدّم ResearchStudio‑Idea، مجموعة مهارات بتساعد الباحثين يبلّشوا فكرة البحث من الصفر بطريقة مبنية على الأدلة. فيها ثلاث مهارات مستقلة: Paper-Search للبحث عن أوراق من مصادر متعددة، Scoop-Check لتأكد من أصالة الفكرة، وIdeaSpark اللي بيوحد كل الخطوات من تجميع الأدلة لحد ما ينتج بطاقة فكرة جاهزة. الفكرة مبنية على 1,947 ورقة من مؤتمرات ICLR, ICML, NeurIPS بين 2021 و2025، وتستخرج 15 نمط فكرية قابلة لإعادة الاستخدام. التقييم الآلي بيظهر إن IdeaSpark بيطلع مقترحات أقوى من الأساسيات أو المهارات العامة.
ليش بتهمّك؟: بتسهل على الباحثين يطلعوا أفكار مدعومة بالأدلة بسرعة وتقلل خطر التكرار.
🌱 شو إلك منها؟
بتخلي الباحث يلاقي فكرة جديدة بسهولة، زي ما تلاقي وصفة طبخ مميزة من كتب الطبخ. الفكرة إنك تجمع شوية معلومات من أوراق سابقة وتطلع بطاقة فكرة جاهزة. ممكن تشوف هالأداة داخل منصات كتابة الأبحاث أو أدوات الذكاء الاصطناعي اللي بتستعملها يومياً.
How Much is Left? LLMs Linearly Encode Their Remaining Output Length
الورقة بتسأل إذا الـLLMs عندها تقدير داخلي لطول الجواب اللي باقي يطلعوا. الفريق درّب probes خطية على hidden states لثلاث موديلات وزنها 7‑8B عبر سبع مجموعات إكمال، ولاحظوا إن الطول الكلي للاستجابة بيتفكّك خطيًا من آخر hidden state قبل ما يطلع أي توكن. كمان الـprobes المدربة على بيانات طبيعية بتنقل للأنهاع التانية من الإكمالات، وحتى على حالات فيها إلغاء وإعادة كتابة الجواب بيظهروا تقدير بيزيد وقت ما الموديل يوقف ويستأنف. النتيجة إن الـLLMs ممكن يكون عندها تمثيل مخطط للكمية المتبقية من الكلام، مش بس عدّ توكنات صعب.
ليش بتهمّك؟: هالنتيجة بتخلينا نفهم كيف الموديلات بتخطط للرد وتساعدنا نتحكم بطول الجواب بشكل أدق.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع بوت وبدك تعرف متى رح يخلص الجواب، هالدراسة بتبين إن البوت ممكن يتوقع طول الرد قبل ما يبلّش. هيك ممكن تخلي التجربة أسرع وتقلل الانتظار. ممكن نشوف هالتحسينات في تطبيقات الدردشة أو المساعدين الصوتيين اللي بنستعملهم كلنا.
استرجاع منقّح vs بحث ويب مفتوح: موازنة التغطية والثقة
Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off
الفريق الأيسلندي قيم خدمة Evrópuvefur قبل الإطلاق، وطلبوا من خبراء يجاوبوا على أسئلة المواطنين باستخدام LLM. جربوا مسارين للاسترجاع: قاعدة معرفة محلية منقّحة (RAG) وبحث ويب مفتوح، وشافوا إن البحث على الويب يجاوب على أسئلة أكتر بس كثير من المصادر كان غير موثوق أو غير ذي صلة. بالمقابل، المصادر المنقّحة كانت موثوقة أكثر لكن عدد الإجابات كان أقل، والنظام رفض يجاوب إذا ما كان عنده معلومات كافية. كمان لقوا إن القوائم الموثوقة في الـprompt ما غيرت كثير نسبة الاقتباس من هالمصادر.
ليش بتهمّك؟: النتائج بتساعد صانعي الخدمات العامة يختاروا بين تغطية أوسع أو موثوقية أعلى حسب احتياجات المواطنين.
🌱 شو إلك منها؟
لما تسأل بوت حكومي عن شيء، ممكن يجيب لك من قاعدة بيانات موثوقة أو من الإنترنت كله. القاعدة الموثوقة تعطيك إجابات أدق لكن ممكن ما تلاقي إجابة على كل سؤال، أما الإنترنت يجاوب على أكتر بس مرات يجيب معلومات غير صحيحة أو قديمة. هالشي بيظهر لك لما تستخدم تطبيقات حكومية أو خدمات استفسار على الويب.
OrbitQuant: تقليل حجم Diffusion Transformers بدون بيانات
OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
فريق Lee وزملاؤه قدموا OrbitQuant، طريقة لتقليل حجم نماذج Diffusion Transformers للصور والفيديو بدون الحاجة لبيانات معايرة. الفكرة إنهم يدوّروا الأوزان والنشاطات بقاعدة مُعَدَّلة بحيث كل إحداثي يظل ثابت مهما تغير المشهد أو النص المرافق. بهالطريقة، كود‑بوك واحد من نوع Lloyd‑Max بيكفي كل الخطوات والطبقات، وما في حاجة لتعديل لكل نموذج أو وسيلة. التجربة على نماذج معروفة مثل FLUX.1 وCogVideoX أظهرت أفضل نتائج PTQ بأقل عدد من البتات مع جودة توليد مقبولة.
ليش بتهمّك؟: هالطريقة بتخلي تشغيل مولدات الصور والفيديو بالذكاء الاصطناعي أسرع وأرخص، وبتفتح الباب لتطبيقات على الأجهزة الشخصية.
🌱 شو إلك منها؟
تخيل إنك بدك تولد صورة أو فيديو من نص على موبايلك، هالطريقة بتضغط النموذج بحيث يشتغل بسرعة أكبر وباستهلاك طاقة أقل، زي ما بنضغط صورة عشان تبقى خفيفة لكن ما تتلف. ممكن تشوف هالتحسينات بأطبيقات توليد الصور اللي بتستخدمها يوميًا، خصوصًا إذا صارت أسرع وأرخص.
PixWorld: توحيد توليد وإعادة بناء المشاهد ثلاثية الأبعاد في مساحة البكسل
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
الفريق قدم PixWorld، نموذج واحد بيشتغل على مساحة البكسل لتوليد مشاهد ثلاثية الأبعاد وإعادة بنائها بنفس الوقت. بدل ما نستخدم تمثيلات مخفية (latent) ونحتاج VAE أو RAE، بيتم الإشراف على عملية الـ diffusion مباشرة على الصور المرسومة، وهالشي بيقلل فقدان المعلومات. كمان ضافوا خسارة إدراك هندسي بتستفيد من نموذج أساسي ثلاثي الأبعاد مدرب مسبقاً لتوجيه الفهم الهندسي. النتائج تبين إن PixWorld يتفوق على طرق الـ latent‑space بالجيل ويواكب أحدث طرق الإعادة بناء من حيث الدقة.
ليش بتهمّك؟: هالطريقة بتخلّي إنشاء وإعادة بناء المشاهد ثلاثية الأبعاد أسهل وأدق، وبتقصر الوقت والموارد على الباحثين والمطورين.
🌱 شو إلك منها؟
تخيّل إنك ترفع صورة لغرفة أو منظر طبيعي، وتطلع لك نسخة ثلاثية الأبعاد جاهزة للعب أو تعديل. النموذج بيقدر يخلق مشاهد جديدة من لا شيء وكمان يترجم صور حقيقية إلى نماذج ثلاثية الأبعاد، يعني ممكن تشوف تطبيقات بالألعاب، التصميم الداخلي، أو الواقع المعزز على موبايلك. هالشي رح يصير جزء من التطبيقات اليومية اللي بنستعملها لتخطيط البيت أو تجربة منتجات بواقع ثلاثي الأبعاد.
LLM-as-a-Verifier: A General-Purpose Verification Framework
الفريق بقيادة Jacky Kwok وزملاؤه بيقدّموا إطار جديد اسمه LLM-as-a-Verifier بيساعدنا نتحقق من صحة الحلول بدون ما نحتاج ندرب نموذج جديد. الطريقة بتعطي تقييمات مستمرة عن طريق حساب توقعات توكنات التقييم، وبهالطريقة بنقدر نزود دقة التقييم بزيادة تفاصيل الدرجات، وتكرار الفحص، وتقسيم المعايير. جربوا الإطار على مجموعة من الـ benchmarks مثل Terminal‑Bench V2 وSWE‑Bench Verified وحققوا أرقام قياسية. كمان بيستعملوا الإطار لتقليل تكلفة اختيار أفضل حل وتقديم ملاحظات غنية للـ RL.
ليش بتهمّك؟: هالإطار بيخلّي تقييم حلول الوكلاء أصح وأدق، وبيسرّع تحسين الأنظمة الذكية.
🌱 شو إلك منها؟
تخيّل إنك عم تحل مسألة رياضية وتبعت حلّك للكمبيوتر يشيك إذا هو صحيح ولا لأ. هالأداة بتعمل هالشي بسرعة وبدقة، وبتعطيك ملاحظات تفصيلية تساعدك تحسّن حلّك. ممكن تشوف هالتقنية بالمستقبل ضمن تطبيقات المساعدة الذكية أو أدوات التعليم.
EvoAgentBench: بنشمارك لتقييم تطور الوكلاء عبر نقل القدرات
EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer
الفريق قدم بنشمارك جديد اسمه EvoAgentBench بيقيس كيف الوكلاء يطوّروا حالهم بنقل القدرات بين مهام مختلفة. بيستخرجوا "Abilities" من تنفيذ الوكلاء وبينظموا إياها بوحدات تشغيلية، بعدين بيعملوا Ability Graph يربط المهام اللي فيها تشابه إجرائي. الاختبار يغطي أربع مجالات: البحث على الويب، التفكير الخوارزمي، هندسة البرمجيات، والعمل المعرفي، مع تقسيم واضح للبيانات للتدريب والاختبار. النتائج بتبين إن نقل القدرات يشتغل بين عائلات النماذج، بس ما في طريقة آلية حالياً بتحقق تحسين دائم بكل الإعدادات.
ليش بتهمّك؟: هالبنشمارك بيساعدنا نفهم ونقوّي قدرة الوكلاء على التعلم من خبراتهم السابقة، مش بس حفظ معلومات، وهاد مهم لتطوير مساعدين ذكيين أكثر فعالية.
🌱 شو إلك منها؟
تخيل إنه المساعد الذكي على هاتفك ما بيكتفي بس يتذكر إجابات، بل بيتعلم كيف ينجز مهام معقدة مثل حجز تذاكر أو كتابة كود، وبيحسّن هالطريقة مع كل مرة بيستخدمها. هالشي بيخلي تجربة الاستخدام أسرع وأسهل، لأن المساعد بيصير يعرف أفضل الطرق للإنجاز من تجارب سابقة، وبيظهر هالتحسن في التطبيقات اليومية مثل تطبيقات البحث أو تنظيم المواعيد.
تأمين النصوص بالمياه: Watermarking انتقائي للـ LLM
Selective Disclosure Watermarking for Large Language Models
الفريق قدم طريقة جديدة اسمها Hierarchical Vocabulary Routing (HeRo) لتطبيق watermarking على النصوص اللي بتطلع من الـ LLM. الفكرة إنه بيتم تقسيم المفردات لهياكل متدرجة وبيوزعوا فيها معلومات الميتاداتا، فكل verifier يقدر يقرأ الجزء اللي إلو صلاحية بس، من غير ما يضطر يفضح باقي الرسالة. الطريقة بتحافظ على عشوائية توليد النص، يعني الجودة ما بتتأثر، وكمان بتوصل دقة كشف عالية وزمن استجابة منخفض.
ليش بتهمّك؟: هالطريقة بتعطي تحكم أدق بالخصوصية وبتقلل مخاطر كشف معلومات ما لازم تنكشف.
🌱 شو إلك منها؟
تخيل إنه برنامج كتابة بيضيف علامة سرية ما حدا يقدر يشوفها إلا إذا إلو إذن خاص، هالشي بيخلي خصوصيتك أأمن. زي ما بنحط قفل على باب البيت بس بنعطي مفتاح للناس اللي بنثق فيهم، هالتقنية بتسمح للجهات الموثوقة تشوف جزء من الرسالة بس. ممكن تشوف هالتقنية بنظام حماية المحتوى أو في تطبيقات التحقق من النصوص على الإنترنت.
OptiAgent: نموذج متعدد الوكلاء لتصميم الصيغ الرياضية
OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement
الفريق قدم OptiAgent، إطار عمل فيه مجموعة من الوكلاء يشتغلوا سوا لتوليد صيغة رياضية جاهزة للsolver من وصف نصّي لمشكلة بحوث العمليات. كل وكيل بيستخرج بنية المشكلة، زي المتغيّرات والقيود، وبيسمح بتصحيح ذاتي من خلال حلقات فيدباك متعددة. صممنا أربع آليات فيدباك متخصصة لتصحيح إشي من سوء الفهم أو عيوب بنيوية أو تناقضات رياضية أو أخطاء بالكود. النتيجة وصلت لأفضل أداء على 3 من 4 benchmarks للـLP، MILP، والبرمجة غير الخطية، وبنفس الوقت بيخلي العملية شفافة وممكن نراجعها.
ليش بتهمّك؟: هالورقة بتسهل على الباحثين والمطورين يبنوا نماذج تحسين بسرعة وبشفافية، بدون ما يضيعوا وقت بإصلاح الأخطاء يدوياً.
🌱 شو إلك منها؟
تخيّل إنك بدك تحل مشكلة توزيع موارد، بدلاً ما تكتب المعادلات يدوياً، OptiAgent بيحوّل كلامك مباشرة لصيغة جاهزة للكمبيوتر. يعني إذا بدك تخطّط لمشروع أو تدير مخزون، البرنامج بيقلك كيف تحلّه بسرعة. هالشي ممكن تشوفه قريباً بأدوات تخطيط الأعمال أو تطبيقات إدارة المخزون.
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
الفريق قدم OmniOpt، وهو مسح شامل ومجموعة تجارب قياسية للمحسّنات اللي بنستعملها بتدريب النماذج الكبيرة. حطوا كل خطوة من تحديث المحسّن كتحويل منظم ضمن خط أنابيب من خمس مراحل، ولاحظوا إن أغلب الطرق بتستعمل مرحلة أو اثنتين بس. كمان استخدموا norm‑constrained linear minimization oracles (LMOs) لتوحيد طرق المحسّنات، وصمموا تصنيف ثنائي الأبعاد بيحدّد عائلة الآلية والهدف التدريبي اللي بتحسّنّه. أخيراً، سووا benchmark عبر مجالات مختلفة من نماذج اللغة لتصنيف الصور، ودرسوا كل عائلة على أهداف تدريبية متعددة لتبيّن المميزات والعيوب.
ليش بتهمّك؟: هالورقة بتساعد الباحثين يختاروا المحسّن الأنسب لتقليل وقت التدريب وتحسين الأداء.
🌱 شو إلك منها؟
تخيّل إنك عم تحضر أكلة وتحتاج توابل معينة لتطلع بأحلى طعم؛ OmniOpt هو مثل دليل الوصفات اللي بيوضح لك أي توابل (محسّن) تناسب كل أكلة (نموذج) لتطلع بأسرع وأحلى نتيجة. هالشي بيسهّل على المطوّرين إنهم يختاروا الطريقة الصح لتدريب التطبيقات اللي بنستعملها يوميًا، مثل المساعدات الصوتية أو تطبيقات الترجمة.
Wan-Streamer v0.2: Higher Resolution, Same Latency
فريق Huang وزملاؤه قدموا Wan-Streamer v0.2، نسخة مطوّرة من نموذج التفاعل السمعي‑بصري اللي بتشتغل بنظام البث المباشر. النسخة الجديدة بترفع دقة الفيديو من 192×336 لـ 640×368 بدون ما تزيد زمن الاستجابة، لحد 200 ms على 25 FPS. النظام حافظ على هيكلية "المفكّر‑المؤدي": المفكّر يظل على GPU واحد للمعالجة السريعة، بينما المؤدي يشتغل على مجموعة GPU متعددة بنمط Ulysses لتوليد الفيديو عالي الدقة. البحث ظهر على Hugging Face Daily Papers وجمع 16 upvote، وهو preprint على arXiv.
ليش بتهمّك؟: هالترقية بتخلّي التطبيقات اللي تحتاج تفاعل بصري سريع، مثل المساعدين الافتراضيين أو الألعاب التفاعلية، يقدروا يعرضوا تفاصيل أوضح من غير ما يتأخروا بالمستخدم.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع مساعد ذكي على الموبايل، وبيظهرلك الفيديو بوضوح تفاصيل إيديك ونظرتك، وكل هالشي بلا أي تأخير. يعني الفيديو بيصير كأنه مكالمة فيديو عادية بس مع تفاصيل أكتر. هالشي ممكن تشوفه قريبًا بخدمات مثل تطبيقات الواقع المعزز أو ألعاب الفيديو اللي بتعتمد على الكاميرا.
GigaWorld-1: خريطة لبناء نماذج عالم لتقييم سياسات الروبوت
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
الباحثين قدموا دراسة منهجية لنماذج العالم كبدائل لتقييم سياسات الروبوت، وعملوا benchmark اسمه WMBench مبني على بيانات تحكم يدوي للروبوتات ومقارنات بين سياسات حقيقية ومحاكاة. حللوا 7 نماذج فيديو، 4 طرق تمثيل للأفعال، وأكثر من 324 000 تجربة محاكاة، ولقوا إن جودة التقييم بتعتمد على استمرارية الأفعال على مدى طويل مش على الواقعية البصرية القصيرة. استنتجوا إن التدريب المسبق لازم يوازن بين معرفة العالم العامة وقدرة التحكم الخاصة بالروبوت، وإن اختيار بنية النموذج وتشفير الأفعال بيلعبوا دور كبير. بناءً على هالنتائج صمموا GigaWorld-1، نموذج عالم مخصص لتقييم السياسات، ونشروا كل الكود والبيانات لتسهيل البحث.
ليش بتهمّك؟: هالورقة بتعطي طريقة أسرع وأرخص لتقييم الروبوتات قبل ما نجرّبها بالحقيقة، فبنقلل الوقت والتكلفة.
🌱 شو إلك منها؟
تخيّل إنك بدك تشوف إذا الروبوت يقدر يخلّص مهمة قبل ما تشتريه أو تدفع على تجارب مكلفة. هالموديل بيقدر يحكي لك إذا الروبوت رح يشتغل تمام من غير ما تحتاج تحطّه على أرضية المصنع. يعني ممكن تشوف هالتقنية في تطبيقات مثل تقييم الروبوتات المنزلية أو الصناعية قبل ما توصل للزبون.
world modelsroboticsevaluationbenchmarkfoundation modelshf
اقرأ المزيد ↗
💬 أضِف تعليقك
#17
تحسين النماذج القوية عبر التقطير المباشر على السياسة (Direct-OPD)
Weak-to-Strong Generalization via Direct On-Policy Distillation
هالورقة بتستكشف طريقة جديدة لتقوية نموذج لغة كبير باستخدام نموذج أصغر تدرب على RLVR. الفكرة إنه بدلاً من نعيد RL على النموذج القوي، بنستفيد من إشارة التغيّر اللي تعلمها النموذج الضعيف بعد RL وننقله مباشرة للنموذج القوي عبر Direct On-Policy Distillation. الطريقة بتقارن سياسات ما قبل وما بعد RL للمعلم الضعيف وبتستعمل الفرق كـ reward ضمنّي للطالب القوي، من غير ما نحتاج نبني نموذج reward صريح ولا نعيد RL مكلف. التجارب أظهرت إنه هالطريقة رفعت أداء Qwen3-1.7B من 48.3% لـ 62.4% على اختبار AIME 2024 خلال 4 ساعات بس على 8 بطاقات A100.
ليش بتهمّك؟: لأنها بتقلل تكلفة تحسين النماذج الكبيرة وتخلّي الاستفادة من RL أكتر فعالية وسرعة.
🌱 شو إلك منها؟
تخيل إنك عندك سيارة صغيرة تتدرب على سواقة في شوارع ضيقة، بعد ما تتقن السواقة، بنعطي نفس الخبرة للسيارة الكبيرة لتصير أسرع وأقوى من غير ما نعيد التدريب من الصفر. هالطريقة ممكن تشوفها بالمساعدات الذكية اللي بتحسّن قدراتها بسرعة من خلال تعلم تجارب أصغر. يعني إذا بتستعمل تطبيقات كتابة أو ترجمة، ممكن تصير أذكى وأدق بوقت أقصر.
SalAngaBhava: مجموعة بيانات سِنْهالا لتحليل المشاعر على مستوى الجوانب
SalAngaBhava: A Sinhala Market Dataset for Aspect-based Sentiment Analysis
يا جماعة، الباحثين Lakshani Galwatta وزملاؤه قدموا SalAngaBhava، مجموعة بيانات سِنْهالا جديدة لتحليل المشاعر على مستوى الجوانب. البيانات فيها مراجعات منتجات سِنْهالا مع تحديد المصطلحات المرتبطة بكل جانب وتصنيف المشاعر إلى إيجابي، سلبي أو محايد. تم جمعها من تعليقات المستخدمين وتعليمها باتباع إرشادات دقيقة لضمان الجودة، وتحليلهم بيّن إنها متوازنة ومهيأة لتكون benchmark لأبحاث ABSA باللغات القليلة الموارد. البحث ظهر على arXiv ضمن تصنيف cs.CL وcs.LG.
ليش بتهمّك؟: هالورقة بتفتح باب دراسة المشاعر بالسينهالا وبتساعد الباحثين يطوّروا نماذج أدق للغات القليلة الموارد.
🌱 شو إلك منها؟
تخيل إنك تقرأ تقييمات منتجات على الإنترنت وتحب تعرف شو الناس بتحب أو ما بتحب كل جزء من المنتج، هالمجموعة بتخلي الكمبيوتر يقدر يعمل هيك. ممكن تستفيد منها التطبيقات اللي تعطيك توصيات أو تحلل ردود الفعل على منتجاتك. هالتقنية رح تشوفها قريباً في تطبيقات التسوق أو الخدمات اللي بتعتمد على تقييمات المستخدمين.
DataComp‑VLM: benchmark لتجميع بيانات أفضل للنماذج البصرية‑اللغوية
DataComp-VLM: Improved Open Datasets for Vision-Language Models
الفريق قدم DataComp‑VLM، benchmark بيخلّي الباحثين يجربوا استراتيجيات تنقية وتنسيق البيانات لتدريب نماذج الرؤية‑اللغة. جمعوا 160 مجموعة بيانات بأربع أنواع وبنوا كوربس بـ6 تريليون توكن متعدد الوسائط. التجارب بينت إن خلط البيانات، خصوصًا مزيج التعليمات، هو اللي بيوصل لأعلى جودة، وبيساعد يرفع دقة نموذج 8B لـ63.6% على مجموعة 33 مهمة. مقارنةً بـ FineVision، هالنتيجة أعلى بـ5.4 نقطة مئوية.
ليش بتهمّك؟: هالنتيجة بتعطي الباحثين طريقة واضحة لتجميع بيانات أحسن وتدريب نماذج أقوى بأقل جهد.
🌱 شو إلك منها؟
بتخيل إنه إذا بدنا برنامج يقدر يفهم الصور ويتكلم معنا، لازم نعلمه من بيانات منظمة. هالبحث بيورجينا إنه خلط أنواع الصور والنصوص مع تعليمات واضح بيخلي البرنامج أذكى. ممكن تشوف هالتحسينات في تطبيقات الترجمة الفورية للصور أو المساعدين الذكيين على الموبايل.
الفريق اقترح طريقة جديدة اسمها TREK بتستغل التلخيص مش لتقليد النموذج بس لتوسيع نطاق الاستكشاف. الطريقة بتشتغل على مرحلتين: أولاً بتحدد الأسئلة الصعبة اللي ما بيجاوبها النموذج، وبعدين تستدعي حلول موثوقة من معلم خارجي أو من نفس النموذج مع سياق إضافي، وتستخدم forward-KL لتقريب هالحلول للطالب. بعدين بيرجع التدريب العادي باستخدام GRPO. التجربة على مسائل رياضية (AIME) ومهام وكيلية (ALFWorld, ScienceWorld) أظهرت تحسين واضح بالأداء.
ليش بتهمّك؟: TREK بيساعد النماذج تتغلب على الأسئلة الصعبة بسرعة بدون ما تحتاج لتدريب ضخم أو تعديل داخلي للمعلم.
🌱 شو إلك منها؟
بتخيل إنك عم تتعلم حل مسألة رياضية مع معلم بيساعدك خطوة بخطوة، والنظام بيستفيد من هالمساعدة ليصير أحسن بوقت أقصر. يعني إذا استخدمنا هالتقنية، التطبيقات اليومية مثل المساعدات الذكية أو الروبوتات رح تكون أذكى وتقدر تحل مشاكل أكتر صعوبة. رح تشوف هالتحسن بأدوات مثل تطبيقات التعليم أو الألعاب اللي فيها تحديات معقدة.
reinforcement learningpolicy optimizationdistillationteacher modelsbenchmarkarxiv
اقرأ المزيد ↗
💬 أضِف تعليقك
📘 مصطلحات هذا العدد
14
💡 مفاهيم 5
self-distillation
تقنية بنعلم فيها نموذج كبير يدرّس نسخة أصغر من نفسه، عشان نحسّن الأداء مش بنحتاج بيانات جديدة
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
On-Policy Distillation
هالطريقة بنقل فيها المعرفة من نموذج بيتعلم على نفس السياسة (on‑policy) إلى نموذج أصغر أو أبسط، يعني بنخلي الـteacher يعلّم الـstudent مباشرةً خلال التدريب. بنستعملها مش لتقليل حجم النموذج بس كمان لتسريع التعلم.
continual learning
تعلم مستمر، النموذج بيضيف مهام جديدة بدون ما ينسى اللي تعلمه قبل، بدنا يبقى معانا طول الوقت
RL
RL يعني Reinforcement Learning، وهو مفهوم بنعلم فيه الموديل يتعلم من خلال التجربة والعقاب عشان يحقق هدف معين، بنسمع عنه لأنه أساس لتدريب الروبوتات والأنظمة الذكية.
🤖 موديلز 7
Claude Code
نموذج من Anthropic بيفهم ويكتب كود برمجي، احنا بنستعمله عشان يسرّع كتابة الإشي البرمجي
VLM
اختصار لـ Vision Language Model، يعني نموذج ذكي بيفهم الصور والنصوص مع بعض. بنسمع عن هاي النماذج كتير الآن عشان بتفتح إمكانيات جديدة في تحليل الصور والفيديوهات.
Paper2Poster
نموذج بيحوّل محتوى الورقة العلمية لملصق بصري، بدنا نعرض شغلنا بسرعة وما نضيع وقت
diffusion language models
نماذج لغة بتستعمل عملية انتشار لتوليد نص، يعني بتضيف ضوضا وتقلّصها لتطلع جمل طبيعية
Audex
نموذج لتوليد أو تحليل الصوتيات، بدنا نستخرج ميزات صوتية أو نخلق أصوات جديدة
Nemotron-Cascade-2-30B-A3B
نموذج لغة كبير بيولد نصوص متقنة، بنستعمله عشان نحل مشاكل الفهم والتوليد
MoE
اختصار لـ Mixture of Experts، يعني نموذج فيه مجموعات من الخبراء المتخصصين كل واحد بيشتغل على جزء معين من المهمة.
🗂️ بيانات 2
Uni-GUI
مجموعة بيانات فيها واجهات مستخدم موحدة من تطبيقات مختلفة، بنستعملها لتدريب نماذج تفهم الGUI
OSWorld
داتا تحاكي بيئات أنظمة تشغيل، بتساعد نماذج الذكاء الاصطناعي تتفاعل مع أوامر النظام بسهولة