📡 أحدث عدد

شو في AI؟ | 12 يوليو — LLM متعدد الوسائط واللغات

يومي 📅 2026-07-12
سلام 👋 هلقيت هالعدد مليان بأحدث التطورات بالذكاء الاصطناعي، من تحسين LLM للغات قليلة الموارد لحد توليد فيديوهات متعددة الوسائط. بدنا نركز على كيف التقنية عم تدمج بين النصوص، الصور والفيديو لتفتح فرص جديدة للباحثين والمنتجين.
#1

تدريب LLM للغة Pharo: تحسين إكمال الكود للغات قليلة الموارد

Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo
الفريق بيشرح كيف قدروا يجيبوا LLM يشتغل على لغة Pharo، اللي هي لغة برمجة قليلة الموارد. بنوا خط أنابيب من جمع بيانات خاصة بـ Pharo، ثم استمروا بتدريب مسبق وتعديلات دقيقة على نماذج LLM المفتوحة. كمان صمموا مجموعة من الـ benchmarks لتقيس إذا النموذج يتقن صياغة الكود ويكمل الشيفرة المموهة من مستودعات GitHub. النتائج بتبين إن النماذج المتخصصة بـ Pharo تتفوق بكتير على النماذج الأصلية وحتى على نماذج أكبر كثير في إكمال كود Pharo.
ليش بتهمّك؟: هالنتيجة بتعطي مبرمجي Pharo أدوات إكمال كود أقوى وأسرع، وبتقربهم من تقنيات الذكاء الاصطناعي الحديثة.
🌱 شو إلك منها؟
تخيّل إنك عم تكتب كود بلغة Pharo ويظهر لك اقتراحات ذكية تشبه ما تشوفه على هاتفك لما تكتب رسالة. هالاقتراحات بتخليك تكتب أسرع وتقلل الأخطاء، وبتكون متوفرة مباشرةً داخل بيئة التطوير اللي بتستعملها كل يوم. يعني رح تشوف تحسين واضح بكتابة البرامج حتى لو ما كنت خبير بالذكاء الاصطناعي.
code completion LLM low-resource languages Pharo software engineering hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

ARDY: توليد حركة بشرية تفاعلية بالتمثيل الهجين

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
الورقة بتقدّم ARDY، إطار توليد حركة 3D بشرية بيشتغل بشكل مباشر وبيستقبل أوامر نصية وفواصل حركية. النظام بيستخدم تمثيل هجين يجمع ميزات الجذر الصريحة مع تمثيل مخفي للجسم، وبيعتمد على محوّل autoregressive لتقليل الوقت وزيادة التحكم. تدرب على مجموعة ضخمة من بيانات الحركة، وبيظهر أداء عالي على HumanML3D وBones Rigplay. كمان عرضوا demo تفاعلي يخلّي المستخدم يتحكم بالحركة عبر الماوس ولوحة المفاتيح.
ليش بتهمّك؟: هالطريقة بتخلّي توليد الحركة الواقعية سريع ومرن، يعني ممكن نستخدمها بألعاب أو روبوتات تفاعلية بلا تأخير.
🌱 شو إلك منها؟
تخيّل إنك عم تلعب لعبة أو تشوف شخصية تتحرك حسب كلامك، هالطريقة بتخلي الحركة تتولد لحظيًا وتستجيب لأوامرك. زي ما بتقلب القناة وتختار الأغنية، هلق تقدر تختار حركة الشخصية بكلمة أو بسحب الفأرة. هالشي رح يطلع بألعاب الفيديو، تطبيقات الواقع الافتراضي، وحتى برامج الأنيميشن.
motion generation diffusion interactive AI human animation benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

تحليل الانتباه خطوة بخطوة في توليد النصوص المتعددة الوسائط

Attending to Multimodal Generation One Token at a Time
فريق Gupta وزملاؤه بيستكشفوا كيف انتباه النماذج الكبيرة متعددة الوسائط بيتغيّر كلمة بكلمة خلال عملية التوليد. قدموا مهام بتحتاج تبديل صريح بين الصورة والنص داخل استجابة وحدة، ولاحظوا إن الانتباه للصورة بيقوى بالمواضع اللي فيها معلومة بصرية، وإن الانتباه للتعليمات بيرجع وقت التحولات. جربوا حجب انتباه سببي لتأكدوا من دور هالأنماط، وبعدها اقترحوا تعديل بسيط وقت الاختبار يعزز الانتباه للوسيط المناسب، ولقوا تحسين واضح بأداء المهام المتعددة الوسائط.
ليش بتهمّك؟: هالتحليل بيفتح الباب لتحسين دقة النماذج المتعددة الوسائط عبر ضبط انتباهها بالوقت المناسب، وبيساعدنا نفهم أكتر كيف بتشتغل داخل دماغ الآلة.
🌱 شو إلك منها؟
بتخيل إنه التطبيق اللي بيترجم صورة لفيديو أو بيكتب وصف لصورة رح يصير أذكى، لأنه بيعرف إمتى يطلع من النص ويطّلع على الصورة. يعني إذا كنت عم تستخدم برنامج يكتب لك وصف للصور، رح تشوف أوصاف أدق وأقل أخطاء. هالتحسين رح ينعكس على تطبيقات مثل المساعدين الرقميين أو أدوات التصميم اللي بتعتمد على الفهم المشترك بين النص والصورة.
multimodal attention language models interpretability generation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

شوف قبل ما تقفز: تقطير بحث الشجرة لتقييم الأفعال في نماذج VLA المجمدة

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
الفريق اكتشف إنه الفشل بالموديلات اللي بتدمج الرؤية واللغة والفعل مش بس من توليد الأفعال، كمان من تقييمها. عملوا إطار اسمه SVA بيستعمل Monte‑Carlo tree search لتجربة كل الخيارات الممكنة بالمحاكاة، وبعدين يضغط هالمعلومات بنموذج Q‑value خفيف بيتوقع نتيجة كل فعل. وقت التنفيذ، الموديل المجمد بيقترح مجموعة أفعال، والنموذج المتعلم بيختار الأنسب بدون ما يحتاج محاكي. النتيجة إنه النماذج بتحقق نجاح أعلى بمهام ما شافتها قبل، وبسرعة أكبر من تكبير حجم الموديل.
ليش بتهمّك؟: هالطريقة بتحافظ على قدرة النموذج العامة وبترفع نسبة النجاح بالمهمات الجديدة بدون تكلفة تدريب إضافية.
🌱 شو إلك منها؟
تخيل إنه برنامج ذكي يقدر يجرب كل الخطوات الممكنة قبل ما يقرر، زي ما بنعمل تجربة على ورق قبل ما نكتب. هالشي بخلي الروبوتات أو المساعدات الرقمية يختاروا القرار الأنسب بسرعة، فبتصير أكثر فاعلية بمهام البيت أو الشغل. ممكن تشوف هالتحسين بالمساعدات اللي بتساعدك بتنظيم يومك أو بالأجهزة الذكية اللي بتتعامل مع البيئة حولك.
VLA Monte-Carlo Tree Search Q-value embodied AI evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

مركز JD Oxygen AI للمنتجات: حل صناعي مبني على LLM/VLM

JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
الفريق قدم منصة صناعية اسمها Oxygen AIIC لتوليد وإدارة معلومات المنتجات على نطاق ضخم. المنصة مبنية على LLMs/VLMs وبتعتمد أربع ركائز: هندسة أونتولوجيا بتعاون بشري‑آلي، عمارة "Semantic Search then Discrimination" (S2D) لتحديد المعرفة، نماذج LLM/VLM تتعلم ذاتيًا، ومركز بيانات موحّد. النتيجة إنه النظام بيقدر ينتج مكتبة معرفية لآلاف المليارات من الـ SKUs بدقة 94.2% واسترجاع 82.8%، وبيشتغل على Huawei Ascend NPUs لمعالجة مئات الملايين من التحديثات يوميًا.
ليش بتهمّك؟: هالورقة بتظهر كيف ممكن نستخدم LLM/VLM لتقليل تكاليف إدارة منتجات التجارة الإلكترونية وترفع جودة التجربة للمستهلكين.
🌱 شو إلك منها؟
تخيّل إنه عندك محل إلكترونيات وتحتاج تصنّف وتضيف معلومات عن آلاف السلع كل يوم؛ هالنظام بيشتغل مثل مساعد ذكي يفرّق بين المنتجات بسرعة ويملأ البيانات تلقائيًا. هالشي بيساعد المتاجر الكبيرة مثل JD إنهم يقدّموا منتجات مرتبة وواضحة للزبائن، وبيقللوا الأخطاء اللي ممكن تصير وقت الإدخال. ممكن تشوف أثره في محركات البحث داخل المواقع أو توصيات المنتجات اللي بتظهرلك يوميًا.
LLM VLM e-commerce knowledge graph ontology hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

RuleChef: نظام قواعد قابل للتعديل من LLM

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules
الفريق قدم إطار اسمه RuleChef بيستغل LLMs لتوليد قواعد تنفيذية للمهام اللغوية مثل تصنيف النصوص، التعرف على الكيانات (NER)، أو استخراج العلاقات. القواعد بتتولد من وصف المهمة ومجموعة أمثلة معنونة، وبنعدلها بشكل تكراري بناءً على أمثلة إضافية ورد فعل بشري على القواعد الموجودة. كمان ممكن نستخدم RuleChef لتوليد قواعد أولية من أزواج الإدخال‑الإخراج لأي نموذج موجود. العملية بتعتمد على LLM بس وقت التدريب، والناتج نظام قواعد سريع، حتمي، وقابل للفحص، وإحنا أطلقنا الكود كمصدر مفتوح تحت رخصة Apache 2.0.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة الكبيرة تنتج حلول سريعة وقابلة للفحص بدل ما تكون صعبة الفهم أو تعديلها.
🌱 شو إلك منها؟
تخيل إنك بدك تصنّف إيميلاتك أو تكتشف أسماء الأشخاص بنصوصك، وبدون ما تحتاج برنامج معقّد، بتستعمل قواعد بسيطة ممكن تشوفها وتعدلها بيدك. هالقواعد بتشتغل بسرعة وبشكل ثابت، يعني ما رح يطلعلك نتائج غريبة كل مرة. بتلاقي هالتقنية ضمن أدوات مجانية على الإنترنت ممكن تستفيد منها مباشرة.
LLM rule-based NLP open-source classification hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

الرؤية كإنتاج موحد متعدد الوسائط

Vision as Unified Multimodal Generation
فريق Xiaoyang Han وزملاؤه قدموا SenseNova-Vision، نموذج موحد بيحوّل كل مهام الرؤية إلى توليد نص أو صورة عبر أوامر لغة طبيعية. ما في حاجة لهياكل خاصة لكل إشي؛ بس تعطيه تعليمات أو إشارة بصرية، وهو يطلع لك النص أو الصورة المطلوبة. تدربوا على SenseNova-Vision Corpus اللي حولت كل الأنهتيشنات لعينات تعليم‑استجابة، فالنموذج قدر يغطي الكشف، OCR، التقسيم، تقدير العمق وغيرها. التجارب ورّيت إن النموذج الواحد يقدر يضاهي الأنظمة المتخصصة.
ليش بتهمّك؟: هالورقة بتخلينا ندمج قدرات الرؤية داخل نماذج أساسية بدون ما نكتب كود خاص لكل مهمة، يعني بنوفر وقت ومجهود كبير للباحثين والشركات.
🌱 شو إلك منها؟
تخيّل إنه تطبيق على موبايل يقدر تشوف صورة وتكتب له طلب مثل "أظهر لي كل السيارات الحمراء" ويرجع لك صورة أو نص يوضح المواقع. هالشي بيسهّل على الناس تنظيم صورهم أو استخراج معلومات من المستندات بسرعة. ممكن نشوف هالتقنية ضمن تطبيقات الفوتوغرافيا أو أدوات البحث البصري اللي بنستعملها يوميًا.
multimodal vision generation foundation-models instruction-following hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

تسريع توليد شروح الفيديو المتعددة باستخدام Parallelized Autoregressive Decoding

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
الفريق قدم إطار عمل جديد يخلّي توليد شروح الفيديو dense يشتغل بشكل متوازي بدل ما يكون خطوة بخطوة. الفكرة إنه الأحداث اللي ما فيها اعتماد قوي على بعضها يقدروا يتولّدوا بنفس الوقت، بينما داخل كل حدث يظل التوليد تسلسلي لتضمن التماسك. استخدموا آلية تخطيط عالمية مخفية تتعلم بنية الأحداث وتدمج المعاني السمعية والبصرية، وآلية فكّ الترميز المتوازية حسب الأحداث. التجارب على عدة benchmarks بيّنت إنه الطريقة مش بس أسرع، كمان بتحسّن جودة الشروح.
ليش بتهمّك؟: هالطريقة بتقلل زمن توليد شروح الفيديو الكثيفة، فبتخلي التطبيقات اللي تحتاج رد فعل سريع أَسرع وأدق.
🌱 شو إلك منها؟
تخيل إنك عم تشوف فيديو طويل وتطبيق يكتبلك ملخص لكل مشهد فورًا، هالطريقة بتخلي هالملخص يطلع أسرع بكتير. يعني بدل ما ينتظر التطبيق ثواني طويلة، رح يكتبلك النصوص خلال لحظات، زي ما بنكتب ملاحظات بسرعة. ممكن تشوف هالتحسين بالمساعدات الذكية على الموبايل أو في منصات الفيديو اللي بتعطيك شرح فوري للمحتوى.
video captioning multimodal parallel decoding efficiency dense captioning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

DrugGen-2: نموذج لغة واعٍ بالمرض لتسريع اكتشاف الأدوية

DrugGen 2: A disease-aware language model for enhancing drug discovery
الفريق قدم DrugGen-2، نموذج توليدي بيستند على GPT-2 ومُدرب على مجموعة بيانات فيها أدوية معتمدة مرتبطة بأمراضها وبروتينات الأهداف. استخدموا طريقة من خطوتين: fine‑tuning إرشادي وبعدين reinforcement learning عبر GRPO، مع مكافآت بتحافظ على صلاحية الجزيء، الجدة، التنوع، وتوقع ارتباط قوي. لما جربوه على خمس بروتينات مرتبطة بالاعتلال الكلوي السكري، طلعوا أحسن بكتير من نماذج DrugGPT وDrugGen القديمة، وصنعوا جزيئات أقرب للأدوية المعتمدة وتوقعوا ارتباطات أعلى. التحليل بالـ docking أكد إنه في مركبات بتوصل لتوقعات ارتباط أقوى من أدوية مرجعية مثل enalapril.
ليش بتهمّك؟: هالطريقة بتخلّي تصميم أدوية جديد يراعي المرض نفسه، فبيسرّع البحث عن علاجات أكتر دقة وفعالية.
🌱 شو إلك منها؟
تخيّل إنه برنامج كمبيوتري يقدر يقترح أدوية جديدة بناءً على المرض اللي عندك، مش بس على الجزيء. هالشي ممكن يخلّي صيدليات المستقبل تلاقي علاجات أسرع وبأقل تكلفة، يعني ممكن تشوف دواء جديد للسكري أو أي مرض قريبًا. هالتقنية عم تتطور وبتظهر على منصات بحوث مثل Hugging Face، فممكن تصادفها وانت تقرأ عن أدوية جديدة على الإنترنت.
drug discovery language model GPT-2 reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

نحو انتباه خطي: تسريع الـ Transformer على النصوص الطويلة

The Key to Going Linear: Analysis-Driven Transformer Linearization
الورقة بتحكي عن مشكلة إنه تكلفة الـ self-attention بتصير تربيعية وبتبطّئ تشغيل الـ Transformer على نصوص طويلة. الباحثين ركّزوا على تصميم تحديث الحالة ضمن نظام ثابت، ولقوا إنه الـ softmax بيعتمد على إسقاطات متعامدة من رتبة‑1 مرتبطة بالمفتاح، وهالشي بيفسر ليه الشبكات من نوع delta بتتفوق على التجميع البسيط. كمان حددوا مصدر أخطاء التقريب وقدّموا تدخلات هي sink tokens، short convolutions، وfixed‑budget cache routing لتقليل الفجوة. جربوا الطريقة على نماذج LLaMA وQwen لحد 32B ومعاها حسّنوا النتائج على MMLU وتوصلوا لأداء مشابه للأنظمة المعقدة للـ caching.
ليش بتهمّك؟: هالطريقة بتخلي الـ Transformers يشتغلوا أسرع على نصوص طويلة من غير ما يضيعوا جودة الفهم، يعني بنقدر نستفيد من نماذج ضخمة بوقت أقل.
🌱 شو إلك منها؟
تخيل إنك عم تقرأ قصة طويلة أو عم تسأل شات بوت عن تفاصيل كتيرة، هالتقنية بتخلي الرد يطلع أسرع وأقل تأخير. يعني بدل ما يطول عليك الوقت لتجهيز النص، بتصير التجربة سلسة زي ما بتكون مع تطبيقات المراسلة الفورية. هالشي ممكن تشوفه بأدوات الدردشة الذكية أو خدمات الترجمة اللي بتعتمد على نماذج لغة كبيرة.
linearization transformer efficiency LLM benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

OpenCoF: توليد فيديو لتسلسل التفكير (Chain‑of‑Frame)

OpenCoF: Learning to Reason Through Video Generation
الفريق قدم OpenCoF، إطار عمل فيه مجموعة بيانات OpenCoF-17K فيها فيديوهات مهيأة لتسلسل التفكير عبر 11 عيلة مهام، وجابوا نموذج Wan‑CoF مدرب خصيصًا لهالنوع من التفكير. بالمقارنة مع قاعدة Wan2.2‑I2V‑A14B، Wan‑CoF حقق تحسينات ملحوظة على أربع معايير لتقييم التفكير بالفيديو. كمان جربوا إضافة توكنات بصرية ونصية تساعد النموذج يلتقط إشارات بصرية دقيقة وفهم نصّي عالي لتقوية الاستدلال عبر الزمان والمكان.
ليش بتهمّك؟: هالورقة بتظهر إنه إعطاء النموذج إشراف زمني متنوع وتوكنات مخصصة بيقوي قدرته على التفكير بالفيديو، وهاد مهم لتطبيقات الذكاء الاصطناعي اللي بدها تحل مشاكل معقدة عبر المشاهد المتحركة.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يتفرج على فيديو ويستنتج شو رح يصير بعدين، زي ما بنشوف أفلام الخيال العلمي. هالتقنية ممكن تساعدنا نطور تطبيقات مثل المساعدة في التعليم أو التنبؤ بالمشاكل بالمنزل قبل ما تصير. إذاً، ممكن تشوف هالشي ينعكس بأدوات ذكية بتفهم الفيديوهات وتقدّم نصايح أو حلول فورية.
video generation reasoning dataset computer vision arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

كيف البيانات بتحدد ترددات RoPE

How Data Shapes RoPE Frequency Usage: From Positional Scale Matching to Length Generalization
الورقة بتشرح ليش نماذج الـ transformers بتستعمل ترددات RoPE بطريقة غير متساوية. الباحثين لقوا إن الترددات اللي بتختارها النماذج بتطابق بنية المسافات النسبية بالبيانات اللي تدربت عليها، يعني كل تردد بيشتغل كعدسة موضعية. بناءً على هالشي، بيظهر إن الترددات المتوسطة‑المنخفضة باللغات الطبيعية ناتجة عن اعتماد اللغة على اعتمادات متعددة المقاييس. كمان بيبينوا إن تقليل الترددات وقت الاختبار بيوسّع “المجال” وبيخلي النموذج يقدر يتعامل مع نصوص أطول إذا كانت الاعتمادات بتكبر بنفس النسبة.
ليش بتهمّك؟: الفهم هاد بيسمح لنا نعدل النماذج لتشتغل مع نصوص أطول بدون ما نعيد تدريبها من الصفر.
🌱 شو إلك منها؟
تخيل إنك عم تقرأ قصة طويلة، النموذج عادةً بيضل ينسى تفاصيل من أول النص. هالدراسة بتورجي إنه إذا عدلنا طريقة تمثيل المواقع بالكلام، النموذج بيقدر يضل متابع للمعنى حتى لو النص أطول. يعني ممكن نلاقي تطبيقات مثل ملخصات المقالات الطويلة أو شات بوتات تحكي معك لفترة أطول.
RoPE transformers language-models length-generalization positional-embeddings arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

قصر الذاكرة الكامن: استدلال للسيطرة عبر Variational Inference التلقائي

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference
الفريق Zhu وزملاؤه قدموا طريقة اسمها Latent Memory Palace (LMP) بتنظّم المعلومات بمساحة كامنّة تشبه قصر الذاكرة، والبحث فيها بيصير تكراري وبيتكيف مع المهمة. بيستغلوا الفكرة إنّ الاستدلال للسيطرة ينعكس كـ variational inference مع توزيع كامنّ autoregressive. من خلال تقنية reinforcement learning في الفضاء الكامن، قدروا يطوّروا بوليصة LMP‑π بتظهر أداء قوي بالمحاكاة وعالم الواقع، وكمان بتوزّع حسابات الاختبار بشكل مفهوم. كمان استخرجوا tokenizer بطول متغيّر اسمه LMP‑tok، بيحسّن سياسات autoregressive الجاية.
ليش بتهمّك؟: هالطريقة بتخلّي سياسات التحكم تتعلم تفكّر وتخطط بطريقة أعمق، فبتقربنا من تطبيقات روبوتات أكتر دقة ومرونة.
🌱 شو إلك منها؟
تخيّل إنّ الروبوت يقدر يخطط لحركته زي ما بنرتّب أغراضنا ببيت الذاكرة، يعني كل خطوة بتاخد وقتها وبدقة. هالطريقة بتخلي الروبوت يشتغل بأقل استهلاك للطاقة ويعطيك نتيجة أسرع، مثل ما بتلاقيها بتطبيقات الملاحة الذاتية أو الألعاب. يعني إذا استعملتها، ممكن تشوف روبوتات أو سيارات ذاتية القيادة تتصرف بذكاء أكتر ببيئات معقّدة.
reinforcement learning variational inference control latent models autoregressive arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

DiaLLM: كيف نقرّب اللغات من لهجاتنا

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation
الفريق بقيادة Jordan Painter قدموا DiaLLM، نموذج لغة بيستمر يتدرب على International Corpus of English وبعدين بيطبق أساليب تدريب بعدية ضمنية وصريحة مع ثلاث استراتيجيات لتوفيق النموذج. هالطريقة سمحت لهم يقارنوا تأثير هالخطوات على لهجات إنجليزية أسترالية، هندية وبريطانية شمالية. النتائج بتبين إن القدرة على الفهم باللهجة وإنتاجها شي مختلف: المعايير التقليدية بتقيس الفهم بس، بينما التوفيق بيغيّر طريقة الإنتاج بطريقة ما بتظهر بالمعايير. التدريب الصريح المستهدف بيوصل نتايج معترف فيها كلهجات ومفضلة على التوفيق العريض، بس الطريقة اللي بتطوّع المكافأة أقوى ما بتنال إعجاب البشر.
ليش بتهمّك؟: هالورقة بتفتح باب لتوليد نصوص بلهجات محلية، الشي اللي بيخلي التطبيقات أدفى وأقرب للناس.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع مساعد ذكي يكتبلك ردود باللهجة الهندية أو الأسترالية، مش بس بالإنجليزي الأمريكي. هالشي بيخلي التواصل أسهل وأقرب للثقافة اليومية، وممكن تشوفه بالـ chatbots أو التطبيقات اللي بتترجم أو بتكتب محتوى للمنصات الاجتماعية.
dialect adaptation language models continual pretraining alignment evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

ProjAgent: استرجاع التشابه الإجرائي لتوليد الكود على مستوى المستودعات

ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
فريق Chen وزملاؤه قدموا ProjAgent، نظام لتوليد الكود بيوظّف إشي اسمه التشابه الإجرائي كإشارة استرجاع جديدة. النظام بيقسم الدالة المطلوبة لخطوات منطقية وبستعمل workflow وكيلّي (agentic) ليلاقي دوال بالمستودع بتشتغل بطريقة مشابهة بكل خطوة. بعدين بدمج هالمعلومات مع الاسترجاع الدلالي التقليدي، وبضيف حلقة تغذية راجعة ثابتة (static‑analysis) لتصليح الكود اللي بيطلع من المترجم. التجربة على مجموعة REPOCOD أظهرت إن ProjAgent وصل 41.14% Pass@1، يعني أداء أحسن من الطرق اللي بتعتمد على الاسترجاع بس.
ليش بتهمّك؟: هالطريقة بتخلّي توليد الكود أكتر دقة وتقلل الأخطاء اللي بتظهر بسبب الاعتماد على تشابه الأسماء بس.
🌱 شو إلك منها؟
تخيل إنك بدك تكتب برنامج وتلاقي كود جاهز يشتغل معك من غير ما تحتاج تقرأ كل ملفات المشروع. ProjAgent بيساعدك تلاقي هالكود بسرعة ويصلحه إذا فيه مشاكل، زي ما بنظّف البيت قبل ما نضيف ديكور جديد. هالشي بيظهر لك لما تستخدم أدوات برمجة ذكية أو منصات تطوير تدعم توليد الكود تلقائيًا.
code generation retrieval procedural similarity static analysis arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

SolarChain-Eval: معيار فيزيائي لتقييم الوكلاء الاقتصاديين الموثوقين في أسواق الطاقة اللامركزية

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets
الفريق قدم SolarChain-Eval، benchmark بيجمع بين قيود فيزيائية وتقييم للثقة بالوكلاء الاقتصاديين. بيصيغ حوكمة السوق كـ Markov Decision Process متوافق مع Gymnasium، وبيخلي الوكلاء يتخذوا قرارات كل ساعة. بيقيس كل سياسة على كذا بُعد: فائدة السوق، السلامة الفيزيائية، الانزلاق، سلاسة الفعل، العدالة المكانية، وقابلية التدقيق. كمان ضمّوا طبقة Planner/Auditor مبنية على LLM لتحديد حدود الفعل ومراجعة الإجراءات الخطرة وتسجيل كل خطوة بسجلات منظمة. التجارب بين سياسات ثابتة وعشوائية ومحدودة النظر وRL وRL+LLM بيورجّوا إنه في توازن واضح بين الفائدة والسلامة، وإنه الـ LLM بيساعد بس ما بيقدر يعوّض عن مكافأة غير مضبوطة.
ليش بتهمّك؟: لأنه الوكلاء الذكيين اللي بيشتغلوا بأسواق الطاقة لازم يكونوا موثوقين وما يعرّضوا الشبكة لمخاطر فيزيائية أو اقتصادية.
🌱 شو إلك منها؟
هالورقة بتساعد نضمن إنه الأنظمة الذكية اللي بتدير بيع وشراء الطاقة من الألواح الشمسية ما بتخرب الكهربا ولا بتصنع كهربا وهمية. تخيّل إنه عندك تطبيق يخلّيك تبيع surplus الطاقة للحي، وبيحافظ على استقرار الشبكة وما بيخلي أحد يستغل البيانات. هالشي رح يبينك قريباً في تطبيقات الطاقة الذكية على موبايلك أو بيتك.
benchmark agents energy markets trustworthiness RL arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

تعقيدات الذكاء الاصطناعي الحواري المتمحور حول المريض

The complexities of patient-centred conversational artificial intelligence
الفريق اللي بيضم João Matos وزملاؤه حللوا أكتر من 2000 محادثة حقيقية بين مرضى وشات بوتات صحية. طوّروا محاكي مريض بيفصل بين المحتوى السريري، الحالة العاطفية، استراتيجية الحوار، وأسلوب الكلام. التقييم اللي عملوه مع 15 مقيّم بشري بيّن إنه المحاكاة قريبة كتير من الواقعية، لأن الدقة وصلت 55% بس. كمان جربوا أربع نماذج LLM لتقييم أولوية الحالات وشافوا إنه أسلوب التواصل بيغيّر النتيجة كثير.
ليش بتهمّك؟: هالنتيجة بتورجي إنه لازم نطور شات بوتات صحية بتفهم تنوع طريقة كلام المرضى لتقليل الأخطاء وتفادي التمييز.
🌱 شو إلك منها؟
إذا استخدمت تطبيق شات للطب، ممكن يطلع لك تشخيص غير دقيق إذا ما قدر يفهم طريقة كلامك أو مشاعرك. زي ما الواحد بيفهم حكي صديقه إذا كان مبسوط أو متوتر، الشات بوت لازم يظبط حالته. هالتحسين رح يخلّي الخدمات الصحية الرقمية أأمن وأقرب للناس اللي بتستعملها كل يوم.
healthcare conversational AI LLM patient simulation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

الفجوة في وصول السياق: كيف بتأثر على تعاملنا مع الوكلاء

The Context Access Divide: Interaction-Level Architecture as a Complementary Dimension of Agentic Inequality
الباحث ماساهيرو فوجيتا بيقدّم فكرة جديدة اسمها Context Access Divide (CAD) لتوضح الفرق بين نظام بيسترجع السياق تلقائيًا من ملفات المستخدم (Dynamic Context Retrieval) ونظام بيحتاج يرفع المستخدم المستندات يدويًا (Manual Attachment). بيشرح كيف هالفارق بيصير عائق كبير للعمال اللي عندهم آلاف الملفات، لأنهم بيضطروا يجهزوا السياق بنفسهم. كمان بيعرض نموذج احتمالي مبني على دراسات الفان إيفكت بيوضح إن الإرفاق اليدوي بيقلل فرص نجاح المهمة مع زيادة حجم الكوربس وتعقيدها، بينما الأنظمة الديناميكية ما بتتأثر بهالشي. الدراسة بتربط هالفجوة ببروتوكول Model Context Protocol (MCP) وهياكل retrieval-augmented generation (RAG) وتناقش أثرها على توزيع الشغل وتوجيه منصات الذكاء الاصطناعي.
ليش بتهمّك؟: هالمفهوم بيفتح عيوننا على نوع جديد من عدم المساواة اللي بيأثر على إنتاجية الناس اللي بيعتمدوا على الذكاء الاصطناعي بالعمل اليومي.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع مساعد ذكي، إما هو يعرف كل ملفاتك ويجيب لك المعلومات لحالو، أو لازم كل مرة ترفع الملف اللي بدك إياه. هالشي بيخلي الشغل أسهل أو أصعب حسب إذا النظام بيسترجع السياق أو لا. هالفرق ممكن تحسه بأدوات مثل ChatGPT مع خاصية رفع ملفات أو تطبيقات إدارة المستندات الذكية.
agentic inequality context retrieval RAG knowledge work AI governance arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

التعلم المعزز لضبط الـ Trigger في الـ Large Hadron Collider

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider
الفريق قدم طريقة RL لتعديل عتبات الـ trigger بوقت الحقيقي بالمصادم. الوكيل ياخد ملخّصات سريعة من تدفق البيانات ويحدّث العتبات لتزيد كفاءة الإشارة وتظل الخلفية ضمن حدودها. جربوا طريقتين من GFPO (GFPO‑F و GFPO‑FR) على سيناريوهات محاكاة وبيانات حقيقية من CMS وشافوا تحسين واضح بنسبة ٤٨٪ للـ H_T و٢٨٪ للـ AD، مع رفع كفاءة الإشارة كمان.
ليش بتهمّك؟: هالطريقة بتخلي التحكم بالـ trigger أذكى وأسرع، وبتقلل الفاقد بالبيانات اللي ممكن تكون مهمّة للفيزياء الأساسية.
🌱 شو إلك منها؟
تخيّل إنه عندك نظام بيفتح أو بيقفل باب بيتك حسب حركة الناس حوالين البيت، بس هالمرة هو بيشتغل على بيانات الجسيمات. هالذكاء بيساعد العلماء يلقوا إشارات نادرة أسرع، يعني ممكن يكتشفوا جزيئات جديدة قبل ما يضيعوا وقت على بيانات مالها فائدة. هالتحسين رح ينعكس على تجارب في CERN وتطبيقات مستقبلية للذكاء الاصطناعي بالفيزياء.
reinforcement-learning LHC trigger physics RL hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

ذكاء الذاكرة النشط للوكيل في مهام طويلة الأمد

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
الفريق قدم memory agent منفصل يشتغل جنب الaction agent الأصلي، وبيحدّث structured memory bank من آخر خطوات المهمة. الmemory agent بيقرر إذا يضيف تذكير مبني على الذاكرة أو يظل صامت، يعني ما بيقاطع الaction agent إلا إذا كان فعّال. الطريقة plug‑and‑play واشتغلت مع وكيلين مختلفين على Terminal‑Bench 2.0 وτ^2‑Bench، وزادت pass@1 بحوالي 8.3 و6.8 نقطة بالمقارنة مع غيرها. كمان درّبوا نموذج Qwen3.5‑27B على SETA باستخدام SFT وGRPO وحصلوا على تحسين بالreward وتعميم جزئي على Terminal‑Bench.
ليش بتهمّك؟: الذاكرة النشطة بتقوّي الوكلاء إنهم يفتكروا معلومات مهمّة حتى لو طولت المهمة، فبيحسّنوا اتخاذ القرار بفعالية أكبر.
🌱 شو إلك منها؟
تخيل إنك عم تشتغل على مشروع طويل وبتنسى تفاصيل مهمة مع الوقت؛ هالطريقة بتخلي البرنامج يذكّرك بأهم النقاط وقت ما تحتاجها. يعني بدل ما يضل يدوّر بالمعلومات القديمة، بيعطيك تنبيه واضح. هالشي ممكن تشوفه قريباً بأدوات المساعدة الذكية أو الروبوتات اللي بتساعدك في الشغل اليومي.
agents memory long-horizon benchmarks model hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 13
💡 مفاهيم 6
fine-tuning
تدريب إضافي لنموذج موجود بالفعل على بيانات جديدة وخاصة عشان يكون أفضل في مجال معين. يعني بدل ما نبني نموذج من الصفر، بنأخذ واحد موجود ونحسّنه. بنسمع عنه عشان بيوفر وقت وموارد كتير.
diffusion
diffusion هو مفهوم بنستخدمه بنماذج توليد الصور، بيبدأ بصورة عشوائية وبعدين يضيف خطوات تصحيح تدريجية عشان يوصل للصورة المطلوبة.
attention
الـ attention هو آلية بتخلي النموذج يركز على أجزاء معينة من النص وقت ما بيولد أو يفهم، يعني بنقول له يركز على الإشي المهم.
test-time intervention
الـ test-time intervention هو تعديل بنعمله على النموذج وقت الاختبار، مش وقت التدريب، عشان نحسن الأداء
Monte Carlo Tree Search
Monte Carlo Tree Search هو خوارزمية بحث بتستكشف خيارات اللعبة أو القرار عن طريق محاكاة عشوائية، بنستعملها عشان نختار أفضل خطوة، احنا بنشوفها في الذكاء الاصطناعي للألعاب
VLA
VLA هو مفهوم بيمثل Attention مع متجهات طولية (Vector Length Attention) لتقليل تعقيد الحسابات، بنسمع عنه لأنه بيخلي الـ Transformers أسرع.
🤖 موديلز 4
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
autoregressive transformer
هالنموذج بيولد نص خطوة بخطوة بناءً على الكلمات اللي قبله، بنسمع عنه عشان هو الأساس لتوليد الكلام والكتابة الآلية
MLLMs
يعني نماذج ذكاء اصطناعي متقدمة بتشتغل مع أنواع معلومات مختلفة زي النصوص والصور والفيديو وأصوات في نفس الوقت. بنسمع عنها عشان هيدول النماذج بتفهم وتحلل معلومات معقدة أكتر من اللي بتشتغل على نص بس، وبتساعد في تطبيقات ذكية أكتر كفاءة.
Q-value model
Q-value model نموذج بيحسب قيمة الـ Q لتقييم جودة الفعل في التعلم المعزز، بنسمعه عشان يحدد أي خطوة أحسن للوكيل
📏 مقاييس 1
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
🗂️ بيانات 2
HumanML3D
HumanML3D هو مجموعة بيانات بتجمع حركات جسم الإنسان ثلاثية الأبعاد، بنستعملها عشان نعلم الموديلات كيف تتصرف بطريقة طبيعية.
Bones Rigplay
Bones Rigplay مجموعة بيانات فيها إطارات حركة عظام (rig) للأنيميشن، بنستفيد منها لتدريب موديلات تحكم بالحركة.
كل المصطلحات ←
العدد السابقشو في AI؟ | تجميع الأسبوع 11 يوليو — نماذج أخف وفيديو من موبايلك
📚 كل الأعداد