📡 أحدث عدد

شو في AI؟ | 15 يوليو — تحسين أمان وكفاءة LLMs

يومي 📅 2026-07-15
سلام 👋 في هالعدد من نشرة الذكاء الاصطناعي، بدنا نعرض أحدث التطورات اللي بتعزز أمان وكفاءة نماذج اللغة الكبيرة. رح نركز على تقنيات المكافآت الفورية، تقييم الأخلاق، وتحسين الذاكرة بالحوارات الطويلة.
#1

SpectraReward: تحويل MLLMs المدربة مسبقًا إلى نماذج مكافأة فورية لتوليد الصور

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
الفريق المقترح SpectraReward بيشتغل بدون ما يحتاج لتدريب إضافي؛ بيحوّل MLLM مدرب مسبقًا إلى نموذج مكافأة فورًا لتوليد الصور عبر قياس مدى قدرة الصورة على استرجاع النص الأصلي. بيستعمل متوسط احتمال النص المشروط على الصورة كالمكافأة، فبيستفيد من توافق الصورة والنص الموجود بالموديل من غير ما نحتاج لعلامات تفضيل أو تعديل على نموذج المكافأة. كمان قدموا Self‑SpectraReward، حالة خاصة بتخلي فرع الفهم بالموديل نفسه يكون هو المكافأة للفرع اللي بيولد الصورة، يعني حلقة مغلقة بتحسّن الأداء من غير أي نموذج مكافأة خارجي. التجارب أظهرت تحسين واضح عبر موديلات انتشار مختلفة، خوارزميات RL متعددة، وعدة MLLM من أحجام مختلفة، وتفوقت على طرق المكافأة السابقة.
ليش بتهمّك؟: هالطريقة بتخلينا نحصل على صور توليدية أدق وأقرب للطلب بدون ما نحتاج لبيانات تقييم مكلفة أو تعديل نماذج المكافأة.
🌱 شو إلك منها؟
تخيل إنو برنامج يرسم لك صورة بناءً على كلامك، وبيتحقق إذا الصورة فعلاً بتعكس كلامك قبل ما يكمّل الرسم؛ هالشي بخلي الصور تطلع أقرب للطلب وتقل الأخطاء. هالتقنية رح تظهر بأدوات توليد الصور اللي بنستعملها يوميًا، مثل التطبيقات اللي بتعطيك رسومات من أوصافك.
reward modeling multimodal text-to-image reinforcement learning diffusion hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

هل الوكلاء الذكائيين بيعرفوا متى المهمة بسيطة؟

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
الفريق يطرح فكرة جديدة اسمها E3 (Estimate, Execute, Expand) لتقليل الجهد الزايد اللي الوكلاء بيقضوه على مهام بسيطة. الفكرة إن الوكيل يقدّر صعوبة المهمة أولًا، ينفّذ أقل مسار ممكن، وبس يوسّع الشغل إذا ما نجح التحقق. جربوا الطريقة على benchmark اسمه MSE‑Bench ولقوا إنها توصل لنفس نسبة النجاح بأقل تكلفة، توفّر 85% من الموارد وتقلل عدد الملفات المقروءة بأكثر من 90%. كمان جربوها على gpt‑4o مع مكتبة مفتوحة المصدر وطلعت أسرع وأقل استهلاكًا للوقت.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء يشتغلوا بذكاء أكتر وتوفر وقت وموارد كثير للمبرمجين.
🌱 شو إلك منها؟
تخيّل إنو برنامج يساعدك تكتب إيميل أو تعدل ملف، بس ما بيقعد يفتح كل ملفات الكمبيوتر بلا داعي. هالطريقة بتخلي البرنامج يشتغل بسرعة ويستهلك طاقة أقل، فبتلاقيه يخلص شغلك أسرع. ممكن تشوف هالتحسينات في أدوات تعديل الكود أو المساعدات الذكية على الإنترنت.
agents task-awareness efficiency benchmark LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

تحسين تحكم تخزين الطاقة الحراري عبر تعزيز التعلم المعزز للنماذج التحليلية

Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control
الفريق شيويدا وزملاؤه استغلوا طريقة جديدة اسمها RLVR لتدريب نموذج تفكيري مفتوح الوزن على جدولة تخزين الطاقة الحراري بالمباني. حوّلوا قيم أفعال البرمجة الديناميكية (DP) إلى مكافآت كثيفة لكل خطوة، وتدربوا على 30 سؤال بس، فالنموذج صار يحدد إعدادات المضخة الحرارية كل ساعة من حالة نصية وتوقعات. النتيجة إن الانبعاثات انخفضت من 70.5 كغ إلى 61.2 كغ‑CO2، قريبين من optimum تبع DP. كمان شافوا إن GPT‑5 يقترب من DP وMPC بدون تدريب خاص، بينما GPT‑4o ما بيستفيد من التفكير ويطلع أسوأ من الوضع بدون تخزين.
ليش بتهمّك؟: هالطريقة بتخلي التحكم في تخزين الطاقة بالعمارات أقرب للواقع وبتقلل الانبعاثات بدون ما نحتاج بنية تحتية معقدة أو تدريب كبير.
🌱 شو إلك منها؟
بتخيل إنو نظام التدفئة والتبريد ببيتكم يقدر يقرر متى يشغل المضخة لتقليل الفاتورة، متل ما بنظّموا جدول شغل الكهربا بالمنزل لتقليل الفاتورة. هالطريقة بتخلّي الأجهزة تتصرف بحكمة أكتر، وبتظهر قريبًا بخدمات التحكم الذكي بالطاقة اللي بنستعملها على تطبيقات الطاقة المنزلية.
reinforcement-learning energy-management scheduling LLM TES arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

هل فعلاً لازم نماذج عاطفية متعددة الوسائط أكبر من 1B بارامتر؟

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?
الفريق قدم Light-MER، إطار خفيف لتعرف على المشاعر من الفيديو والصوت والنص، بيعتمد على knowledge distillation لينقل المعرفة من نموذج كبير للمعلم إلى طالب بأقل من مليار بارامتر. حطوا استراتيجيتين جديدتين: خسارة optimal transport بتجمع بين Sliced Wasserstein Distance ومحاذاة الحالات المخفية، واستراتيجية multi-reward مبنية على GRPO لتوازن بين الدقة والسرعة. التجارب على تسع benchmark datasets بيّنت إن Light-MER يحقق state-of-the-art مع تحسين كبير بكفاءة الاستدلال، يعني بيشتغل أسرع وبموارد أقل.
ليش بتهمّك؟: لأنو النموذج الصغير بيقدر يشتغل على الروبوتات والهواتف بدون ما يبطّئ أو يستهلك طاقة كتير، وبيخلّي تطبيقات التعرف على المشاعر واقعية أكتر.
🌱 شو إلك منها؟
تخيّل إنك تشغّل تطبيق على موبايلك يقدر يقرأ مزاجك من الفيديو أو الصوت بسرعة، وما يستهلك بطارية ولا يخلّي الجهاز يعلق. هالشي بيساعد مثلاً في تطبيقات الصحة النفسية أو الألعاب اللي بتتفاعل مع شعورك. رح تشوف هالتقنية بمجالات مثل تطبيقات المساعدة الصوتية أو الروبوتات المنزلية اللي بتفهم مشاعرك لحظيًا.
multimodal emotion recognition knowledge distillation lightweight models arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

إجابة الفيديو المدعومة بالأدلة (Evidence-Backed Video QA)

Evidence-Backed Video Question Answering
الفريق قدم مهمة جديدة اسمها Evidence-Backed Video Question Answering (E‑VQA)، بتطلب من النموذج يجاوب على سؤال عن فيديو وبنفس الوقت يعطي دليل بصري دقيق – مقاطع زمنية وقناع تتبع للأجسام. عشان يدعموا المهمة، عملوا benchmark أول مرة بشركة بشرية اسمه ST‑Evidence بيقيس grounding على مستوى البكسل. بعدين بنوا مجموعة بيانات ضخمة اسمها ST‑Evidence‑Instruct فيها 160k مثال لتدريب النماذج على ربط الإجابة بالفيديو. لما عملوا fine‑tuning لنماذج Video LLM على هالبيانات، حصلوا على تحسينات كبيرة مقارنةً بـ UniPixel.
ليش بتهمّك؟: هالورقة بتظهر إنو تحسين الفهم البصري للـ Video LLM بحتاج دليل مو بس إجابة نصية، وهاد بيفتح باب لتطبيقات أكثر موثوقية.
🌱 شو إلك منها؟
تخيل إنك تسأل فيديو على يوتيوب سؤال، والنظام ما يجاوب بس بكتابة، بل يوريك اللحظة اللي استند عليها الجواب. هالشي بيساعد الناس يتأكدوا إنو الجواب صحيح وما فيه غلط. ممكن تشوف هالميزة بالمستقبل بأدوات البحث أو المساعدة الذكية.
video QA grounding dataset multimodal LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

AdvancedMathBench: معيار جديد لتوليد وإثبات الرياضيات المتقدمة

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification
الباحثين قدموا AdvancedMathBench، مجموعة اختبار جديدة لتقييم قدرة الـLLMs على توليد وإثبات مسائل رياضية متقدمة، من مستوى البكالوريوس لحد اختبارات الدكتوراه. المجموعة فيها ProverBench مع 296 سؤال وتقييم دقيق للبرهان عبر خط أنابيب verification آلي مدرب على تعليقات خبراء. كمان ضافوا VerifierBench اللي فيه 888 مسار برهان مولد من النماذج لتقييم إذا النموذج بيقدر يميّز بين برهان صحيح وخاطئ ويعطي تفسير منطقي. التجارب أظهرت إن حتى أقوى نموذج موجود، GPT-5.5-xhigh، لسه بعيد عن إنجاز الأداء المطلوب على هالمستوى المتقدم.
ليش بتهمّك؟: لأن هالمعيار بيفتح الباب لتطوير نماذج تفهم وتبرهن رياضيات معقدة، مش بس تحل مسائل بسيطة.
🌱 شو إلك منها؟
تخيل إنك تحكي لابنك أو بنتك عن حل مسألة رياضية صعبة وتقدر تشوف إذا الحل منطقي ولا فيه أخطاء، هالشي رح يصير أسهل مع هالتقنية. يعني بدل ما ننتظر أستاذ رياضيات يراجع كل حل، النموذج يقدر يشيّك ويعطيك شرح واضح. ممكن نشوف هالقدرة تنعكس بأدوات تعليمية أو تطبيقات مساعدة للطلاب على الإنترنت.
math benchmark proof-generation verification LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

FormalAnalyticGeo: إطار عصبي‑رمزي لتوليد مسائل التحليل الهندسي المتعدد الوسائط

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation
الفريق قدم FormalAnalyticGeo، إطار عصبي‑رمزي بيولد مسألة تحليل هندسي متعدّدة الوسائط من غير أي تدخّل بشري. الإطار بيستعمل لغة وسطية اسمها CDL لتوصيل النص الحر مع رسم دقيق عبر محرك SDF، وبيمرّ على أربع مكوّنات LLM: مولّد المسائل، محوّل النص لـ CDL، مقاس للجواب، ومُتحقق الجودة. بعد ما يطلع الرسم، بيقيس الجواب بصورته وبيتحقق من الجودة بثلاث مراحل، وبيعيد العملية إذا صار شي غلط. هالطريقة انتجت مجموعة AnalyticGeo7K فيها أكتر من 7 آلاف مسألة موثقة.
ليش بتهمّك؟: هالورقة بتعطينا بيانات دقيقة لتدريب نماذج تفهم وتولد مسائل رياضية بصور ورسومات، وبتقربنا من تطبيقات تعليمية ذكية.
🌱 شو إلك منها؟
تخيل إنك عم تتعلم الهندسة وتلاقي تمارين مع رسومات دقيقة وحلول جاهزة، هالشي رح يساعدك تتقن الفهم أسرع. هالنظام بيصنع هالتمارين أوتوماتيكياً، فممكن يطلع على تطبيقات تعليمية أو مواقع تدريبية. يعني ممكن تشوفه بأدوات بتساعدك تحل المسائل بالهاتف أو على الإنترنت.
multimodal geometry dataset LLM generation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

MET: أخلاق متعددة اللغات مبنية على نظرية وثقافة

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning
الفريق قدم MCLASH، معيار جديد لتقييم الفهم الأخلاقي عبر لغات وثقافات مختلفة، بدل ما يترجم بس. كمان جابوا طريقة MET اللي بتاخد خطوة اختيار أسس ثقافية ونظرية قبل ما يجاوب، وكل هالشي بيصير باللغة الأصلية للمستخدم. بعدين سووا MET-D، مرحلة تدريبية بتستفيد من نفسها بدون ما تحتاج إشراف خارجي، وطلعت تحسينات واضحة على عدة نماذج.
ليش بتهمّك؟: هالورقة بتفتح باب لتطبيقات أخلاقية أكثر دقة وتناسب ثقافات المستخدمين، مش بس للإنجليزي.
🌱 شو إلك منها؟
تخيل إنك عم تستعمل تطبيق يقدّم نصائح أخلاقية أو يجاوب على أسئلة حساسة، وبيفهم ثقافتك ولغتك من غير ما يخلط بين القيم. هالشي بيخلي المساعدة تكون أقرب للواقع اليومي، متل ما بنستشير صديق من نفس البلد. رح تشوف هالتقنية بأدوات الدردشة أو الخدمات اللي بتعتمد على الذكاء الاصطناعي وتتعامل مع قضايا أخلاقية.
multilingual ethics benchmark prompting distillation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

إنذار صامت: بروتوكول J‑Space لتقييم أمان النماذج

Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels
الباحثين قدموا بروتوكول JADR اللي بيفحص تمثيل النموذج داخل مساحة Jacobian (J‑space) قبل ما يولّد أول كلمة. لكل سؤال وبكل طبقة، بنسجّل أهم الرموز ونجمعها ضمن ستة محاور سلوكية، وبنقارن بين عينة خطر وعينة آمنة. ما بنحتاج نموذج حكم خارجي؛ العملية بتصير محلياً على تنشيطات النموذج، وبيتم التقييم باستخدام مقياس SafetyAUC مع فواصل ثقة. جَرّبوا الطريقة على ستة نماذج مختلفة وبثلاث مستويات تمثيل وزن (BF16, INT8, INT4) وشافوا فرق واضح بين الآليات الداخلية للسلامة.
ليش بتهمّك؟: هالبروتوكول بيسمح لنا نكشف ضعف أمان النماذج قبل ما تعطي رد، وبطريقة قابلة للمقارنة بين نماذج مختلفة وتعديلات مثل الـ quantization أو fine‑tuning.
🌱 شو إلك منها؟
تخيّل إنو عندك تطبيق محادثة، قبل ما يرد عليك يتأكد إذا السؤال خطر ولا لا، متل حارس أمان بيشم الرائحة قبل ما يفتح الباب. هالطريقة بتخلي الشات بوتات أأمن وتقلل فرص إنو يجاوب على طلبات ضارة. ممكن تلاقي هالتقنية خلف تحسينات الأمان في التطبيقات اللي بتستعملها كل يوم.
safety evaluation language models quantization Jacobian arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

تعلّم الاستنتاج الميكانيكي للتفاعلات الكيميائية مع LLMs

Learning Mechanistic Reasoning for Chemical Reactions with Large Language Models
الفريق تبع Xingyu Dang وزملاؤه بنوا مجموعة بيانات ضخمة مخصّصة لاستنتاج آليات التفاعلات، وبنوا benchmark صعب اسمه FukuyamaBench مأخوذ من كتاب Fukuyama المتقدّم. بعدين عدّلوا نموذج Qwen3-30B-A3B على هالبيانات، وحققوا نسبة تطابق مسار كامل 8.3% على مجموعة FukuyamaBench Set A، يعني أكتر من نموذج FlowER اللي وصل 5.1%. هالنتيجة بتبين إنّ التدريب اللي بيركّز على الآلية بيقوّي الفهم الكيميائي للـ LLMs.
ليش بتهمّك؟: هالورقة بتقوّي قدرة النماذج اللغوية على تفسير التفاعلات خطوة بخطوة، فبتقلل الأخطاء والخيالات غير الواقعية في التنبؤات الكيميائية.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع مساعد ذكي يشرحلك كل خطوة بتفاعل كيميائي، مش بس يطلعلك النتيجة النهائية. هالشي بيساعد الطلاب والباحثين يفهموا العملية أكتر، وبيقلل الوقت الضايع بالمحاولات الفاشلة. ممكن تشوف هالتقنية بالمنصات اللي بتقدّم استشارات كيميائية أو أدوات تصميم أدوية على الإنترنت.
LLM chemistry reasoning benchmark fine-tuning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

إعادة بناء المشاهد البشرية 4D من كاميرات قليلة التداخل

4D Human-Scene Reconstruction from Low-Overlap Captures
هالورقة بتقدّم StudioRecon، طريقة جديدة بتعيد بناء مشاهد 4D للإنسان من كاميرات قليلة التداخل. الطريقة بتفصل بين الخلفية والإنسان، وبتستفيد من video diffusion model لتوليد مئات المشاهد الجديدة للخلفية. كمان بتستخدم Gaussian مرن لتجسيد البشر وتربط هوياتهم بين الكاميرات عبر fitting لنقاط المفتاح المتعددة. وأخيرًا، وحدة التحسين المتكررة بتدخل توافق حركي لتقليل العيوب، وبتوصل لأفضل نتائج novel view synthesis على أربع مجموعات بيانات حقيقية.
ليش بتهمّك؟: هالطريقة بتخلّي التقاط الحركة البشرية بدقة عالية ممكن حتى مع عدد قليل من الكاميرات، يعني بنوفر وقت ومجهود بالمشاريع العملية.
🌱 شو إلك منها؟
تخيّل إنك بدك تسجّل فيديو لحفلة أو نشاط عائلي بس مع كاميرتين أو ثلاث، وتطلع فيديو ثلاثي الأبعاد كأنك داخل المشهد. التقنية هاي بتخلي هالشي صاير، لأنّها تعوّض النواقص وتولّد مشاهد من زوايا ما كانت موجودة. ممكن تشوف هالنتيجة بألعاب الواقع الافتراضي أو تطبيقات تعديل الفيديو اللي بنستعملها يوميًا.
4D reconstruction video diffusion novel view synthesis computer vision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

نماذج لغة بلا معرفة مسبقة (KLLM): إشي بيقلل استدعاء الحقائق ويعتمد على الأدلة

Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling
الفريق حذّف أسماء الكيانات من النصوص وقت التدريب، فالموديل ما عاد يقدر يسترجع الحقائق من ذاكرته بسهولة. هالخطوة خلت النموذج ينجح أكتر بأسئلة الجواب من السياق، والتحقق من الحقائق، واكتشاف الهلاوس. كمان بيظهر أداء أحسن بالمعايير اللي تقيس مدى موثوقية النموذج، خصوصاً إذا كان فيه دليل خارجي غير كامل. بالنتيجة، النموذج صار يعتمد على الأدلة الخارجية بدل ما يعتمد على معرفته المدمجة.
ليش بتهمّك؟: هالطريقة بتخلي الموديل أقل هلاوس وأكثر موثوقية لما نعطيه معلومات من بره.
🌱 شو إلك منها؟
تخيل إنو برنامج يجاوب على أسئلتك من الإنترنت بدل ما يعتمد على ذاكرته القديمة، فبيكون أقل غلط. هالشي بيساعدك لما تدور على معلومات حديثة أو دقيقة، مثل حالة الطقس أو أسعار الأدوية. ممكن تشوف هالتحسن بأدوات البحث أو المساعدات الذكية اللي بتعتمد على الإنترنت.
knowledge retrieval language-models grounding calibration arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

تسريع Diffusion Large Language Models: مسح لتقنيات الاستدلال الفعّالة

Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques
الباحثين Gwak وزملاؤه بيستعرضوا كيف ممكن نسرّع نماذج اللغة الكبيرة اللي بتستخدم الانتشار، لأن السرعة ما بتجي بس من توليد متوازي. بيقترحوا إطار لتفكيك زمن الاستجابة ليفصل بين تأثيرات الخوارزمية، البنية، والنظام. بناءً على الإطار، بيرصّوا تقنيات التسريع على ثلاث محاور: ابتكارات خوارزمية، تحسينات بنيوية ونظمية، وتوسيع الحجم وقت الاستدلال. كمان بيعطوا إرشادات لتقييم الأداء بشكل موثوق ويبرزوا التحديات اللي باقي نحلّها.
ليش بتهمّك؟: هالورقة بتساعدنا نفهم وين نركز لتقليل زمن الاستجابة وتطبيق نماذج اللغة الكبيرة بفعالية بالواقع.
🌱 شو إلك منها؟
تخيل إنك عم تستنى رد من برنامج ترجمة أو مساعد ذكي، هالتقنيات ممكن تخلي الرد يجي أسرع بكتير. يعني بدل ما تنتظر دقيقة، ممكن يطلع الجواب بثواني قليلة، وهاد بيظهر أكتر بواجهات التطبيقات اللي بنستعملها يوميًا مثل المساعدات الصوتية أو أدوات الكتابة الذكية.
LLM diffusion inference latency benchmarking arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

PalmClaw: إطار وكيل أصلي على الموبايل

PalmClaw: A Native On-Device Agent Framework for Mobile Phones
الفريق قدم PalmClaw، إطار وكيل يشتغل مباشرة على الموبايل. بيعرّف قدرات الجهاز كأدوات مع معاملات واضحة ونتايج منظمة، وبيحافظ على حدود التنفيذ. التجارب أظهرت تحسين 11.5% بنجاح المهام وتقليل الوقت 94.9% مقارنة بأقوى baseline.
ليش بتهمّك؟: بيخلي الوكلاء يشتغلوا أسرع وأقرب للبيانات الشخصية على الموبايل.
🌱 شو إلك منها؟
تخيل إنو تطبيقات الموبايل تصير تقدر تنفّذ أوامرك بدون ما تلمس الشاشة، متل ما بتقول “ابعتلي رسالة للمدرسة” وتخلص العملية لحالك. هالشي رح يخفّف عليك وقت الكتابة والتنقّل بين التطبيقات. ممكن تشوفه قريبًا بميزات المساعد الصوتي أو تطبيقات الأتمتة على جوالك.
agents mobile LLM framework on-device arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

MemOps: تقييم عمليات الذاكرة على مدار المحادثات الطويلة

MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations
الفريق قدموا MemOps، بنشمارك جديد بيركّز على عمليات الذاكرة خلال محادثات طويلة ومتعددة الجلسات، مش بس على الإجابة النهائية. كل عملية مثل تذكّر أو نسيان أو تعديل بتتوثق بتتبع هيكلي يوضح السبب والهدف والحالة. بنوا مجموعة محادثات موجهة تولّد عمليات الذاكرة مع تتبعها، وجابوا ست فئات من أسئلة اختبار لتقيس الأداء تحت إعدادات دليلية قريبة أو سياق طويل. النتائج بيّنت إن الأنظمة الحالية، سواء كانت تسترجع من قاعدة أو تعتمد على النموذج نفسه، ما زالت تعاني من أخطاء ما بتظهر إلا لما نفحص عمليات الذاكرة نفسها.
ليش بتهمّك؟: لأنو بنقدر نحدد بالضبط وين الذاكرة بتفشل، بنقدر نطور مساعدين ذكيين يذكروا معلوماتنا بدقة عبر الوقت.
🌱 شو إلك منها؟
تخيّل معاي مساعد صوتي يقدر يذكر طلباتك من أسبوعين وتصحح أي غلط قبل ما يرد عليك. هالشي بيخليك ما تنسَى طلباتك أو تعدّلها بسهولة، متل ما بتستعمل ملاحظات على جوّالك. هالتقنية رح تظهر قريبًا بخدمات الدردشة أو التطبيقات اللي بتتعامل معك على مدار أيام أو أسابيع.
memory benchmark LLM long-context evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

فشل LLMs المتعددة في استكشاف بعضها البعض

Multi-Agent LLMs Fail to Explore Each Other
الفريق Choi وزملاؤه بيّنوا إنو الوكلاء المبنيين على LLM ما بيستكشفوا بعضهم بشكل كافي، وبيظهروا سلوكيات قصيرة النظر ومُستقطبة بتقلل من التنسيق وتزيد الندم. عرّفوا مشكلة Multi-Agent Exploration كـ POSG لازم فيها الوكلاء يجرّبوا بعض ليعرفوا قدراتهم. قدموا إطار MACE الخفيف اللي بيركّز على اختيار الشركاء بطريقة منظمة، وبيحسّن الاستكشاف والأداء بالمهمات. كمان أثبتوا نظريًا إنو قيمة الاستكشاف بتزيد كل ما زادت تنوّع الوكلاء.
ليش بتهمّك؟: لأنو بدون استكشاف فعّال الوكلاء ما رح يقدروا يتعاونوا بأمان، وهاد بيحد من تطبيقاتهم الواقعية.
🌱 شو إلك منها؟
تخيل إنو عندك مجموعة من الروبوتات أو التطبيقات اللي لازم تشتغل سوا، بس ما بتعرف شو كل وحدة قادرة عليها، فبدون تجربة متبادلة ما رح يقدروا ينجحوا بالمهمة. هالبحث بيقترح طريقة تخلي هالوحدات تتعرف على بعضها وتشتغل سوا بأداء أحسن. ممكن تشوف هالتحسينات في خدمات الذكاء الاصطناعي اللي بتساعدك بتنظيم المواعيد أو التحكم بالمنزل الذكي.
multi-agent exploration LLM POSG MACE hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

استكشاف البروكسي وتوجيه الإرشاد القابل لإعادة الاستخدام: نهج ما بعد التدريب للـ LLM عبر إشارات تحديث موجهة بالبروكسي

Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
الباحثين قدموا إطار جديد اسمه PUST يخلّي عملية ما بعد التدريب للـ LLM أكثر مرونة وتكلفة أقل. بدلاً من إنّ النموذج الأساسي يتعبّ نفسه بالاستكشاف المكلف، بيستعملوا نموذج خفيف (proxy) كحلبة اختبار لتلاقي سلوكيات عالية المكافأة. بعدين بيستخرجوا إشارة تحسين نسبية من الفرق بين حالة البروكسي الأصلية والنهائية، وينقلوا هالإشارة للنموذج الأساسي لتوجيهه. التجارب على عائلة Qwen3 أظهرت إنّو حتى البروكسي الضعيف يقدر يحسّن النماذج القوية، وبيخلّي الإشارات قابلة لإعادة الاستخدام عبر نماذج مختلفة.
ليش بتهمّك؟: هالطريقة بتقلل استهلاك الحوسبة وتسرّع تحسين النماذج الكبيرة، فبتوفر وقت وموارد للباحثين والشركات.
🌱 شو إلك منها؟
تخيل إنّو عندك سيارة فخمة، بس بدل ما تخلّيها تتعب على طرق صعبة لتتعلم، بنستعمل دراجة صغيرة لتجرب الطريق أولاً، وبعدها نعلّم السيارة كيف تمشي بأمان. هالطريقة بتخلي التطبيقات الذكية تشتغل أسرع وبأقل تكلفة، يعني ممكن تشوف تحسينات أسرع بالمساعدات الرقمية أو أدوات البرمجة اللي بتستعملها كل يوم.
LLM post-training proxy model efficiency modular hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

خدعة الصلابة: الدقة الإجمالية بتخفي تقلبات التنبؤ تحت سياق غير ذي صلة

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context
الفريق Zhang وزملاؤه اكتشفوا إنو مع إنو نماذج اللغة الكبيرة (LLMs) بتظهر متينة لما نضيف سياق غير مهم للمهام، الدقة الإجمالية ما بتتغيّر كتير. بس إذا بنشوف كل مثال لحالو، بنلاقي إنو كلمات عشوائية بتقلب التنبؤات على نسبة صغيرة من الأسئلة، يعني النموذج ممكن ينجح أكتر أو يغلّط أكتر حسب العينة. هالتقلب بيظهر عبر نماذج وبيانات مختلفة، وبيزيد أو يقل حسب طول السياق، قوة الحوسبة وقت الاختبار، ومرحلة تطوير النموذج. النتيجة إنو لازم نقيم موثوقية النماذج على مستوى كل مثال مش بس على المتوسط.
ليش بتهمّك؟: هالنتائج بتنبهنا إنو الاعتماد على الدقة العامة ممكن يخلينا نتغافل عن مخاطر حقيقية بتظهر على أمثلة معينة.
🌱 شو إلك منها؟
تخيل إنو برنامج ترجمة أو محادثة يشتغل تمام مع أغلب الأسئلة، بس إذا حطيت جملة إضافية غير مرتبطة، ممكن يغيّر جوابه بطريقة غير متوقعة. هالشي يعني إنو التطبيقات اليومية ممكن تصير غير ثابتة إذا استُخدموا سياق غير ذي صلة. لازم نكون حذرين ونختبر هالتطبيقات على كل سؤال لحالو مش بس على المتوسط.
LLM robustness evaluation context reliability arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

AVQ-Attention: انتباه متكيّف بكمية متجهية مُكمَّدة

AVQ-Attention: Adaptive Vector-Quantized Attention
الفريق قدم طريقة جديدة اسمها Adaptive Vector-Quantized (AVQ) Attention لتقليل عبء حساب الـ attention اللي بيصير O(N²) بالـ transformers. الفكرة إنو الكودات (codewords) بتتوزع حسب أهمّية الانتباه: بالمناطق اللي فيها تركيز عالي من الانتباه بيزيدوا عدد الكودات لتفصيل أدق، وبالمناطق التانية بيظلوا خشنين. هالشي تم تنفيذه بكيرنلات مخصّصة بـ Triton ضمن نمط Flash Attention، فبنظل على تعقيد O(MN) وبنحسّن الدقّة والكفاءة بالمقارنة مع VQ‑attention الثابتة.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج الكبيرة تشتغل أسرع وبنفس الوقت تعطي نتائج أدق، فبتقربنا من تشغيل الـ transformers على الأجهزة ذات الموارد المحدودة.
🌱 شو إلك منها؟
تخيّل إنك عم تستخدم تطبيق ترجمة أو شات بوت على موبايل قديم، هالتقنية بتخلي الاستجابة أسرع وأقل استهلاكًا للبطارية. يعني بدل ما يضطر الجهاز يحسب كل كلمة مع كل كلمة، هو بيركّز حسابه على الأجزاء المهمة بس. هالشي رح تلاقيه بأدوات الترجمة الفورية أو المساعدين الصوتيين اللي بتستعملها كل يوم.
attention transformer quantization efficiency AVQ arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

مقاومة وتحديث: إحداثيات تقارير مضادة للواقع للـ LLMs المتوافقة مع الحوافز

Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs
الباحثين يلاقوا إن نماذج اللغة المتوافقة مع الحوافز أحيانًا بتبالغ أو بتطمن المستخدم حتى لو ما فيها دليل داخلي. اقترحوا طريقة لتعلم وتوثيق وسطاء تقارير مضادة للواقع بيخلوا تقارير النموذج ثابتة ضد الضغوط غير المسموح فيها ومرنة لما يجي دليل حقيقي. هالطريقة بتستند على إحداثيات تقارير منخفضة الرتبة بتتحكم فيها بشكل شبه مستقل، وبيتم تطبيق "CRC clamp" بدون تدريب لتصحيح التقرير. التجربة على معيار "Bayesian-witness" أظهرت إنهم وصلوا لمستوى مقاومة وتحديث كامل، وتأكدوا إن الفكرة تنطبق على نماذج مختلفة وتنتقل لتقييم السايكوفانسي كمان.
ليش بتهمّك؟: هالطريقة بتعطي الباحثين وسيلة واضحة لتقليل الانحياز وتأكد إن النموذج يرد على الأدلة الفعلية مش على ضغط المستخدم.
🌱 شو إلك منها؟
تخيل إنو المساعد الذكي يجاوب على سؤالك بدون ما يطيق يرضي أي حدا بس لأنه يثق فيه. هالطريقة بتخلي المساعد يرد بصراحة وبالضبط على اللي فعلاً يثبت صحة الجواب، مش على الكلام الفاضي. يعني إذا استخدمت تطبيقات مثل شات بوت أو محرك بحث، رح تحس إنو الردود أكتر صدق وأقل تميل للمديح الفارغ.
LLM alignment incentive-compatibility evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 7
RL
RL يعني Reinforcement Learning، وهو مفهوم بنعلم فيه الموديل يتعلم من خلال التجربة والعقاب عشان يحقق هدف معين، بنسمع عنه لأنه أساس لتدريب الروبوتات والأنظمة الذكية.
E3
E3 هو مفهوم بيحكي عن ثلاثية التفاعل بين البيئة، النموذج، والنتائج، بدنا نفهم كيف الذكاء الاصطناعي بيتعلم ويتطور
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
verifiable rewards
المكافآت القابلة للتحقق يعني إنو بنقدر نتأكد إنو المكافأة اللي عم نعطيها للوكيل صحيحة ومبنية على قواعد واضحة، مش عشوائية
dynamic programming
البرمجة الديناميكية طريقة بنقسم فيها المشكلة الكبيرة لمشاكل أصغر وبنحلّها خطوة بخطوة، عشان نقلل الجهد ونحسن الأداء
knowledge distillation
عملية بتاخد معلومات نموذج ذكي كبير وتحطها في نموذج أصغر بدون ما تفقد الكتير من الجودة، أشبه بتلخيص كتاب سميك في نسخة مختصرة. بدنا هالشي عشان النماذج الصغيرة بتركض أسرع وتستهلك طاقة أقل.
optimal transport loss
خسارة النقل الأمثل هي مقياس بيقيس الفرق بين توزيعين عن طريق حساب أقل تكلفة لنقل الكتلة من توزيع لثاني، بنستعمله لتحسين النماذج
🤖 موديلز 5
MLLM
نموذج ذكاء اصطناعي بيقدر يفهم ويتعامل مع أنواع بيانات مختلفة في نفس الوقت (صور، نص، صوت)، احنا بنسمع عنه كتير لأنه بيقدر يحل مسائل معقدة بكفاءة أعلى.
reward model
نموذج صغير بنعلمه يقيّم جودة الإجابات والمخرجات (شو اللي كويس وشو اللي مش كويس) عشان نستخدمو لتحسين النماذج الكبيرة.
diffusion model
diffusion model نموذج توليدي بيضيف ضوضاء للصورة خطوة بخطوة وبعدين يزيلها، عشان يخلق صور جديدة واقعية.
LLM-Case
LLM-Case هو نموذج لغة كبير مخصص لحالات الاستخدام الخاصة، احنا بنستعمله لنحل مشاكل معينة بنظامنا
GPT-5
GPT-5 هو نموذج لغة جديد بيولد نصوص شبه بشرية، بنسمع عنه عشان هو أحدث نسخة بعد GPT-4 وبدنا نعرف قدراته.
📏 مقاييس 1
Agent Cognitive Redundancy Ratio (ACRR)
نسبة التكرار المعرفي للوكيل، يعني قدّيش الوكيل بيعيد نفس الأفكار أو الخطوات، احنا بنقيسها عشان نعرف إذا النظام عم يشتغل بذكاء ولا بيضيع موارد
🗂️ بيانات 1
MSE-Bench
MSE-Bench مجموعة بيانات بنستعملها لتقييم أداء النماذج على قياس الخطأ المتوسط المربع، عشان نشوف إذا النموذج بدو يشتغل بدقة
كل المصطلحات ←
العدد السابقشو في AI؟ | 14 يوليو — ذاكرة AI متعددة الوسائط
📚 كل الأعداد