📡 أحدث عدد

شو في AI؟ | 29 يونيو — قوانين تعاون الوكلاء وتوقع صعوبة الأسئلة

يومي 📅 2026-06-29
مرحبا 👋 هلقيت العدد الجديد من نشرتنا عن الذكاء الاصطناعي، بنغطي فيه أهم التطورات التقنية الحديثة.
#1

LLawCo: قوانين التعاون للوكالات المتجسدة

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
الفريق Zhou وزملاؤه قدموا إطار جديد اسمه LLawCo بدنا يساعد الوكلاء المتجسدين يتعلموا ينسقوا مع بعضهم ومع المهمة. النظام بيحلل الأخطاء السابقة ويستخرج قوانين سلوكية عالية المستوى مثل “احكي إذا إشي لازم” أو “استنى الشريك”. القوانين دي بتنضاف لسلسلة التفكير للوكيل عن طريق supervised fine‑tuning، فبيصير تصرفه متماشي مع هدف المهمة وشركائه. التجارب على benchmark PARTNR‑Dialog وTDW‑MAT ورّيت تحسين ملحوظ بنسب النجاح.
ليش بتهمّك؟: الطريقة بتخلي الوكلاء المتجسدين يتعاونوا بشكل أكتر كفاءة ويزيدوا فرص نجاح المهام المشتركة.
🌱 شو إلك منها؟
تخيل إنه روبوتات البيت أو السيارات الذاتية ما بتتعارض مع بعض، بل بتعرف تحكي وتستنى لتكمل شغلها معك. هالطريقة بتخلي هالأجهزة تتصرف أذكى وتقلل الأخطاء اليومية. ممكن تشوف هالتحسينات قريبًا بخدمات مثل المساعدات الذكية أو الروبوتات المنزلية.
multi-agent cooperation LLM benchmark fine-tuning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

حلقات التفكير في LLM بتساعد نتوقع صعوبة الأسئلة للإنسان

Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
الفريق قدم طريقة اسمها Epi2Diff، بتحوّل سجلات التفكير (reasoning traces) اللي بتطلع من نماذج اللغة الكبيرة (LRMs) لسلسلة من الحلقات المعروفة باسم "episodes". هالحلقات بتصنّف مراحل حلّ المسألة وبتعطي مؤشرات على الجهد والانتقالات بين الحالات. بعدين بيجمعوا هالمؤشرات مع تمثيل النص الأصلي للسؤال لتوقع صعوبة العنصر البشري. التجارب على أربع مجموعات بيانات واقعية أظهرت إنّ Epi2Diff يتفوّق على طرق التعديل الصغيرة، التعلم داخل السياق، وتكييف LLM المراقب، حتى على اختبارات مستمدة من SAT.
ليش بتهمّك؟: هالطريقة بتخلّي تقدير صعوبة الأسئلة أكتر دقة وبدون الحاجة لتكاليف تقييم يدوي، فبتحسّن عدالة الاختبارات وبناءها.
🌱 شو إلك منها؟
تخيّل إنّ المعلم يقدر يعرف قبل ما يوزّع الامتحان أي سؤال صعب على الطلاب، ويعدل الاختبار ليكون عادل للجميع. هالشي بيصير لأن النموذج بيحلّ السؤال ويعطينا فكرة عن الجهد اللي بيحتاجه. ممكن تشوف هالتقنية تتطبق بأدوات التعليم الإلكترونية اللي بتقترح أسئلة مناسبة لكل طالب.
LLM difficulty prediction education reasoning interpretability arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

HPRO: تحسين هرمي للمنح عبر استخراج التفضيلات لتوليد الكلام العاطفي

HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
الفريق Nie وزملاؤه قدموا HPRO، إطار جديد بيحل مشكلة إن نماذج النص‑إلى‑كلام بتولّد نبرة متوسّطة وما بتعبر كفاية عن المشاعر. الطريقة بتستعمل HD-Emo codec كنموذج مكافأة قابل للاشتقاق، بيفصل بين محتوى الكلام وتفضيلات الأسلوب عشان ما يصير تعارض بينهما. بعدين، HPRO بيوصل بين المكافآت على مستوى الإطار، الكلمة والجملة بطريقة تدريجية، فبيقلل الفجوة بين المكافآت القليلة على مستوى الجملة وتوليد التفاصيل الدقيقة. التجارب أظهرت إن الكلام بيصير أكثر عاطفة مع الحفاظ على وضوح المعنى.
ليش بتهمّك؟: هالطريقة بتخلّي الأنظمة تولّد صوت بشعور أقرب للإنسان، وبتقلل الأخطاء اللغوية اللي بتصير مع تحسين العاطفة.
🌱 شو إلك منها؟
تخيل إنك تسمع برنامج صوتي يقدر يعبّر عن الفرح أو الحزن كأنه صديقك الحقيقي، مش بس صوت ثابت. هالتحسين بيخلي التطبيقات مثل المساعدات الصوتية أو الكتب المسموعة تحسّس المستمعين بطرق أدفى وأقرب للواقع. يعني إذا استخدمت تطبيق يقرأ لك رسائل، رح تحس إن الصوت يشاركك مشاعرك فعلاً.
TTS emotional speech reward optimization preference learning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Qwen-Image-2.0-RL: تحسين جودة الصور وتعليم النموذج عبر RLHF

Qwen-Image-2.0-RL Technical Report
الفريق قدموا Qwen-Image-2.0-RL، طريقة بعد التدريب بتستعمل reinforcement learning from human feedback (RLHF) وon‑policy distillation (OPD) لتقوي جودة الصورة وقدرة النموذج على اتباع التعليمات. بنوا reward models مخصصة للمهام عن طريق fine‑tuning لنماذج vision‑language مع scoring نقطية وسلسلة تفكير. بعدين استخدموا إطار RL مبني على GRPO مع hybrid classifier‑free guidance لتوازن بين المعرفة الأصلية وتوجيهات المستخدم، وأخيرًا دمجوا السياسات عبر on‑policy distillation. التقييم أظهر تحسين واضح بالمقاييس على Qwen-Image‑Bench وفي ساحات النص‑إلى‑صورة وتحرير الصور.
ليش بتهمّك؟: هالطريقة بتعطي نماذج توليد الصور قدرة أعلى على إنتاج صور أجمل وتلتزم بالتعليمات بدقة أكبر، وهذا بيفتح باب لتطبيقات أكثر موثوقية.
🌱 شو إلك منها؟
تخيل إنك تطلب من برنامج يرسم لك صورة حسب طلبك، وبس يطلع لك صورة واضحة وجميلة وتطابق طلبك تمامًا، هالشي بيصير أسهل مع هالتقنية. يعني إذا بدك صورة لعيلة أو تعديل على صورة موجودة، النموذج رح يلتزم بالتعليمات ويحافظ على ملامح الوجوه. ممكن تشوف هالتحسينات بأدوات توليد الصور اللي بنستعملها على الإنترنت أو في تطبيقات تعديل الصور.
vision-language RLHF diffusion image generation editing hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

GBC: توصيلات مبنية على التدرّج لتحسين الأنظمة متعددة الوكلاء

GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems
الفريق قدم طريقة جديدة اسمها Gradient-Based Connections (GBC) لتحديد إشي كل وكيل يساهم فيه بالخطأ داخل نظام متعدد الوكلاء مبني على LLMs. الفكرة إنه بنمثّل النظام كرسمة حسابية وبنضيف أوزان متدرجة لتقيس تأثير مخرجات كل وكيل على الوكلاء اللي بعده على مستوى كل كلمة. بعدين بنرجّع إشارة الخسارة للوراء عبر هالرسم لتحديد مصادر الأخطاء بدقة وتعديل البرمجة. كمان طوّروا تنفيذ سريع اسمه AgentChord بيستغل حساب التدرّج بالبادئة لتقليل التكلفة، ولقوا تحسّن واضح على مهمات MultiWOZ وτ‑bench.
ليش بتهمّك؟: هالطريقة بتخلّي أنظمة الوكلاء المتعددة تتصرف بشكل أكثر تنسيق وتقلل الأخطاء اللي بتصير من سوء الفهم بين الوكلاء.
🌱 شو إلك منها؟
تخيّل إنك عم تحكي مع مجموعة من الروبوتات كل وحدة عندها دور معين، هالطريقة بتساعدهم يعرفوا مين غلط وين، فبيصيروا يشتغلوا مع بعض بأقل لخبطة. يعني إذا أحدهم يخطأ في خطوة، بنعرف بسرعة نصلحه بدل ما نعيد كل العملية من الصفر. هالتحسين ممكن ينعكس على خدمات الدردشة الذكية أو المساعدات الرقمية اللي بنستعملها يوميًا.
multi-agent attribution gradient optimization LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

ProMSA: وكيل بحث متعدد الوسائط متدرج للـ KB-VQA

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
الفريق قدم ProMSA، وكيل بحث متعدد الوسائط بيتصرف خطوة بخطوة ليفهم السؤال والصورة. الوكيل بيختار إذا بدو يدور إشي صورة، أو يدور إشي نص، أو يوقف، وبنفس الوقت بيحافظ على ميزانية استدعاء الأدوات وبيمنع التكرار. تدربوا على طريقة SFT مع رفض العينات، وبعدها حسّنوا الوكيل باستخدام هدف RL اسمه TN‑GSPO اللي بيوازن بين طول الجواب وعمق التفاعل مع الأدوات. التجارب على مجموعتي E‑VQA وInfoSeek ورّيت إنه الوكيل بيتفوق على أساليب RAG والوكلاء التانية.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الـ VQA تستفيد من المعرفة الخارجية بطريقة أذكى وأسرع.
🌱 شو إلك منها؟
تخيل إنك بتسأل صورة على الفيسبوك عن شي ما بتعرفه، الوكيل بيدور لك بالمعلومات من الإنترنت ويجاوبك بدقة. يعني إذا حابب تعرف تاريخ مبنى قديم من صورة، هالتقنية رح تساعدك توصل الجواب بسرعة. ممكن تشوف هالتحسينات بأدوات البحث أو التطبيقات اللي بتعتمد على الصور.
multimodal VQA agents retrieval RL hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

NeuraDock Agent: ربط السياق للـ EEG منخفض القنوات

Boundary-Aware Context Grounding for A Low-Channel EEG Agent
الفريق قدم NeuraDock Agent، بنية مفتوحة المصدر بتفصل محرك EEG المحلي deterministic عن طبقة اللغة الوعيّة بالمعدات. المحرك بيحلّل التسجيلات، يعمل quality control، وينفّذ سير عمل طيفي مُراجَع، وبعدين يكتب مخرجات قابلة للقراءة آلياً. الـ LLM بيستقبل ملخّص مختصر ومسموح به مع حزمة سياق مُصدّرة توضح العتاد ذو السبعة قنوات، سير العمل، حدود التنفيذ، والسيناريوهات المرجعية، بينما تظل البيانات الخام محلية. التجارب أظهرت إن 12 تسجيل بيطلع نفس النتائج عبر 10 تكرارات، وإن النظام بيتعامل بثبات مع أخطاء HTTP أو مخرجات مشكّلة، وكمان نجح في اختبار حدود الوعي عبر 36 سؤال تحت 4 اختصارات سياق و2 LLMs.
ليش بتهمّك؟: هالطريقة بتخلّي الـ LLM يشتغل بوعي أكبر على بيانات EEG منخفض القنوات، وبتقلل الأخطاء اللي ممكن تصير من تفسيرات غير مدعومة.
🌱 شو إلك منها؟
تخيّل إنك عم تستعمل جهاز EEG بسيط على راسك، والنظام بيقدر يشرح لك النتائج بطريقة واضحة وما بيخدعك بتفسيرات غير دقيقة. يعني إذا حبيت تعرف كيف دماغك عم يشتغل وقت الراحة أو الشغل، هالأداة رح تعطيك تقرير موثوق بدون ما تحتاج خبرة تقنية. هالشي ممكن تشوفه قريبا ببرامج الصحة الذكية أو تطبيقات تتبع التركيز.
EEG LLM agent hardware-aware benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

SingGuard: حارس متعدد الوسائط يتكيّف مع السياسات

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning
فريق SingGuard قدم نموذج guardrail بيشتغل على محادثات متعددة الوسائط وبيقدر يتغيّر مع سياسات الأمان وقت التشغيل. النموذج بياخد القواعد بلغة طبيعية كمدخل وبعدين بيفحص المحتوى حسب كل قاعدة، وبينتج تصنيف الأمان والقاعدة المفعّلة. كمان بيوفر ثلاث مستويات استدلال من سريع لبطئ، وبيتحسّن عبر reinforcement learning مفصول بين السريع والبطيء. اختبارهم SingGuard‑Bench فيه أكثر من 56 ألف مثال عبر 80 نوع خطر، وحققوا أعلى متوسط F1 بكل عائلة من الاختبارات.
ليش بتهمّك؟: هالورقة بتخلّي التطبيقات المتعددة الوسائط أأمن وأكتر مرونة مع تغيّر سياسات الحماية.
🌱 شو إلك منها؟
تخيّل إنك عم تستخدم تطبيق بيجمع نص وصور، وبيجاوبك على أسئلة حسّاسة. SingGuard بيضمن إنه الردود ما تتجاوز حدود الأمان حتى لو تغيرت القواعد بين بلد وبلد. يعني بتعيش تجربة أأمن بدون ما تحس بأي قيود غريبة.
multimodal safety benchmark reinforcement-learning policy-adaptive hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

Democratic ICAI: مناظرات شخصية لاستخراج مبادئ توجيهية

Democratic ICAI: Debating Our Way to Steering Principles from Preferences
الفريق قدم طريقة جديدة اسمها Democratic ICAI. الفكرة إنه بدل ما نكتفي بقرار نهائي من زوجين من الخيارات، بنجمع مناظرات بين شخصيات مُصمّمة لتعطي تبريرات متعددة. هالتبريرات بتتحول لمبادئ توجيهية بلغة طبيعية، وبنستعملها لتوجيه نماذج القرار إما بـ LLM أو بأشجار القرار. التجارب على مجموعات MuCE-Pref وLiTBench أظهرت إنه الطريقة بتعطي توقعات تفضيلات أدق من الأساليب السابقة.
ليش بتهمّك؟: هالطريقة بتساعدنا نفهم ليش الناس بتفضّل خيار على تاني، وبتحسّن دقة الأنظمة اللي بتتبع تفضيلاتهم.
🌱 شو إلك منها؟
تخيل إنك عم تختار بين أكلة، بدل ما تسأل شخص واحد يجاوب بسرعة، بنسمع نقاش بين عدة أشخاص يشرحوا ليش كل اختيار ممكن يكون أحسن. هالنقاش بيساعد البرنامج يقرر بطريقة أقرب لتفكيرنا. هالشي ممكن يطلع في تطبيقات توصية الأغاني أو الأفلام اللي بتعطيك اختيارات مبنية على أسباب واضحة.
alignment preference learning LLM decision-making benchmarks arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

من الرموز للحالات: LLMs كحالة خاصة من نماذج العالم والمسار المستمر للأمام

From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond
الباحث Paul Dubois بيحكي إن العلاقة بين LLMs ونماذج العالم ما لازم تكون إما/أو. هو بيشوف إن الـ LLM هو بس حالة متدهورة من نماذج العالم، لأن مساحة الحالة هي كل سلاسل الرموز والإجراء الوحيد هو إضافة رمز جديد. كمان بيقترح إن فيه طيف مستمر بين النماذج اللي بتتوقع رموز (NTP) والنماذج اللي بتشتغل على الفضاء الكامن (JEPA)، ومع كل خطوة بنقرب من تمثيل الواقع لكن بنفقد مزايا التدريب الضخمة للـ LLM. البحث بيفتح سؤالين: كيف نلاقي بيانات ذات إشارات فعلية بدلاً من نصوص الإنترنت، وهل الـ transformer يقدر يتعامل مع توقع حالات مستمرة ولا نحتاج بنية جديدة.
ليش بتهمّك؟: هالورقة بتوضح كيف ممكن نتخطى حدود الـ LLM ونقرب من نماذج تفهم وتولد الواقع بشكل أعمق، وهذا مهم لتطوير ذكاء اصطناعي عام.
🌱 شو إلك منها؟
تخيل إنه برنامج ما بس يكتب جمل، بل يتخيل المشهد كامل ويتصرف فيه، زي ما بنحكي مع صديق بيعرف كل تفاصيل اليوم. هالفكرة ممكن تخلي المساعدات الذكية أو الألعاب أكتر واقعية وتفهم احتياجاتنا. إذا صارت، رح نحسّ بالفرق لما نستعمل تطبيقات بتتوقع خطواتنا وتساعدنا قبل ما نطلب.
language models world models transformers AI research arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

ToolPrivacyBench: قياس خصوصية الأدوات في وكلاء LLM

ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
الباحثين Shijing Hu وزملاؤه قدموا أداة جديدة اسمها ToolPrivacyBench لتقييم كيف الوكلاء اللي بيستعملوا نماذج اللغة الكبيرة بيمرّروا المعلومات الخاصة خلال سلاسل الأدوات. الأداة بتشتغل على 2,150 حالة فيها تدفقات بيانات حساسة، وبتقارن ما بين ما يُرسل للـ tools وسجلات السياسات المعرّفة مسبقًا. النتائج بتوضح إنه الوكيل ممكن ينجز المهمة بس يفضح معلومات خاصة ما لازمة خلال استدعاءات الأدوات المتوسطة.
ليش بتهمّك؟: هالورقة بتبيّن إنه نجاح إنجاز المهمة ما يعني إنه الخصوصية محفوظة، وهاد مهم لنحافظ على بيانات المستخدمين بأمان.
🌱 شو إلك منها؟
تخيل إنه برنامج بيساعدك تحجز فندق، بس وهو عم يطلب بياناتك من حسابك البنكي غير الضروري. هالمراجعة بتكشف إذا البرنامج عم يشارك معلوماتك مع خدمات ما لها علاقة بالحجز. يعني إذا استخدمت تطبيقات بتستدعي أدوات ثانية، ممكن تكون محمي من تسريب بياناتك غير المطلوبة.
privacy LLM benchmark agents tool-use arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

هل الـLLM تحكم أحسن من توليدها؟

Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA
الباحث سامباران باندياوبادياي اختبر فكرة إنه النماذج الكبيرة ممكن تحكم على إجاباتها بنفسها أسهل من توليدها. استخدموا إعداد سؤال‑جواب داخل السياق مع أربعة benchmarks (SQuAD 2.0, DROP, HotpotQA, MuSiQue) ونمذجتين، ولاحظوا إنه الدقة بتوليد الإجابة أعلى من الدقة بتقييمها ذاتيًا بثلاث اختبارات، ما عدا MuSiQue اللي فيها أسئلة متعددة الخطوات. تحليل الـattention بيّن إنه النموذج بقرّب أقل للفقرة والسؤال وقت التقييم، وFine‑tuning بـLoRA بيأكد إنه هالاختلاف مش نتيجة تدريب معين.
ليش بتهمّك؟: لأنه الاعتماد على تقييم ذاتي للـLLM ممكن يخلّي الأنظمة تعطي تقييمات غير دقيقة، وهذا بيأثر على جودة التطبيقات اللي بتستعمل هالتقنية.
🌱 شو إلك منها؟
تخيل إنه برنامج يكتب إجابة على سؤال وبعدين بيحكم إذا إجابته صحيحة أو لا. هالدراسة بتظهر إنه هالبرنامج غالبًا ما بيكون دقيق بحكمه الذاتي، يعني ممكن يصدق إجابة غلط. يعني إذا عم تستخدم تطبيقات تقييم أو تصحيح آلي، لازم تكون حذر لأن التقييم الذاتي ما بيكون دايمًا موثوق.
LLM self-evaluation QA attention LoRA arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

تحويل مهارات التلاعب من البشر للروبوتات عبر تمثيل الجسر

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
الورقة بتستكشف إذا فينا نتعلم مهارات تلاعب جديدة من تصرفات البشر لروبوت ثنائي اليدين عنده مقبضين متوازيين. الباحثين بيقولوا إنه تمثيل الحركة التقليدي بـ6DoF مش كفاية، فبدّعو تمثيل "bridging action" اللي هو إزاحة المعصم النسبية ضمن إطار الكاميرا اللي على الرأس، وهو مساحة حركة مشتركة بين البشر والروبوتات. ليهيك بنوا نموذج vision-language-action مع توكنات حركة متداخلة وattention masking ليعالج نقص بعض مكوّنات الحركة بحسب الكيان. التجارب على مجموعة مهام تلاعب جديدة بتظهر إنه هالتمثيل بينقل معرفة البشر للروبوتات بشكل أحسن بكتير من الحركات الـ6DoF الضوضائية وبيستفيد أكتر مع زيادة بيانات البشر.
ليش بتهمّك؟: هالطريقة بتخلي الروبوتات تتعلم أسرع وأدق من بيانات البشر المتوفرة بكمية كبيرة.
🌱 شو إلك منها؟
تخيل إنك تشوف فيديو لشخص عم يفتح علبة، الروبوت يقدر يتعلم من هالفيديو ويعمل نفس الشي. يعني ممكن يشتغل بالمطابخ أو بالمصانع بدون ما نبرمجه لكل حركة. هالشي رح يلاقيه بتطبيقات الروبوتات المنزلية أو الخدماتية.
robotics manipulation transfer learning vision-language hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

خصائص ضارة ثابتة تحت هجمات الجيلبريك: دليل من تخصّص رؤوس الانتباه في LLM

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models
الفريق يوضح إن هجمات الجيلبريك ما بتقضي على كل ميزات الأمان بالـ LLM، بس بتقمع رؤوس انتباه معينة. لقوا نوعين من الرؤوس: رؤوس متعرضة للعدوان (ACH) موجودة بالطبقات الأولى، ورؤوس متوافقة مع الأمان (SAH) بالطبقات المتوسطة، والـ ACH بتتقمع وقت الهجوم بينما الـ SAH بتظل شغالة. التجارب بتأكد إن إلغاء شوية من الـ ACH يخلّي النموذج يجاوب على أسئلة كان يرفضها، وإلغاء الـ SAH بيضعف إشارات الأمان الداخلية. كمان بيظهر إن قمع الـ ACH بيصير بسبب توكنات نموذج الهجوم، وهالشي بيوضح ليش الهجمات بتنجح مع بقاء إشارات الأمان.
ليش بتهمّك؟: الفهم الدقيق لهالآلية بيساعدنا نبني دفاعات أقوى ضد هجمات الجيلبريك اللي بتخترق أمان الـ LLM.
🌱 شو إلك منها؟
تخيل إنه فيه برنامج بيقدر يكتشف إذا حدا عم يحاول يخدع الذكاء الاصطناعي، مش بس من الكلام الظاهر، بل من إشارات داخلية مخفية. هالطريقة بتخلي التطبيقات اليومية، زي المساعدات الصوتية أو شات بوتات، تكون أأمن وما تسمح بإجابات ضارة. يعني إذا بتستعمل بوت لتسأل عن معلومات حساسة، هالتقنية رح تحميك من الردود الخطيرة قبل ما تصير.
LLM safety attention jailbreak detection arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

مراقب آلي لاكتشاف عدم استقرار تدريب LLM قبل ما يوقع

Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability
الفريق درس كيف نقدر نكشف مشاكل استقرار تدريب نماذج اللغة الكبيرة قبل ما يبان الانهيار بالـ loss. استخرجوا مراقبين داخلين من دور كل وحدة أساسية، مثلاً راقبوا entropy الطيفي لتفكيك QK بالـ flash attention، ولاحظوا إشارة غير طبيعية قبل ما ينهار الأداء. كمان طوّروا مؤشرات للـ MoE routers حسب دورهم باختيار الخبراء. التجارب اللي عملوها بإدخال أخطاء بتأكد إن الإشارات هيدي بتنبّه على الفشل بآلاف الخطوات قبل ما يبان الانحراف بالـ loss.
ليش بتهمّك؟: هالمراقبين بيساعدوا الباحثين يتفادى خسارة وقت وموارد ضخمة بسبب تعطل التدريب فجأة.
🌱 شو إلك منها؟
تخيل إنه عندك سيارة وبتظهر إشارة تحذير قبل ما يوقف الموتور؛ هيك النظام بيحذّر المطوّرين قبل ما يضيعوا أيام وشغل على تدريب نموذج كبير. يعني لو حدا بيشتغل على تطبيقات ذكية، هالتقنية ممكن توفرله وقت ومصاريف كثير. ممكن تشوف هالتحذيرات ضمن أدوات تدريب الذكاء الاصطناعي على السحابة أو منصات التطوير اللي بتستعملها.
LLM training stability monitoring flash attention MoE arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

MultiHashFormer: نموذج لغوي هاشي بفعالية

MultiHashFormer: Hash-based Generative Language Models
هالورقة بتقدّم MultiHashFormer، إطار جديد بيسمح باستخدام الهاش لتوليد النصوص بطريقة تلقائية. كل كلمة بتنولد توقيع هاش فريد مكوّن من مجموعة هوية هاش مستقلة، وبعدين بنضغطها بـ Hash Encoder لتدخل على Transformer decoder. بعدين Hash Decoder بيطلع توقيع الهاش للكلمة الجاية وبيتحول للنص. التجارب على نماذج 100M، 1B، و3B بتظهر إنه MultiHashFormer بيتفوّق على الـ Transformer العادي وبيقدر يضيف vocabularies بلغات متعددة بدون ما يزود عدد البارامترات.
ليش بتهمّك؟: الموديل بيقلل استهلاك الذاكرة ويعطي أداء أحسن بكتير، خصوصًا للغات متعددة.
🌱 شو إلك منها؟
تخيّل إنك عم تتعامل مع تطبيق ترجمة أو كتابة نصوص على موبايل قديم، هالتقنية بتخلي التطبيق يشتغل أسرع وباستهلاك أقل للبطارية. يعني ممكن تستمتع بكتابة رسائل أو ترجمة بدون ما يبطّئ الجهاز. هالشي بيظهر أكتر بخدمات الدردشة أو المساعدات الصوتية اللي بنستعملها كل يوم.
hashing language model transformer parameter efficiency multilingual arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

STAG: تمثيل هيكلي زماني-مكاني للتعبيرات الدقيقة

STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition
الفريق Sharma وزملاؤه قدموا STAG، شبكة ديناميكية بتركّز على مناطق الوجه وتربطها بوحدات الحركة (AU) لتعرف التعبيرات الدقيقة. بيستخرجوا optical flow من إطارات مختارة بذكاء، وبعدين يدمجوا graph attention network للمعالجة المكانية مع transformer encoder للمعالجة الزمنية. وحدة cross‑attention bidirectional بتسمح للخصائص المكانية والزمنية تتنقّح بعض، وتغيّر الروابط بين المناطق حسب نشاط العضلات. النتيجة إن النموذج بيشتغل أسرع وبيدقّق أكتر عبر مجموعات بيانات مختلفة.
ليش بتهمّك؟: هالطريقة بتخلّي التعرف على الميكرو‑إكسبرشنات أدق وأقوى عبر بيئات مختلفة، وهاد مهم لتطبيقات الأمان وتحليل السلوك.
🌱 شو إلك منها؟
تخيل إنه في برنامج يقدر يقرّبلك إشارة وجه صغيرة ما بتلاحظها، زي لما تحاول تخفي مشاعر معينة. هالتقنية بتساعد الأطباء أو المسؤولين يكتشفوا هالإشارات بسرعة، زي ما بنشوفها بتطبيقات الفحص أو المقابلات. يعني ممكن تلاقيها ضمن أدوات تحليل الفيديو أو تطبيقات الصحة النفسية.
micro-expression computer vision graph neural network transformer cross-dataset arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

التدريب التوأمي بالتعزيز مع مكافآت قابلة للتحقق (TRL)

Tandem Reinforcement Learning with Verifiable Rewards
الفريق Jiao وزملاؤه قدموا طريقة جديدة اسمها Tandem Reinforcement Learning (TRL) لتقوية قدرة نماذج اللغة الكبيرة على التفكير المتسلسل، بحيث يشتغل نموذج كبير (senior) مع نموذج أصغر (junior) مجمد ويتقاسموا المكافأة. الطريقة بتخلّي النموذج الكبير يضبط طريقة تفكيره لتكون أسهل على الصغير يتبعها، وبيظهروا إن الأداء يبقى مثل ما هو مع طريقة GRPO التقليدية. التجربة على نموذج Qwen3-4B-Instruct في مسابقات الرياضيات أثبتت إنه فيه تحسين بالتماسك بين النموذجين، وانخفاض الانحراف اللغوي، وسلسلة تفكير أوضح للجنيريتور الصغير.
ليش بتهمّك؟: الطريقة بتفتح باب لتعاون أكثر فاعلية بين نماذج الذكاء الاصطناعي المختلفة وبين البشر، وبتقلل المشاكل اللي بتظهر لما النماذج الكبيرة تعطي ردود معقدة أو غير مفهومة.
🌱 شو إلك منها؟
تخيل إنه عندك برنامج ذكي يساعدك بحل مسائل الرياضيات، بس هو يشرح الحل خطوة خطوة بطريقة سهلة تفهمها حتى لو كنت مش خبير. هالطريقة بتخلي الشرح أوضح وأسهل للمتابع، فممكن تستفيد منها في تطبيقات التعليم أو المساعدة الشخصية. يعني إذا استعملت تطبيق تعليم رياضيات أو مساعدة في الواجبات، رح تلاقي الشرح صار أبسط وأدق.
reinforcement-learning language-models chain-of-thought multi-agent arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

دمج البيانات بين الحقيقة الواحدة والمتعددة باستخدام Large Language Models

Single and Multi Truth Data Fusion using Large Language Models
فريق Hira Beril Kucuk وزملاؤه استكشفوا كيف ممكن نستفيد من Large Language Models بمهام دمج البيانات الجدولية. جرّبوا استراتيجيات prompting مختلفة للسيناريوهات اللي فيها قيمة وحدة أو قيم متعددة، وشملوا prompts حسب المجال أو بدون مجال، كمان جربوا zero‑shot و one‑shot. اختبروا هالطرق على ثلاث مجموعات بيانات benchmark، ولقوا إنّ الأساليب المعتمدة على LLM تفوقت على طرق اكتشاف الحقيقة التقليدية غير المُشرف عليها مثل DART و LTM. الكود متوفر على GitHub للكل يقدر يستخدمه.
ليش بتهمّك؟: هالنتيجة بتبيّن إنّ LLMs فيهن تحل مشاكل دمج البيانات بدقّة أعلى من الأساليب القديمة، وهاد بيفتح باب لتطبيقات أكتر موثوقة.
🌱 شو إلك منها؟
تخيل إنّك عندك جداول فيها معلومات من مصادر مختلفة، وبعضها متناقض. هالتقنية بتساعد البرامج تلاقي القيمة الصحّية أو القيم الصحّية من غير ما تحتاج تدخل يدوي. يعني إذا بتستعمل تطبيقات مثل محركات البحث أو خدمات توصية، ممكن تشوف نتائج أدق وأكتر موثوقية.
LLM data fusion truth discovery prompting benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

تمثيل الأفكار الخفية: أربع مبادئ لتقييم LLMs

Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs
الفريق Fahd Seddik و Fatemeh Fard قدموا إطار تقييم أكسيوماتيكي للتمثيلات الخفية بالأفكار داخل LLMs، بيشتغل على قياس أربع مبادئ وظيفية (Causality, Minimality, Separability, و Stability) بشكل مستقل عن درجات benchmark. حسب ما لقوا، ما في أي نموذج بيحقق الأربعة مبادئ مع بعض، والتمثيلات بتفرّق بين أنواع المهام بس ما بتفرّق بين سؤالين من نفس النوع. كمان لقوا إنه التمثيلات ما بتضيف معلومات أكتر من اللي موجودة أصلاً بالـ input embedding، والنتيجة ثابتة عبر عوائل النماذج dense، reasoning‑distilled، واللي تدربت بـ RL. البحث ظهر على Hugging Face Daily Papers وجمع 4 upvote، وأصله preprint على arXiv.
ليش بتهمّك؟: هالورقة بتوضح إنه تقييم جودة تمثيل الأفكار داخل LLMs لازم يكون مستقل عن الأداء على benchmark، وبتكشف فجوة هيكلية ما بتنحل بس بتكبير النموذج أو تعديل التدريب.
🌱 شو إلك منها؟
تخيل إنه البرنامج اللي بتستعمله لتجيب إجابات سريعة ما بيحسب بس النتيجة، بل كمان بيحاول يفهم الفكرة ورا السؤال. هالورقة بتقول إنه هالأنظمة لسا ما بتفهم الفكرة بشكل كامل، يعني ممكن تضل تخليك تشوف إجابات غير دقيقة. إذاً، لما تستخدم أدوات مثل المساعدات الرقمية أو تطبيقات الذكاء الاصطناعي، لازم تعرف إنه الفهم العميق للمعنى لسا مش مضمون بالكامل.
evaluation representation LLM reasoning benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 7
fine-tuning
تدريب إضافي لنموذج موجود بالفعل على بيانات جديدة وخاصة عشان يكون أفضل في مجال معين. يعني بدل ما نبني نموذج من الصفر، بنأخذ واحد موجود ونحسّنه. بنسمع عنه عشان بيوفر وقت وموارد كتير.
PARTNR-Dialog
benchmark بنستعمله عشان نقيس كيف الأنظمة بتتفاعل مع البشر بحوارات معقّدة، احنا بدنا نعرف أي نظام أقوى.
reasoning traces
هالشي هو السجلات اللي بتوضح خطوات التفكير للـ AI، بنحتاجه عشان نفهم ليش وصل للنتيجة مش عشوائية.
preference tokens
هني رموز بتعطي الـ AI فكرة عن تفضيلات المستخدم، فبصير يقدّم محتوى أقرب لإشي بنحبه.
RLHF
تعلم مع تقوية من ردود البشر (Reinforcement Learning from Human Feedback)، احنا بنستعمله ليخلّي النموذج يتصرف بطريقة أكتر طبيعية.
Gradient-Based Connections
طريقة تربط طبقات الشبكة بناءً على التدرجات، بتساعد النموذج يتعلم أسرع وأكتر استقرار.
attribution graph
شبكة attribution graph هي رسم بياني بنظهر فيه كيف كل جزء من الداتا أو الموديل بيساهم بالنتيجة، احنا بنستعملها عشان نفهم إشي بيصير بالقرارات
🤖 موديلز 6
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
reward model
نموذج صغير بنعلمه يقيّم جودة الإجابات والمخرجات (شو اللي كويس وشو اللي مش كويس) عشان نستخدمو لتحسين النماذج الكبيرة.
HD-Emo codec
موديل بيحوّل المشاعر لإشارات رقمية بدقة عالية، بدنا نستخدمه لنطلع صوت أو فيديو فيه تعابير وجيهية واضحة.
diffusion model
diffusion model نموذج توليدي بيضيف ضوضاء للصورة خطوة بخطوة وبعدين يزيلها، عشان يخلق صور جديدة واقعية.
GRPO
نموذج حديث بتقنية RL متطوّرة بتساعد النموذج يتعلّم بكفاءة أعلى وأسرع. هو بيركّز على الجودة في كل خطوة تدريب، عشان كذا بينتج إجابات أفضل بموارد أقل.
AgentChord
موديل بيجمع أكتر من وكيل ذكي ليشتغلوا سوا كفرقة، بدنا نستخدمه لتطبيقات معقدة فيها مهام متعددة.
🗂️ بيانات 1
MultiWOZ
داتاست فيه محادثات خدمة عملاء متعددة المجالات، احنا بنستعمله لتدريب وتقييم أنظمة الحوار.
كل المصطلحات ←
العدد السابقشو في AI؟ | 28 يونيو — تحسين الفهرسة وتوليد فيديو متعدد المشاهد
📚 كل الأعداد