📡 أحدث عدد

شو في AI؟ | 27 يونيو — نمذجة عالم داخل السياق وتحكم روبوتي

يومي 📅 2026-06-27
مرحبا 👋 الآن بنقدملكم عدد جديد من AI سالي، بنستعرض فيه أحدث الأبحاث والتقنيات بطريقة مختصرة وواضحة.
#1

نمذجة العالم داخل السياق للتحكم الروبوتي (ICWM)

In-Context World Modeling for Robotic Control
الفريق Wang وزملاؤه قدموا طريقة جديدة اسمها In-Context World Modeling (ICWM) عشان الروبوتات تقدر تتعرف على حالتها من خلال شوية تفاعلات سابقة، بدون ما نحتاج نعيد تدريب النموذج. الفكرة إنه النموذج بيستغل نافذة السياق ليعرف كيف النظام بيشتغل، مش بس يتبع الأوامر الحالية. بهالطريقة الروبوت بيقدر يتعامل مع كاميرات أو أشكال جديدة من غير ما نضطر نعمل fine‑tuning كثيف. التجارب على محاكاة وحقيقي أظهرت إنه ICWM بيتفوق بكتير على الطرق التقليدية خصوصاً مع تغيّر زاوية الكاميرا.
ليش بتهمّك؟: هالطريقة بتقوّي قدرة الروبوتات على التكيّف السريع ببيئات جديدة بدون ما نضطر نعيد ضبط أوزان النموذج.
🌱 شو إلك منها؟
تخيّل إنه الروبوت بالبيت يقدر يتعلم كيف يتعامل مع طاولة جديدة أو إضاءة مختلفة بمجرد ما يجرب شوية حركات، هيك ما رح تحتاج نشتري روبوت جديد كل مرة نغيّر فيها المكان. يعني إذا كان عندك روبوت تنظيف، بيصير يظبط نفسه عالمنزل الجديد بسرعة. هالشي ممكن تشوفه بأجهزة ذكية بتنظف أو تساعد بالمطبخ، اللي رح تصير أذكى وتشتغل معاك أكتر.
robotics in-context learning world modeling VLA adaptation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

ضغط KV Cache بوعي معلوماتي لتفكير طويل

Information-Aware KV Cache Compression for Long Reasoning
الفريق قدم طريقة InfoKV لتقليل حجم ذاكرة الـ KV اللي بتستخدمها نماذج اللغة الكبيرة وقت التفكير الطويل. بدل ما يعتمدوا بس على أوزان الـ attention لتحديد أهم الكلمات، استعملوا مقياس جديد اسمه Forward Influence بيقيس كيف كل كلمة ممكن تأثر على السياق المستقبلي. كمان دمجوا إشارة عدم اليقين التنبؤي مع تطور التمثيلات الطبقية، ودمجوها مع الـ attention لتحديد أي توكنات نضغطها. التجارب على Benchmarks طويلة السياق مع Llama-3.1 وLlama-3.2 وDeepSeek-R1 أظهرت إن InfoKV يتفوق على طرق الضغط السابقة في كل من مرحلة التحميل والإنشاء.
ليش بتهمّك؟: هالطريقة بتخلي نماذج اللغة الكبيرة تشتغل أسرع وتستهلك أقل من الذاكرة، خاصةً لما نحتاج نفهم نصوص طويلة.
🌱 شو إلك منها؟
بتخيل إنك عم تقرأ قصة طويلة على الموبايل، وبدل ما يعلق الجهاز بسبب كثرة البيانات، هالتقنية بتقلل الحمل وتخلي القراءة سلسة. يعني كأنك عم تحط نص قصير لكن مع كل تفاصيله، وبتستفيد من كل كلمة حتى لو ما ظهرت كلها على الشاشة. ممكن تشوف هالتحسينات في تطبيقات الدردشة أو الترجمة اللي بتتعامل مع نصوص طويلة وتشتغل بسرعة أكبر.
LLM KV cache compression long-context InfoKV hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

PhysiFormer: محاكاة ميكانيكا الأشياء في الفضاء العالمي

PhysiFormer: Learning to Simulate Mechanics in World Space
الفريق Chen وLan وVedaldi قدموا PhysiFormer، transformer مبني على diffusion لتوليد حركة ثلاثية الأبعاد واقعية للأجسام. النموذج ياخد مواضع الرؤوس والسرعات ونوع المادة، ويولد مسارات مستقبلية مباشرةً في إحداثيات العالم، من غير ما يحتاج أي افتراضات مسبقة عن الصلابة أو السببية. العملية كلها بنظام denoising diffusion، والـ attention مفصول على الوقت والمساحة والأجسام لحتى يشتغل بكفاءة على مشاهد فيها أكتر من جسم. تم تدريب النموذج على أكثر من 100k مسار محاكى، وبيظهر أداء أحسن بكتير من الطرق autoregressive من حيث دقة المسار، الحفاظ على الصلابة، والاتساق الفيزيائي.
ليش بتهمّك؟: هالطريقة بتخلينا نقدر نولد حركات فيزيائية دقيقة ومتنوعة حتى لو ما كان عنا معلومات كاملة عن المستقبل، وهذا مهم لتطبيقات الروبوتات والرسوم المتحركة.
🌱 شو إلك منها؟
تخيل إنك عم تشوف برنامج يقدر يتوقع كيف رح تتحرك الأشياء بمجرد ما تعرف مكانها وسرعتها، زي ما بيصير مع ألعاب الفيديو أو الروبوتات اللي بتتعامل مع أدوات. هالتقنية بتساعد المصممين يجرّبوا تصاميمهم قبل ما يصنعوها، وبتسهل على المطورين يضيفوا حركات طبيعية لتطبيقاتهم بدون ما يكتبوا كود معقّد. ممكن تشوف هالنتيجة في تطبيقات الواقع المعزز أو الألعاب اللي بتصير أكثر واقعية.
diffusion transformer physics simulation 3D robotics hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

فهم الفيديو بثقة مع Robust-TO

Confidence-Aware Tool Orchestration for Robust Video Understanding
الفريق He و Choi و Yoon قدموا إطار عمل اسمه Robust-TO بيضيف مقياس موثوقية لكل فريم بالفيديو، يعني ما بيخلي النموذج يثق بكل صورة كأنها نظيفة. كل أداة بصرية بتستقبل سؤال فرعي وإطار موثوق وبترد بأدلة مثل صندوق حدود أو نص أو فعل مع درجة موثوقية. هالدرجات بتتجمع بثلاث مستويات لتحدد وزن الأدلة، وفيه مكافأة اسمها confidence-cost GRPO بتحسّن الدقة والفعالية. التجارب على benchmarkين للفيديو أظهرت إن Robust-TO وصل لـ56.4% دقة على البيانات النظيفة وتفوق على Gemini-2.5-Pro وحتى تحت تشويش واقعي ما انخفضت الدقة كثير.
ليش بتهمّك؟: هالطريقة بتقلل الفجوة بين الأداء النظيف والواقع المتشوش، فبتخلي نماذج الفهم الفيديو تكون أكثر موثوقية بالمواقف اليومية.
🌱 شو إلك منها؟
بتخيل إنك عم تشوف فيديو على الموبايل وفجأة يجي ضباب أو إضاءة قوية، النموذج رح يقدر يحدد شو مهم بالفيديو وما يضل يضلّ بالخطأ. يعني إذا بدك برنامج يترجم أو يشرح فيديوهاتك حتى لو كان فيه تشويش، هالتقنية رح تخلي النتيجة أدق وأكتر فائدة. ممكن تشوف هالتحسينات بخدمات الترجمة الفورية أو المساعدة الذكية بالفيديوهات اليومية.
video-understanding robustness multimodal LLM tool-orchestration hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

DailyReport: معيار مفتوح لتقييم وكلاء البحث اليوميين

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks
الفريق قدم DailyReport، معيار مفتوح بيقيس قدرات وكلاء البحث اللي بيستعملوا LLMs على مهام بحث يومية. فيه 150 مهمة مفتوحة مع 3,546 rubric بتغطي أسئلة واقعية ومُحدّثة، وكل مهمة بتنقسم لمهام فرعية وبيتم تقييمها عبر cascade rubrics بأبعاد منفصلة. الطريقة بتعطي درجات تفسيرية لكل بُعد وتلخّصها بدرجة تفضيل المستخدم. التجربة على 17 نظام وكيل أظهرت إنهم بعدهم ما وصلوا لتوقعات المستخدمين.
ليش بتهمّك؟: هالمعيار بيساعدنا نفهم وين الوكلاء بحاجة لتحسين، وبيوفر دليل واضح للباحثين لتطويرهم.
🌱 شو إلك منها؟
تخيل إنك كل يوم بدك تعرف شي جديد، مثل حالة الطقس أو أسعار السلع، وتستنى من برنامج يجيب لك إجابة كاملة من الإنترنت. هالبحث بيطوّر طريقة نقيم هالبرامج بحيث نعرف إذا كانوا فعلاً بيساعدونا أو لأ. يعني إذا استعملت تطبيق بحث ذكي، رح تلاقيه يرد عليك بدقة أكتر وبطريقة أسهل.
search agents benchmark evaluation LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

ما وراء هندسة المكافأة: وصفة بيانات لتحسين التفكير على سياق طويل

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning
الفريق اللي بيضم Xiaoyue Xu وزملاؤه بيقترحوا طريقة بسيطة من ناحية البيانات، يشتغلو فيها على ثلاث مجموعات مهام: الاسترجاع، تجميع أدلة متعددة، والتفكير. جمعوا 8 مجموعات بيانات فيها حوالي 14 ألف مثال، وجرّبوا هالوصفة على ثلاثة نماذج Qwen (4B/8B/30B-A3B) وشافوا تحسينات واضحة على سبع benchmarks للـ long‑context. كمان لما استمروا بالتدريب على نموذج مُجهَّز للوكيل، ارتفعت أداء GAIA وBrowseComp. الباحثين رح يطلقوا مجموعاتهم للكل لتسهيل الأبحاث الجاية.
ليش بتهمّك؟: هالوصفة بتظهر إن تحسين بيانات التدريب ممكن يرفع قدرة النماذج على التفكير عبر نصوص طويلة بدون ما نحتاج نلعب كثير على المكافآت.
🌱 شو إلك منها؟
إذا بتستعمل تطبيقات مثل المساعدات الذكية أو برامج تلخيص طويلة، هالطريقة ممكن تخليها تفهم وتلخّص أكتر من شغلة. تخيّل إنك تعطيها قصة طويلة، وتطلعلك خلاصة دقيقة بدل ما تضل تتوه. هالتحسين رح ينعكس على الخدمات اليومية اللي بنستعملها على الموبايل أو الكمبيوتر.
reinforcement learning long-context data-centric LLM RL hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

تعلّم من أخطائك: مسارات تصحيحية للـ Self‑Distillation

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation
الفريق قدم طريقة جديدة اسمها Trajectory‑Augmented Policy Optimization (TAPO) لتقوية الـ self‑distillation بالـ LLMs. بدل ما يطابقوا توزيعات الاحتمالات بس، TAPO بيولد مسارات صغيرة فيها الخطأ لحد ما يصير، وبعدين يضيف تشخيص طبيعي‑اللغة وتصحيح مبني على مثال صحيح من نفس المجموعة. هالطريقة بتحافظ على توزيع النموذج على طول التدريب وبتقلل التداخل بالـ gradient. التجارب على مسابقات رياضية مثل AIME وHMMT أظهرت تحسين ثابت مقارنةً بـ GRPO.
ليش بتهمّك؟: بتخلّي النماذج الكبيرة تتعلم من أخطائها بشكل أدق، فبتصير أحسن بالتحليل وحل المسائل المعقّدة.
🌱 شو إلك منها؟
زي ما بنقعد نراجع غلطاتنا ونصححها، هالنظام بعلّم الذكاء الاصطناعي يتعلم من غلطاته ويصححها. النتيجة إنه التطبيقات اللي بتعتمد على الفهم والشرح، مثل المساعدات التعليمية أو محركات البحث، رح تعطي إجابات أدق وأقرب للواقع. يعني إذا استعملت برنامج تعليم رياضيات، رح تلاقيه يشرح لك الخطأ ويصححه بطريقة أوضح.
self-distillation language-models reinforcement-learning trajectory reasoning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

مقارنة GUI vs. CLI: شو بيحدّوا بإنجاز المهام

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
الورقة بتقدّم benchmark جديد فيه 440 مهمة على سطح المكتب، بيقارن بين وكلاء GUI اللي بيشتغلوا بشاشات بس وبين وكلاء CLI اللي بيستعملوا أوامر مهارة. كل وكيل استقبل نفس الهدف والحالة، بس كل واحد مقيد بطريقته الأصلية. النتائج بتظهر إن أقوى وكيل GUI وصل لـ59.1% نجاح، بينما تحسين مهارات CLI رفع نسبة النجاح لـ69.3%، يعني العائق بالـCLI أكتر بنقص المهارات مش بنقص النموذج.
ليش بتهمّك؟: هالنتائج بتفيدنا نعرف وين نركز تحسين الوكلاء حسب نوع الواجهة لنرفع كفاءة تنفيذ المهام اليومية.
🌱 شو إلك منها؟
تخيل إنك بدك تشغّل برنامج على الكمبيوتر، إما تضغط على أيقونات أو تكتب أوامر. هالدراسة بتقول إن الضغط على الأيقونات ممكن يكون أبطأ إذا ما في تفاعل ثابت، لكن كتابة أوامر بتكون أسرع إذا عندك أوامر جاهزة لكل شغلة. يعني إذا بتستعمل أدوات ذكية لتشغيل البرامج، لازم تتأكد إنهم عندهم كل الأوامر المطلوبة لتسريع شغلك.
agents benchmark GUI CLI execution hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

تحدّي الوكلاء: إعادة تقييم قدراتهم مع GauntletBench

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
الفريق قدم GauntletBench، منصة ويب بتقيس قدرة الوكلاء على شغل مهام صعبة ما بنشوفها كتير، مثل الفهم الزمني، الفهم الرسومي، والتفكير ثلاثي الأبعاد، ضمن خمس تطبيقات احترافية. كل تطبيق فيه عشرين مهمة بصرية، يعني مجموع ميت مهمة. النتائج فرجتنا إن أقوى وكيل حالياً وصل بس 19.1٪ نجاح، بينما البشر العاديين يقدروا ينجزوا أكتر من 80٪.
ليش بتهمّك؟: هالنتيجة بتبيّن قديش الوكلاء لسه بعيدين عن التعامل مع مشاكل الحياة اليومية المعقّدة.
🌱 شو إلك منها؟
تخيّل برنامج ذكي بيساعدك ترتّب الفيديوهات أو تصمّم دوائر، بس هالبرامج لسا ما بتعرف تتعامل مع تفاصيل معقّدة مثل ترتيب المشاهد بوقت معين أو فهم رسومات ثلاثية الأبعاد. هالورقة بتظهر إنه لازم نطوّرهم أكتر قبل ما نعتمد عليهم بأعمالنا اليومية، مثل تعديل الفيديوهات أو تصميم منتجات.
agents benchmark generalization evaluation AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

نفس الدليل، إجابة مختلفة: فحص حساسية الترتيب في MLLMs

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models
الفريق قدم أداة اسمها Facet-Probe لتدقيق حساسية الترتيب عند نماذج اللغة الكبيرة المتعددة الوسائط. الفحص يغطي خمس جوانب: الاختيار، قطعة الدليل، ترتيب المستند، مجموعة الصور، وترتيب الأنماط المختلطة، وباستخدام نموذج بايزي للردود بيفصلوا بين ضجيج الترتيب والتحيز. النتايج أظهرت إن ولا نموذج من الـ18 اللي اختبروه ما فيه استقرار للترتيب، ومعدل القلب بين 24٪ و50٪، وأقوى نموذج لسا بيقلب الجواب بـ13.4٪ من الحالات. جربوا تعديل الـprompt بدون تدريب، ولقوا إن التحسين محدود وما بينتقل بين النص والرؤية.
ليش بتهمّك؟: لأن حساسية الترتيب بتقوّض موثوقية النماذج اللي بنعتمد عليها يوميًا، وبتخلي النتائج غير ثابتة.
🌱 شو إلك منها؟
تخيّل إنك تسأل مساعد ذكي سؤال عن صورة، وتعيد ترتيب الكلام أو الصور، يطلع لك جواب مختلف مع نفس المعلومات. هالشي ممكن يخلّي التطبيقات اللي تعتمد على الفهم المشترك بين النص والصورة تعطي إجابات غير دقيقة، مثل البحث بالصور أو المساعدة في التعليم. لازم نعرف هالمشكلة لنحسّن الأدوات اللي بنستعملها كل يوم.
multimodal evaluation robustness language-models AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

توائم رقمية مبنية على اللغة (LLM) لمساعدة كبار السن

Language-Based Digital Twins for Elderly Cognitive Assistance
الفريق اقترح إطار توائم رقمية يعتمد على اللغة لتقليد سلوك الحديث عند كبار السن، ودمج إشارات ستايلومتريكية وبيانات سياقية. استخدموا large language models مع multi-head conditional variational autoencoder (cVAE) لقياس جودة الاسترجاع وتوقع درجات الإدراك. جربوا النموذج على مجموعة I-CONECT ولقوا إنه بيحافظ على الخصائص الشخصية وبيحقق أخطاء توقع MoCA قريبة من البيانات الحقيقية، متفوق على ردود GPT العادية.
ليش بتهمّك؟: هالطريقة بتخلينا نتابع صحة الإدراك عند كبار السن بشكل مستمر وغير غازي، وبدّها تنبؤ مبكر للمشاكل.
🌱 شو إلك منها؟
تخيّل عندك صديق افتراضي يقدر يسمعك ويحكي معك كل يوم، وإذا لاحظ تغيّر بسيط بكلامك، بيخبر طبيبك إنه ممكن تكون في مشكلة بالذاكرة. هالشي بيساعد العيلة تتصرف بسرعة قبل ما يصير الوضع أسوأ، وبيظهر بأبليكشنات الصحة على الموبايل.
digital twin language model cognitive health MoCA cVAE arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

تمكين وكلاء الواجهة الرسومية عبر استكشاف الخبرات الذاتية واستخدام الخبرات المتراجعة للتخطيط

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
الفريق قدم طريقة جديدة اسمها PEEU، بتخلي الوكلاء الصغار يكتشفوا بيئات الويب لحالهم ويستفيدوا من الخبرات المتراجعة لتوليد بيانات تدريب عالية المستوى ومتوافقة. كمان حطوا إطار TDHAF لتحليل كيف بتنقسم المهام على مستويات منخفضة ومتوسطة وعالية، ولقوا إن التدريب على مستوى عالي بيقوي القدرة على التعميم خارج النطاق. التجارب على benchmark حقيقي ورّيت إن نموذج 7B حقّق 30.6% دقة، وتفوق على نموذج Qwen2.5-VL-32B الضخم.
ليش بتهمّك؟: هالطريقة بتخلّي الوكلاء الصغار يخططوا مهام معقدة بأقل تكلفة وتدعم الخصوصية، فمفيد للباحثين اللي بدهم نماذج فعّالة بدون ما يصرفوا موارد هائلة.
🌱 شو إلك منها؟
تخيّل إنه في برنامج يقدر يفتح لك المواقع ويضغط الأزرار بدل ما تضيّع وقتك كل مرة. هالطريقة بتعلم البرنامج كيف يتصرف لوحده حتى لو الموقع جديد أو غير مألوف. يعني ممكن تشوف هالتقنية بأدوات مثل المساعدين الرقميين اللي يشتغلوا على المتصفح.
GUI agents planning multimodal MLLM OOD arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

كشف، نسيان، وإسترجاع: حماية نماذج التلخيص النصي من تسميم البيانات

Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
الفريق Thota وزملاؤه بيّنوا إنه تسميم البيانات وقت الفاين‑تنج ممكن يخلّي نماذج الـLLM لتلخيص النصوص تنتج ملخصات منحازة أو مضرة، وحتى مع الحفاظ على مقاييس التقييم التقليدية. طوّروا طريقة دفاعية بعد التدريب بتستغل تحليل influence‑function لتكتشف أزواج الوثيقة‑الملخص المشبوهة، وبالـblack‑box بيقيسوا حساسية النموذج لتغييرات تحافظ على المعنى. كمان قدموا تقنية gradient‑ascent للـunlearning بتسترجع سلوك النموذج الأصلي مع خسارة بسيطة بROUGE. التجارب على تسعة معماريات وست مجموعات بيانات أظهرت دقة كشف بين 85‑92٪ وقدرة استعادة سلوك النموذج لأكثر من 96٪.
ليش بتهمّك؟: لأنه هالطريقة بتخلّي نماذج التلخيص أقوى ضد هجمات التسميم وبدون ما نحتاج نعيد تدريب النموذج من الصفر.
🌱 شو إلك منها؟
تخيل إنه تطبيق تلخيص الأخبار ممكن يضيف تحيّز أو معلومات غلط بسبب بيانات مدربة سيئة؛ هالحل بيفحص ويصلّح هالخطأ بعد ما التطبيق صار شغّال. يعني إذا شفت ملخص غريب أو متحيّز، النظام بيقدر يكتشفه ويصححه بسرعة، بدون ما يضطروا يحمّلوك نسخة جديدة من التطبيق.
data poisoning text summarization LLM defense influence functions arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

حقن التعليمات في فحص السيرة الذاتية بالـ LLMs

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings
الفريق Baxi وزملاؤه درسوا كيف ممكن المتقدّمين يضيفوا نصّ إعلاني خفيف ما بيضيف مؤهلات جديدة، بس بيهدف إنه يغيّر تقييم الـ LLM لسيرهم الذاتية. جربوا تجارب مسيطرة ولقوا إنّو هالإضافة بتحسّن ترتيب المتقدّم إذا كان مستوى السيرة متقارب وعدد الناس اللي بيضيفوا قليل. بس إذا زاد عدد اللي بيعملوا injection أو صاروا المؤهلات مختلفة، الفعالية بتقل بسرعة وبيصير الترتيب غير عادل. النتيجة إنّو أنظمة الفحص بالـ LLM حساسة أكتر لما تكون التلاعبات نادرة والفروقات بين المتقدّمين صغيرة.
ليش بتهمّك؟: هالورقة بتبين إنه الاعتماد على الـ LLM لتقييم المتقدّمين ممكن يفضحنا لمخاطر التلاعب إذا ما ضبطنا النظام، وبتحذرنا من مشاكل العدالة.
🌱 شو إلك منها؟
تخيل إنك عم تحط سيرة ذاتية وتضيف جملة بسيطة مثل "أنا شغوف ومجتهد" بدون ما تكون جديدة، هالكلام ممكن يخلي البرنامج يظنّك أحسن من غيرك. هالشي بيظهر إذا الشركات تستعمل برامج ذكية لتقييم المتقدّمين. يعني لازم ننتبه إنه هالتقنيات ممكن تتلعب فيها وتأثر على فرص الناس.
prompt injection LLM hiring fairness ranking arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

TriViewBench: اختبار جديد لتقييم التفكير البصري المتعدد المشاهد

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs
الفريق Chen و Guo قدموا TriViewBench، بنشمارك بصور ثلاثية المشهد من مشاهد 3D صناعية فيها عد إشي من الكائنات ودرجة تغطية. فيه 1,923 مشهد وأكثر من 14 ألف سؤال‑جواب مقسّمين لأربع مستويات تعقيد وثلاث فئات تفكير: قرار محلي، عدّ كائنات، واسترجاع شامل. لما جربوا 18 نموذج MLLM، كلهم أظهروا نفس الترتيب (قرار محلي أحسن من عدّ كائنات، وأحسن من الاسترجاع الشامل) وتدهور الأداء مع زيادة التعقيد، وCoT ما عطاهم أي فائدة تقريباً.
ليش بتهمّك؟: هالنتيجة بتبين إنه النماذج الكبيرة لسا ما بتقدر تتعامل مع تعقيدات بصرية حقيقية، فبدنا نشتغل على تحسين تمثيل الفضاء ثلاثي الأبعاد.
🌱 شو إلك منها؟
تخيل إنك عم تحاول تفهم صورة فيها أشياء مخفية أو متراكبة، هالنماذج ممكن تضلّ ما تعرف عدد الأشياء أو مكانها. يعني لو استعملتها لتطبيقات مثل المساعدة الذكية للناس المكفوفين أو فحص الصور الطبية، ممكن يطلعوا نتائج غير دقيقة. هالورقة بتخلينا نعرف وين المشكلة ونحاول نصلحها قبل ما نعتمد على هالتقنيات بحياتنا اليومية.
multimodal benchmark visual reasoning MLLM scaling arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

ضعف المصنّفات اللغوية أمام النصوص العدائية المتطوّرة (GAversary)

Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text
الفريق قدم GAversary، وهو خوارزمية جينية بتولد نصوص عدائية لتخريب نماذج اللغة. الخوارزمية بتشتغل كصندوق أسود، يعني ما بتحتاج تدخل لداخل النموذج غير قيمة الـlogit لتقود البحث. استُخدموا تمثيلات GloVe لتبديل الكلمات بحيث يبقوا قريبين للمعنى الأصلي. التجارب أظهرت إن GAversary بتقلل الدقة من 76.8٪ لتصير 5.8٪، مع زيادة بسيطة بعدد الكلمات المتبدلة ووقت التنفيذ.
ليش بتهمّك؟: هالطريقة بتكشف قدّيش نماذج اللغة ممكن تنكسر بسهولة، وبتعطينا فرصة نطور دفاعات أقوى.
🌱 شو إلك منها؟
تخيل إنه برنامج ترجمة أو محرك بحث ممكن ينخدع بكلمة أو كلمتين بس، ويتغيّر الجواب تمامًا. GAversary بيوريّنا إنه هالمشاكل حقيقية وبتصير بسرعة. إذا استعملنا أدوات أمان أقوى، رح نضمن إنه التطبيقات اليومية ما تتلخبط بسبب هالنوع من الهجمات.
adversarial attacks genetic algorithm NLP security GloVe robustness arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

Fast LeWorldModel: نموذج بصري سريع لتخطيط الفعل

Fast LeWorldModel
الفريق اللي قدم Fast-LeWM بيقول إنه الطريقة القديمة لنماذج LeWM كانت بتعتمد على roll‑out خطوة بخطوة، وهاد كان بيخلي التخطيط بطيء وبيزيد الأخطاء مع طول الأفق. Fast-LeWM بيستبدل هالroll‑out بتوقع prefixes للأفعال، يعني بيحسب النتائج المستقبلية للخطوات المتتابعة مرة وحدة وبالتوازي. الطريقة بتعلم النموذج كيف بتتطور الحالات مع مجموعات الأفعال بدل ما يتعلم خطوة واحدة بس. التجارب بتبين إنه Fast-LeWM بيوصل نجاح أعلى ووقت تخطيط أقل، وكمان بيقلل فقدان الـlatent مع زيادة طول التخطيط.
ليش بتهمّك؟: هالطريقة بتسرّع التخطيط البصري وبتقلل الأخطاء، فبتخلي الأنظمة الذكية تتصرف أسرع وأدق.
🌱 شو إلك منها؟
تخيل إنك عم تحاول تخطط مسار سيارة ذاتية القيادة، هالنظام بيساعدها تتخذ قرارات بسرعة أكبر وبخطأ أقل. يعني بدل ما تحسب كل خطوة لحالها، بيحسب مجموعة خطوات مرة وحدة، زي ما بنقّص وقت الطهي بنجهّز كل المكونات سوا. هالتحسين ممكن تشوفه بأجهزة الملاحة أو الروبوتات المنزلية اللي بتستجيب أسرع.
world models planning computer vision efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

قدّيش قوي OCR-Reasoning؟ اختبار صمود نماذج الرؤية‑اللغة تحت التشويش البصري

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations
الفريق Yuxing Cheng وزملاؤه قدموا benchmark جديد اسمه OCR‑Robust لتقيس صمود نماذج الرؤية‑اللغة على مهام OCR لما الصور تتعرض لتشويش بصري. Benchmark فيه 812 عينة من مستندات، نصوص مشهدية، إيصالات، كتابة يد، محتوى رياضي، وكمان مخططات وجداول. اختاروا 5 أنواع تشويش بثلاث مستويات شدّة بناءً على دراسة أولية على 18 نوع. قيموا 18 نموذج باستخدام مقاييس مثل RCR وWCR وCRI، ولاحظوا إن الدقة النظيفة ما بتدلّ على الصمود، وإن المخططات والجداول بتتأثر أكتر من المستندات.
ليش بتهمّك؟: هالنتيجة بتساعدنا نختار نماذج أقوى لتطبيقات القراءة الآلية للصور، خصوصًا بالمجالات اللي فيها تشويش أو تشويه بصري.
🌱 شو إلك منها؟
بتخيلوا تطبيق على الموبايل يقرأ الفواتير أو اللوحات الإرشادية حتى لو الصورة مش واضحة أو فيها ضبابية؟ هالورقة بتشتغل على تحسين هالنوع من التطبيقات لتظل تعطي نتائج صحيحة. يعني إذا استخدمنا نموذج صامد، رح تقدروا تعتمدوا على تطبيقات مسح المستندات أو ترجمة النصوص من الصور حتى بظروف إضاءة سيئة أو صور مشوشة.
OCR robustness vision-language benchmark evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

Dziri Voicebot: نظام حواري صوتي للدارجة الجزائرية

Dziri Voicebot: An End-to-End Low-Resource Speech-to-Speech Conversational System for Algerian Dialect
الفريق قدم نظام حواري صوتي كامل للدارجة الجزائرية، من الكلام للكمّال. النظام مقسّم على أربع وحدات: ASR مبني على Whisper، وحدة الفهم اللغوي بتستعمل transformer وبتشتغل بنظام حواري موجه للمهام، وجهاز توليد النص مع RAG، وآخر لتوليد الصوت من النص على كوربوس جديد. كل وحدة تدربت على مجموعات بيانات خاصة بمجال الاتصالات، ونتائج التجارب أظهرت نسبة خطأ كلمة قليلة بالـ ASR، وتصنيف نوايا عالي للـ NLU، وجودة ثابتة للـ TTS. هالنظام بيقدّم قاعدة قابلة لإعادة الإنتاج لأي حوار صوتي بالدارجة.
ليش بتهمّك؟: هالورقة بتفتح باب لتطبيقات حوارية صوتية بالدارجة، وبتقرب التقنية من الناس اللي ما عندهم موارد لغوية كافية.
🌱 شو إلك منها؟
تخيل إنك تقدر تحكي مع تطبيق على موبايل بالدارجة وتفهمه طلباتك بدون ما تكتب إشي. هالشي بيسهّل على الناس اللي ما يكتبوا أو ما يلاقوا أدوات تدعم لهجتهم. ممكن تشوف هالتقنية بالمستقبل بخدمات الدعم الصوتي أو المساعدات الذكية.
speech-to-speech low-resource Arabic dialect conversational AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

توليد صور آمن بطريقة autoregressive مع codebooks متطوّرة

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks
الفريق Xue وزملاؤه بيقدّموا طريقة جديدة لتوليد الصور بأمان باستخدام codebooks بيتحسّنوا لحالهم. بيستغلوا نموذج multimodal موحد ليحدّدوا الصور اللي ممكن تكون غير آمنة، وبعدين بيعدّلوا الـcodebook ليشيلوا الخرائط الضارة. بعدين بيعملوا fine‑tuning للـcodebook على أزواج صورة‑نص آمنة، والعملية بتتكرّر لحد ما ما في تحسين إضافي. النتيجة نموذج يولد صور بجودة عالية ومحمية من المحتوى الضار من غير ما نحتاج تعليقات بشرية.
ليش بتهمّك؟: هالطريقة بتخلينا نضمن أمان الصور المولدة بدون ما نحتاج فرق تقييم بشرية، فبتسرّع تطبيقات النص‑إلى‑صورة بأمان.
🌱 شو إلك منها؟
تخيل إنك تكتب وصف لصورة وتطلع لك صورة نظيفة وما فيها محتوى مسيء، مثل ما بنشوف بأدوات الرسم الذكي. هالشي بيساعد الأطفال أو المستخدمين غير المتخصصين يطلعوا محتوى آمن بسهولة. ممكن تشوف هالتقنية ضمن تطبيقات تعديل الصور أو مولّدات الصور على الإنترنت.
image generation safety autoregressive multimodal codebook arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 9
In-Context World Modeling
فكرة إن النموذج يقدر يبني نموذج للعالم من خلال السياق اللي بنعطيه، يعني يقدر يتوقع أو يفهم البيئة من الكلام قدامه.
Vision-Language-Action
مفهوم بدمج الرؤية، اللغة، والقيام بأفعال، يعني النظام يقدر يشوف، يحكي، ويتصرف بناءً على الفهم، مش بس يكتب
fine-tuning
تدريب إضافي لنموذج موجود بالفعل على بيانات جديدة وخاصة عشان يكون أفضل في مجال معين. يعني بدل ما نبني نموذج من الصفر، بنأخذ واحد موجود ونحسّنه. بنسمع عنه عشان بيوفر وقت وموارد كتير.
system identification
system identification عملية بنحدد فيها خصائص نظام معين من خلال ملاحظاته، لتوقع سلوكه.
Forward Influence
Forward Influence فكرة بتقيس كيف قرار أو فعل هلّق بيأثر على المستقبل، احنا بنستعملها عشان نقييم سياسات أو نماذج بتتوقع تأثيرها بعيد.
predictive uncertainty
predictive uncertainty يعني مدى عدم تأكد النموذج من توقعاته، يعني بنعرف متى النموذج مش متأكد من الجواب
denoising diffusion
هي طريقة بنستعملها لنزيل الضوضا من إشارات عشوائية خطوة خطوة، عشان نولد صور أو نصوص نظيفة ومفهومة.
attention
الـ attention هو آلية بتخلي النموذج يركز على أجزاء معينة من النص وقت ما بيولد أو يفهم، يعني بنقول له يركز على الإشي المهم.
Blind Trust Problem
المشكلة هادي بتصير لما النموذج يثق بالنتايج اللي بيعطيها بدون ما يتحقق، يعني بيصدق كل شي بلا ما يشكك، وهاد ممكن يخلّي الأخطاء تنتشر
🤖 موديلز 3
InfoKV
موديل أو بنية بتخزن معلومات الـ key‑value بطريقة أكتر فاعلية، احنا بنسمع عنه لأنه بيقلل الذاكرة وبيسرّع الاستدلال
diffusion transformer
هالنموذج بدمج فكرة الـ diffusion مع بنية الـ transformer، يعني بيستفيد من قوة الـ transformer لتوليد محتوى بصورة تدريجية، بنسمع عنه لأنه بيعطي نتائج أقوى بالـ generative tasks
Robust-TO
Robust-TO هو نموذج صُمم ليكون قوي ضد الأخطاء والتغيّرات، يعني حتى لو البيانات فيها تشويش أو ظروف مش متوقعة، النموذج بدنا يظل يعطي نتايج ثابتة، بنستعمله عشان الموثوقية العالية.
📏 مقاييس 2
entropy
entropy هو مقياس للغموض أو العشوائية بتوزيع الاحتمالات، كل ما زادت الentropy كل ما كان النص أو الصورة أكتر تنوع.
trajectory accuracy
trajectory accuracy بيقيس إذا النموذج عم يتبع المسار الصح عبر الوقت، بنستعمله عشان نتأكد إنو التعلم ما بيضل يضل.
كل المصطلحات ←
العدد السابقشو في AI؟ | 26 يونيو — تحسين كفاءة MLLM وتتبع متعدد المشاهد
📚 كل الأعداد