📡 أحدث عدد

شو في AI؟ | 6 يوليو — تحسين سياسات التدريب للـ LLM

يومي 📅 2026-07-06
سلام 👋 اليوم بنقدملكم عدد عن آخر تطورات الذكاء الاصطناعي، من تحسين سياسات التدريب للـ LLM لحد تقييم أمان النماذج. بدنا نركز على كيف هالتقنيات بتقربنا من تطبيقات عملية وموثوقة.
#1

AGE: تمويه تكيفي لتضمين الرسوم البيانية في توليد معزز بالاسترجاع

AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation
الباحثين قدموا طريقة جديدة اسمها Adaptive-masking for Graph Embedding أو AGE، بتستغل Transformer لتعلم تمثيلات للرسوم البيانية بطريقة تمويه ذاتي‑إشراف. الفكرة إنه الرسوم البيانية فيها عقد أساسية (key nodes) صعب نتوقعها من الجيران، فـ AGE بيختار تعلّم العقد غير الأساسية عبر مُعِدّ عُقَد قابل للتعلم. هالطريقة صارت تحسن كثير من دقة نماذج الـ GraphQA على أربع مجموعات اختبار مختلفة، خصوصًا لما تكون الـ LLM متجمدة وما فيها تعديل.
ليش بتهمّك؟: هالطريقة بتقرب تمثيل الرسوم البيانية من الفهم النصي للـ LLM، فـ بتخلي الاسترجاع المعتمد على الرسوم البيانية أدق وأقوى بالواقع.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع برنامج ذكي يقدر يطلع معلومات من شبكة علاقات معقّدة، مثل خريطة علاقات الأصدقاء أو بيانات الشركات. الطريقة الجديدة بتخلي البرنامج يفهم هالشبكات أسرع وأدق، يعني ممكن يجاوب أسئلة معقّدة عن علاقات الأشخاص أو المنتجات بشكل أقرب للواقع. رح تشوف هالتحسينات في تطبيقات البحث أو المساعدين الذكيين اللي بتستعمل بيانات مترابطة.
RAG graph embedding transformer retrieval benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

خدعة تحسين سياسات التدريب: تحسين سياسات الاستدلال المتدرجة للـ LLM

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
الباحثين بيّنوا إنه الفجوة بين سياسات التدريب والاستدلال بالـ LLM بتسبب عدم استقرار خلال التدريب باستخدام reinforcement learning. اقترحوا هدف جديد اسمه Monotonic Inference Policy Improvement (MIPI) بيركّز على تحسين سياسة الاستدلال الفعلية مش بس سياسة التدريب. بناءً عليه، طوّروا إطار عمل من خطوتين اسمه Monotonic Inference Policy Update (MIPU) بيختار التحديثات اللي بتقلل الفجوة بين الجانبين. التجارب على نماذج بحجمين مختلفين أظهرت إنه MIPU بيرفع أداء التفكير المتوسط وبي stabilizes التدريب.
ليش بتهمّك؟: الورقة بتوضح طريقة تضمن إنه تحسين التدريب ينعكس فعليًا على أداء النموذج لما يُستعمل بالواقع، فبهيك بنقلل الانهيارات ونرفع الفائدة من الـ LLMs.
🌱 شو إلك منها؟
تخيل إنك عم تدرب برنامج ترجمة، بس التدريب ما بيوصل للنسخة اللي بتشتغل على هاتفك، فبيصير فيه أخطاء. هالبحث بيحط طريقة تضمن إنه التحسينات اللي بتصير أثناء التدريب تنعكس على النسخة اللي بتستعملها كل يوم. يعني رح تشوف ترجمة أو إجابات أدق وأقل أخطاء على التطبيقات اللي بتستعملها.
reinforcement learning LLM policy optimization training stability hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

ترجمة الأدب بالذكاء الاصطناعي "مقبولة"، بس القُرّاء بيفضّلوها البشرية

AI translation of literary texts is "fine", but readers still prefer human translations
الفريق طلب 15 قارئ شغوف يقارنوا بين الترجمات البشرية (HT) وترجمات الآلة (MT) اللي تولدت عبر LLM، على 15 رواية حديثة من الفرنسية، البولندية واليابانية للإنجليزي. القُرّاء لقوا إن MT "مقبولة" بس بيفضّلو HT لأنه أسهل، أوضح، وأكثر غمرًا، خاصةً لما يقرأوا النصوص على مستوى الفقرات. كمان القُرّاء ما قدروا يميزوا بين النسختين بشكل موثوق، والقياسات الآلية ما عكست تفضيلاتهم، بل فضلت MT. الباحثين أطلقوا مجموعة البيانات LAIT لتقييم ترجمة الأدب من منظور القارئ.
ليش بتهمّك؟: هالنتيجة بتبين إنّو حتى لو الـLLM بيترجم النصوص بدقّة، القُرّاء ما زالوا بحاجة للترجمة البشرية لتجربة قراءة غامرة ومريحة.
🌱 شو إلك منها؟
إذاً، ممكن تستعملوا ترجمة آلية لتقريب الفكرة من كتاب، بس القصة رح تحسّها أريح وأقرب للروح إذا ترجمتها إنسان. مثل ما بتقرا قصة من صديقك بدل ما تقراها من برنامج، الإحساس بيكون أعمق. هالنتيجة بتظهر على خدمات ترجمة النصوص اللي بنستعملها يوميًا، مثل التطبيقات اللي تترجم الكتب أو المقالات.
translation LLM evaluation dataset literary hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Embodied.cpp: تشغيل نماذج الذكاء المتجسدة على الروبوتات بسهولة

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
الفريق قدم Embodied.cpp، وهو runtime مكتوب بـC++ لتشغيل نماذج الذكاء المتجسدة على الروبوتات المتنوعة. بيقسم التنفيذ لخمس طبقات من adapters للمدخلات لبناء السلاسل للـbackbone ولـhead plugins، وبيوفر تنفيذ متعدد السرعات ودمج للـinference بأقل تأخير. جربوه على نموذجين VLA (HY‑VLA و pi0.5) وعلى benchmark أولي للـWAM، ولقوا نجاح 100 % و91 % بالمهمات، وكمان قلّصوا الذاكرة من 312 MiB إلى 88 MiB.
ليش بتهمّك؟: هالورقة بتخلّي المطوّرين ينشروا نماذج الذكاء المتجسدة على أي روبوت بسهولة وبدون ما يضطروا يكتبوا كود خاص لكل جهاز.
🌱 شو إلك منها؟
تخيّل روبوت بيتك يقدر يفهم أوامر صوتية ويتصرف بسرعة، حتى لو كان معالجه ضعيف. مع Embodied.cpp، الشركات تقدر تحط هالذكاء على الروبوتات بأقل تكلفة، يعني ممكن تشوف تطبيقات أذكى بالمنازل أو بالمصانع قريبًا. هالشي بيظهر في خدمات مثل المساعدين المنزليين أو العربات اللي تشتغل بالمخازن.
embodied AI inference runtime robotics C++ efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

LACUNA: منصة لتقييم دقة محو المعرفة من LLMs

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning
الباحثين قدموا LACUNA، وهو اختبار أول بيوفر معرفة دقيقة بالمكان اللي بتتخزن فيه معلومات حساسة داخل وزنات نموذج LLM. بيحطوا بيانات شخصية صناعية داخل وزنات محددة بموذج 1B و7B من OLMo، وبعدين بيقيسوا إذا طرق المحو بتستهدف هالوزنات ولا بس تخفي المعلومة من المخرجات. النتائج بتظهر إن الطرق الحالية قوية بالمخرجات بس غير دقيقة بالموقع، وبيقدروا يرجعوا المعلومة بهجمات إعادة الظهور. كمان بيبينوا إن إذا نجح التحديد، طريقة بسيطة تعتمد على التدرج بتعطي محو قوي ومقاوم لهالهجمات.
ليش بتهمّك؟: لأنها بتخلينا نعرف إذا محو البيانات من النماذج بيصير فعليًا أو بس مخفي، وهذا مهم لحماية خصوصية المستخدمين.
🌱 شو إلك منها؟
تخيل إنه برنامج ذكي يتذكر معلوماتك الشخصية، وإنت بدك تتأكد إنه ما بقى يقدر يطلعها. هالاختبار بيساعد المطوّرين يتأكدوا إنه هالمعلومات فعلاً انقلبت من المخزن، مش بس مخفية. يعني إذا بتستعمل تطبيقات شات أو ترجمة، هالطريقة بتعطيك أمان أكتر إنه بياناتك ما رح تنكشف مرة تانية.
unlearning LLM benchmark privacy localization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

تحسين التعرف على المتكلم في مسلسلات TV الطويلة بـ LLM

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
هالورقة بتقدّم benchmark جديد اسمه DramaSR-532K فيه 532 ألف سطر حوار من أكتر من 900 شخصية، وبتحتاج ندمج الصوت، النص والصورة لنحدد المتكلم. كمان فريق الباحثين طوّر طريقة اسمها DramaSR-LRM مبنية على large reasoning model، بتستعمل أدوات متعددة لتجمع الأدلة السياقية وتوزّعها على طول الحلقة. التجارب بتظهر إنه DramaSR-LRM بتتفوق على الطرق القديمة، خصوصًا على الجمل القصيرة اللي ما فيها معلومات صوتية كافية.
ليش بتهمّك؟: لأنه التعرف الدقيق على المتكلم بيساعد أنظمة الفهم الآلي للفيديوهات تكون أذكى وتنتج ترجمات أو ملخصات أدق.
🌱 شو إلك منها؟
تخيّل إنك عم تشوف مسلسل وتطبيق يقدر يكتب لك اسم الشخصية كل ما تحكي، حتى لو الكلام قصير أو الصوت مش واضح. هالشي بيسهّل عليك متابعة القصة، خصوصًا إذا كنت عم تتعلم لغة جديدة أو عندك ضعف سمع. ممكن تشوف هالتقنية تنضاف لتطبيقات الترجمة الفورية أو أدوات البحث داخل الفيديوهات.
speaker recognition multimodal benchmark LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

الجهد العقلي يرفع موثوقية توليد الكود بالـ agents

Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
فريق Mehta عمل دراسة ملاحظية على ٩٠ تشغيل مستقل لوكلاء برمجة يبنوا تطبيق لوحة زمنية من مواصفات مفصلة. جربوا نماذج مختلفة وإشي مستويات جهد تفكيري (High و xHigh)، وأدوات اختبار وتصميم، وقاسوا النتايج على معيار ١٤ معيار وظيفي. النتايج بيّنوا إن رفع جهد التفكير من High لـ xHigh خلى نسبة النجاح من أول محاولة ترتفع من ٢٨٪ لـ ٨٩٪، بينما أداة الاختبار زادت التكلفة بدون ما تحسّن النتيجة الوظيفية. كمان التصميم الموجه رفع جودة الشكل بس ما غير الأداء الوظيفي.
ليش بتهمّك؟: هالنتيجة بتفرجينا إنه استثمار الوقت بالتفكير أهم من إضافة أدوات معقّدة لتوليد كود موثوق من أول مرة.
🌱 شو إلك منها؟
زي ما إذاك بتقرا الوصفة قبل ما تطبخ، إذا خدت وقت لتفكر بالخطوات قبل ما تكتب الكود، النتيجة بتطلع مضبوطة من أول مرة. الأدوات الإضافية ممكن تكلفك وقت وفلوس بدون ما تحسّن النتيجة. هالشي بنشوفه اليوم مع مساعدات البرمجة الذكية اللي بنستعملها على الحاسوب أو بالمتصفح.
code generation agents reasoning evaluation AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

Self-Gating Attention لتوقع السلاسل الزمنية بكفاءة

Self-Gating Attention for Efficient Time Series Forecasting
الفريق بقيادة Dezheng Wang قدموا طريقة جديدة اسمها Self-Gating Attention لتقليل تكلفة حساب الـ attention في نماذج الـ Transformer. الفكرة إنه بيستبدلوا حساب الـ query وkey بمصفوفة مشتركة متعلمّة مع مكوّن residual يعتمد على البيانات، فبيصير الوقت والذاكرة خطيين مع طول السجل. دمجوها داخل عدة نماذج توقع واختبروها على تسع مجموعات بيانات من الكهرباء للطقس للطب، ولقوا إنه الأداء يبقى قوي بس الاستنتاج صار أسرع وأخف. النتائج نُشرت كـ preprint على arXiv ضمن cs.LG و cs.AI.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج التوقع تشغّل أسرع وباستهلاك أقل للذاكرة، فبتنفع للأنظمة اللي مواردها محدودة.
🌱 شو إلك منها؟
تخيل إنك عم تتوقع استهلاك الكهرباء للبيت أو حالة الطقس للمنطقة، وبدك التطبيق يجاوب فوراً من على موبايلك. الطريقة الجديدة بتسرّع هالتوقعات وبتقلل استهلاك البطارية. يعني رح تشوف تطبيقات الطقس أو مراقبة الصحة تشتغل بأقل تأخير وبشكل أكثر سلاسة.
time series attention efficiency forecasting transformer arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

محاذاة هيدرونية مدركة للرتبة لتقليل بيانات الرؤية‑النص

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
الفريق Jongoh Jeong وزملاؤه قدموا طريقة جديدة لتقليل حجم مجموعات البيانات اللي فيها صور ونصوص. الطريقة اسمها RAHA، بتنقل تمثيلات البيانات لهيدروني (hyperbolic) وبتستغل فكرة إن العلاقة بين الصورة والنص غالبًا منخفضة الرتبة، فبتحافظ على تنوع كل وسيلة. بهالطريقة بيحافظوا على قدرة النموذج على الاسترجاع عبر الوسائط حتى مع ميزانية بيانات محدودة، وبيظهروا نتائج تنافسية على Benchmarks مع تحسين النقل.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب نماذج الرؤية‑النص أسرع وأرخص بدون ما نخسر الدقة.
🌱 شو إلك منها؟
تخيّل إنك بدك تعلم برنامج يتعرف على صور مع أوصافها، بس ما عندك وقت ولا مساحة لتخزين آلاف الصور. هالطريقة بتصنع شوية أمثلة صناعية صغيرة تعطي نفس الفائدة، زي ما بنستعمل نسخة مختصرة من كتاب لتلخيصه. ممكن تشوف التحسينات بالمواقع اللي بتستعمل بحث بالصور، مثل تطبيقات التسوق أو الترجمة الفورية للصور.
vision-language dataset distillation hyperbolic retrieval multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

رأس المال البشري هو المفتاح لتوقعات الذكاء الهجين

Human Capital, Not Model Benchmarks, Predicts Hybrid Intelligence in Forecasting
الفريق بقيادة Vivienne Ming استخدموا سوق توقعات حقيقي (Polymarket) ليفحصوا كيف بيأثر الجمع بين الإنسان والذكاء الاصطناعي على الدقة. لقوا إن الأداء الهجين بيظهر بثلاث حالات: إما الناس يتبعوا النموذج، أو يخلطوا بين توقعاتهم والنموذج ويصيروا أسوأ، أو يشتغلوا بتفكير تكميلي ويوصلوا لأفضل من السوق نفسه. الصفات مثل أخذ منظور الآخرين، التواضع الفكري، والفضول كانت هي اللي بتميز الفئة القليلة اللي حققت هالنتيجة. النتائج أولية لكن ثابتة إحصائيًا وبتحمل فكرة تكرار الدراسة بشكل مسجّل مسبقاً.
ليش بتهمّك؟: هالنتيجة بتوضح إنه نجاح التعاون بين الإنسان والذكاء الاصطناعي ما بيعتمد بس على قوة النموذج، بل على مهارات وتوجهات البشر.
🌱 شو إلك منها؟
تخيل إنك عم تستخدم تطبيق توقعات للرياضة أو سوق الأسهم، وبتلاقي إنه إذا كنت متواضع وبتحب تستمع لآراء غيرك، ممكن توصل لتوقعات أدق من أي برنامج. هالشي يعني إنه مهاراتنا الشخصية ممكن تعطي قيمة أكبر للذكاء الاصطناعي، مش بس التكنولوجيا نفسها. ممكن تشوف هالتأثير بأدوات التنبؤ اللي بتستعملها يوميًا، مثل تطبيقات التداول أو توقعات الأخبار.
human-AI collaboration forecasting hybrid intelligence prediction markets cognitive traits arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

OrbitQuant: كوانتِزايشن بدون بيانات للـ Diffusion Transformers

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
الفريق قدم طريقة جديدة للكمّية (quantization) بعد التدريب للـ Diffusion Transformers، ما بتحتاج أي بيانات معايرة. استعملوا دوران RPBH عشان يخلوا كل إحداثي يركّز حول قيمة ثابتة، فبيكفوا كود‑بوك واحد لكل التايم ستيب والبرومبتات والطبقات. الطريقة بتشتغل على الصور والفيديو بنفس الإعداد، وحققت أفضل نتائج للـ PTQ بأقل عدد من البتات، حتى W2A4 بجودة مقبولة.
ليش بتهمّك؟: هالطريقة بتقلل استهلاك الطاقة والوقت لتوليد الصور والفيديوهات عالية الجودة، فبتخلّي النموذج يشتغل أسرع على الأجهزة المتوسطة.
🌱 شو إلك منها؟
بتخلي مولّدات الصور والفيديو اللي بنستعملها على هواتفنا أو لابتوباتنا أسرع وأرخص، زي ما بنضغط ملف كبير بدون ما يبوّظ جودته. يعني إذا بدك تولّد صورة أو فيديو من نص، ما رح تنتظر وقت طويل أو تحتاج جهاز قوي. هالتحسين ممكن يبان في تطبيقات تعديل الصور أو الفلاتر الذكية اللي بتستعمل الذكاء الاصطناعي.
quantization diffusion computer vision efficiency PTQ arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

DecompRL: توليد كود مودولي لتقليل تكلفة الـ GPU

DecompRL: Solving Harder Problems by Learning Modular Code Generation
الفريق قدم طريقة جديدة لتقليل عبء الحساب على الـ GPU عند توليد الكود. الفكرة إنه بدلاً من محاولة توليد حل كامل مرة وحدة، بنقسم المشكلة لمجموعة من الدوال الصغيرة اللي كل وحدة فيهن بتنحل بشكل مستقل، وبنركّبهم مع بعض لنحصل على عدد كبير من الحلول المحتملة. خوارزمية DecompRL بتعلم من خلال الـ RL كيف تقسم وتنفّذ هالهيكل الهرمي، وبتحوّل التكلفة من الـ GPU للـ CPU الرخيص، فبتقلل استهلاك الـ GPU بحوالي 50 مرة. التجارب على LiveCodeBench وCodeContests أظهرت إنه الطريقة بتتفوق على أساليب الـ RL التقليدية، وبتقدر تحل مشاكل ما كانتش الموديلات الأساسية قادرة تحلها.
ليش بتهمّك؟: هالطريقة بتخلّي توليد الكود بالـ LLM أسرع وأرخص، وبتفتح باب حل مشاكل أصعب ما كانش ممكن نتعامل معها قبل هيك.
🌱 شو إلك منها؟
تخيل إنك بدك تحل مسألة برمجة معقدة، بدل ما تنتظر ساعات على الكمبيوتر، النظام بيقسمها لمهام صغيرة وبيحلها بسرعة على جهازك العادي. هالشي بيقلل الفاتورة على الإنترنت لأنه ما بيحتاجش سحابة GPU مكلفة. ممكن تشوف هالتحسينات في أدوات البرمجة اللي بتعتمد على الذكاء الاصطناعي مثل GitHub Copilot أو أدوات التعليم البرمجي على الويب.
code generation reinforcement learning modular LLM efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

هل Benchmarks تحسين الأداء تقيس Coding Agents بصدق؟

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?
الفريق Chen وزملاؤه فحصوا ثلاث Benchmarks مشهورة لتقييم Coding Agents على مستوى المستودعات. رجّعوا الباتشات الرسمية لـ 740 مهمة على أربع أنواع من آلات Google Cloud ولاحظوا إن القواعد الأصلية ما انطبقت إلا على نسبة قليلة من المهمات. كمان بيّنوا إن ترتيب المتقدّمين على Leaderboard بيتغيّر كتير حسب قواعد حساب النقاط، وبيظهروا مهام فيها إشارة أداء أكثر موثوقة.
ليش بتهمّك؟: المقال بيفضح إن التقييم الحالي ممكن يضلّلنا بخصوص قدرة الوكلاء على تحسين الكود، فبدنا نعيد التفكير بطريقة القياس.
🌱 شو إلك منها؟
تخيل إنه برنامج تحسين الكود اللي بتستعمله ممكن يبين إنه أسرع من غير ما يكون فعلاً هيك؛ هالورقة بتورجيك إنه لازم نتأكد من النتائج قبل ما نثق فيها. هالشي بيأثر على المطوّرين اللي بيعتمدوا على أدوات تحسين تلقائي، لأنه ممكن يختاروا أداة ما بتعطي تحسين حقيقي. إذا بتستعمل أي أداة لتقليل وقت تشغيل برامجك، لازم تشوف إذا النتائج موثوقة ولا مجرد أرقام على Leaderboard.
benchmark coding agents performance reproducibility evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

لما زيادة العينات بتضر: السقف المودالي وسقف الارتباط في اختبار النماذج

When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling
الباحثين Bay و Yearick بيكشفوا إنه زيادة عدد العينات وقت الاختبار ما دايمًا بتحسن النتيجة. بيّنوا إنه بعد ما بيصير في عشرات قليلة من التجارب، الجواب اللي بيختاروه النظام بيستقر – هاد هو الـmodal ceiling – ولما بنقيس الأداء على benchmark بيصير مستقر أسرع، يعني وصلنا للـcorrelation ceiling. بعد هالنقطة، كل عينة إضافية بس بتزيد التكلفة وممكن تخلي الجواب أسوأ. الورقة بتعرّف رقم واحد بسيط اسمه effective number of samples لنعرف متى نوقف العينة الزايدة.
ليش بتهمّك؟: بساعدنا نحدد بدقة متى نوقف توليد إجابات إضافية لتقليل تكلفة الأخطاء وزيادة كفاءة النماذج.
🌱 شو إلك منها؟
تخيل إنك تسأل مجموعة أصدقاء نفس السؤال، أول ما يجيك رد واضح من كم صديق، ما في داعي تسأل باقي المجموعة لأنهم بس رح يضيفوا ضجيج. هالشي بيقلل وقتك ومجهودك، وبيخليك توصل لحل أسرع. هالفكرة موجودة فعليًا بأدوات البحث أو المساعدات الذكية اللي بتعتمد على نماذج اللغة.
sampling test-time scaling language models evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

قوانين التوسع للبحث القريب التقريبي على شبكة في أبعاد عالية

Scaling Laws for Grid-Based Approximate Nearest Neighbor Search in High Dimensions
الفريق قدم تحليل شامل لخوارزمية multiprobe grid معتمدين على حجم الداتا N وبعدها d. التجارب بيّنت إنه عند مجموعة تمثيلات GloVe، هالخوارزمية بتحافظ على ثابت تقليل الأداء مع زيادة البعد، بينما طرق الجراف والشجر بتتدهور. كمان بتعطي تقريباً خطية في استعلام N وتكلفة فهرسة أقل من غيرها. النتائج بتشير إنه هالطريقة ممكن تنافس غيرها بالبيئات اللي فيها بناء الفهرس كثير أو أبعاد عالية.
ليش بتهمّك؟: لأنها بتقلل وقت وتكلفة بناء الفهارس وتظل سريعة حتى بأبعاد عالية، وهذا مهم لتطبيقات الذكاء الاصطناعي الكبيرة.
🌱 شو إلك منها؟
تخيل إنك بدك تدور على صورة أو نص بسرعة بين ملايين الملفات، هالخوارزمية بتخلي البحث أسرع وأرخص. يعني لو بتستعمل تطبيق توصيات أو بحث بصور، رح تحس بالفرق بالسرعة. هيك ممكن تشوف تحسين بالأداء على خدمات مثل محركات البحث أو تطبيقات الهواتف.
ANN scaling laws grid search high-dimensional data efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

SciIR: مجموعة بيانات وتحدي لتوليد صور علمية

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
الفريق قدم SciIR، مصدر كبير لتدريب وتقييم نماذج توليد الصور العلمية. جمعوا أكتر من 80 ألف زوج صورة‑نص من أوراق حديثة، ورتبوه حسب ثلاث أبعاد من التفكير العلمي: الكيان (Icon)، العملية (Index)، والقانون (Symbol). كمان سووا SciIR‑Bench لتقييم الدقة العلمية باستخدام أسئلة تفصيلية، ولما عدلوا نموذج Qwen‑Image‑SciIR على هالمجموعة وصلوا لتحسين واضح من 35٪ لـ43٪.
ليش بتهمّك؟: هالورقة بتظهر قديش النماذج الحالية ما بتفهم الصور العلمية وبتعطي طريقة واضحة لتحسينها.
🌱 شو إلك منها؟
تخيل إنك تقدر تولّد رسومات توضيحية دقيقة لمقال علمي من غير ما تحتاج تصممها يدوياً، هالشي بيسهّل على الطلاب والباحثين يوضحوا أفكارهم بسرعة. ممكن تشوف هالتقنية بالمستقبل داخل أدوات كتابة الأبحاث أو التطبيقات التعليمية.
image generation scientific reasoning dataset benchmark multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

مراقبة السلامة للـ LLMs على طول

Online Safety Monitoring for LLMs
المؤلفين Mona Schirmer وزملاؤها بيحكوا إنه رغم تدريب الـ LLMs لتكون متوافقة، لسا ممكن يطلعوا ردود غير آمنة وقت الاستخدام. بدنا نظام يراقب المخرجات مباشرةً ويطلق إنذار إذا ما كان في أمان، فالقوا طريقة بسيطة بتحوّل إشارة verifier من نموذج خارجي لإنذار عبر حدّ (threshold) بيتظبط بالتحكم بالمخاطرة. التجارب على مجموعات أسئلة رياضية ومجموعات red‑teaming ورّيت إنه هالتصميم البسيط بيشتغل تقريباً زي المراقبين المتقدمين اللي بيستعملوا اختبارات الفرضية المتسلسلة.
ليش بتهمّك؟: هالطريقة بتخلينا نكشف الأخطاء الخطيرة للـ LLMs فوراً قبل ما توصل للمستخدمين، فبتحافظ على أمان التطبيقات اليومية.
🌱 شو إلك منها؟
تخيل إنك عم تستعمل برنامج يكتب لك إجابات سريعة، وإذا صار فيه شي غير مناسب، النظام بيبلّغك فوراً. هالشي بيساعد إنه ما يصير محتوى ضار أو مخيف على الشاشة. بتشوف هالمراقبة بالأنظمة اللي بتعتمد على الذكاء الاصطناعي مثل المساعدات الرقمية أو أدوات التعليم الإلكتروني.
LLM safety monitoring risk-control AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

صمود أقوى ضد هجمات النص داخل الصورة بـ Training‑free Concept Localization

Towards Robustness against Typographic Attack with Training-free Concept Localization
الباحثين قدموا طريقة ميكانيكية لتفسير نماذج الـ CLIP بدون أي تدريب إضافي، بيستعملوا عينات لتفكيك تمثيلات الحالة المخفية وبيحددوا شو جزء الـ Vision Transformer بيركّز على النص بدل ما يركز على المشهد. من خلال تحليل احتمالي واستخراج الدوائر، علقوا على رؤوس الانتباه اللي بتشفر المعلومات اللغوية بشكل مبالغ فيه، وبعدين عدلوا وزن الانتباه بهالرؤوس بدون ما يحتاجوا لتدريب. هالتدخل البسيط رفع صمود النموذج ضد هجمات النص داخل الصورة، وتفوق على طرق الدفاع المشرفة أو غير المشرفة. التجربة أثبتت إنه تطبيق الطريقة على مشفرات الرؤية بأحدث الـ LVLMs بيحسّن دقة الإجابة على الأسئلة البصرية في RIO‑Bench تحت هجمات النص.
ليش بتهمّك؟: لأنه هالهجمات ممكن تخلي الأنظمة الحساسة مثل السيارات الذاتية القيادة تتلخبط، الطريقة هادي بتقوّي الأمان بدون ما نحتاج نعيد تدريب النماذج الكبيرة.
🌱 شو إلك منها؟
تخيل إنه كاميرا السيارة تشوف لوحة مكتوب عليها "STOP" بس النص مش على إشارة حقيقية، ممكن يخلّي السيارة تتصرف غلط. هالبحث بيلاقي طريقة لتصحيح هالخطأ من غير ما نعيد تدريب النظام، فبيخلي التطبيقات اليومية زي الملاحة أو البحث بالصور أأمن وأدق. يعني كل ما تستخدم تطبيق بيقرأ الصور، رح تلاقيه أقل عرضة للخطأ بسبب الكلام المكتوب داخل الصورة.
CLIP VisionTransformer robustness typographic attack mechanistic interpretability arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

TestEvo-Bench: بنشمارك حي لتطور الاختبارات والكود

TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution
الفريق Wang وزملاؤه قدموا TestEvo-Bench، بنشمارك حي بيجمع إشي بين تغيّر الكود والاختبارات. كل مهمة مربوطة بكمّيت حقيقي من مستودعات جافا، ومعاها إعدادات بيئية لتشغيل الاختبارات وحساب معدلات النجاح، التغطية، وmutation score. البنشمارك بِصير live benchmark، يعني كل ما يطلع commit جديد بيضيف مهمة جديدة عشان نقلل خطر تسريب البيانات. جربوا أربع agents (Claude Code، Gemini CLI، SWE-Agent) مع نماذج أساسية (Claude Opus 4.7، Gemini 3.1 Pro) ولقوا نجاح لحد 77.5% بالجيل واختبار التحديث.
ليش بتهمّك؟: هالبنشمارك بيساعدنا نقيم إذا الوكلاء يقدروا يفهموا تغيّر الكود ويحدّثوا الاختبارات بشكل عملي.
🌱 شو إلك منها؟
تخيل إنه كل مرة يضيف مطوّر كود جديد، البرنامج يكتب أو يحدّث الاختبارات لحاله. هالشي بيوفر وقت كتير وبيقلل الأخطاء اللي ممكن تطلع بعد التحديث. ممكن تشوف هالتقنية بأدوات CI/CD اللي تستخدمها الشركات لتأكد من جودة الكود.
software testing benchmark code evolution AI agents arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

المُحَوِّل المتكيّف مع المتطرفات (Exformer) لتوقع السلاسل الزمنية

Extreme Adaptive Transformer for Time Series Forecasting
الفريق اللي قدّامه Sanjeev Shrestha وزملاؤه بدنا يقدّموا Exformer، إطار جديد بيستغل attention متكيّف مع المتطرفات ليعالج السلاسل الزمنية اللي فيها إشي نادر وشديد. بيضم ثلاث مكوّنات sparse: Local للمدى القصير، Stride للأنماط الدورية، وExtreme لتتبع العلاقات بين الأنماط العادية والحدّية. التجارب على أربع مجموعات بيانات لتدفق المياه أظهرت إن Exformer يتفوق على أحدث النماذج في توقع الثلاث أيام الجايين. هالنتيجة بتثبت إن التركيز على الأحداث المتطرفة بيقوّي قدرة الـTransformer على التنبؤ بسلاسل زمنية غير متوازنة.
ليش بتهمّك؟: لأن التنبؤ بالفيضانات بدقة بيساعد على إنقاذ حياة الناس وإدارة الموارد المائية.
🌱 شو إلك منها؟
تخيّل إذا كان عندك تطبيق يحمّلك تنبؤات للمنسوب بالمياه قبل ما يصير الفيض. هالتقنية بتخلي التنبؤات أدق بوجود الأمطار الغزيرة المفاجئة. ممكن تشوف هالتحسينات في أنظمة الإنذار المبكر أو تطبيقات الزراعة الذكية.
time series transformer extreme events forecasting hydrology arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 10
RAG
اختصار Retrieval-Augmented Generation، يعني احنا بنجيب معلومات من قواعد بيانات خارجية ونخليها تساعد النموذج إنه يجاوب على أسئلتك بشكل أدق. بنسمع عنه عشان بيحسّن إجابات الذكاء الاصطناعي ويقلل الأخطاء.
self-supervised learning
Self-supervised learning طريقة تعلم ما بتحتاج بيانات معنونة، النموذج بيصنع إشيه الخاص كعلامة لتدريب نفسه، بدنا نستخدمها عشان نقلل الجهد البشري.
graph embedding
graph embedding هو تمثيل الرسوم البيانية بأرقام عشان الموديلات تقدر تفهم العلاقات بين العقد. بنسمع عنه عشان بدنا نحول الهياكل المعقدة لإشي بسيط يشتغل مع التعلم العميق.
Monotonic Inference Policy Improvement
معناها إنو احنا بنحسّن سياسة الاستدلال بطريقة monotonic، يعني ما بننزل أبداً، بنستعملها عشان ما يتراجع الأداء.
Monotonic Inference Policy Update
Monotonic Inference Policy Update يعني احنا بنحدّث السياسة بطريقة ما بتنخفض فيها الجودة، عشان النموذج يظل يتحسن.
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
automatic metrics
المقاييس الأوتوماتيكية هي طرق تقييم بتحسب جودة النموذج بشكل آلي، بنستعملها عشان ما نحتاج تقييم يدوي لكل نتيجة
VLA
VLA هو مفهوم بيمثل Attention مع متجهات طولية (Vector Length Attention) لتقليل تعقيد الحسابات، بنسمع عنه لأنه بيخلي الـ Transformers أسرع.
WAM
WAM يعني Weighted Attention Mechanism، طريقة بتوزّع الانتباه على أجزاء النص بحسب أهميتها.
unlearning
unlearning يعني حذف أو تعديل معلومات معينة من نموذج الذكاء الاصطناعي، بنسمعه عشان بنقدر نتعامل مع البيانات الحساسة.
🤖 موديلز 2
transformer
هو البنية الأساسية اللي قايم عليها الذكاء الاصطناعي الحديث كله، بيشتغل على مبدأ الانتباه يعني بيحدد شو الأهم في البيانات وبيركز عليه. بنسمع عنه لأنه الأساس اللي اتبنى عليه ChatGPT وكل النماذج الكبيرة.
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
📏 مقاييس 1
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
🗂️ بيانات 1
LAIT
LAIT مجموعة بيانات عربية بتجمع نصوص وإشارات عاطفية، بنستعملها عشان ندرب نماذج الذكاء الاصطناعي على الفهم.
كل المصطلحات ←
العدد السابقشو في AI؟ | 5 يوليو — تحسين ذاكرة الوكلاء LLM
📚 كل الأعداد