📡 أحدث عدد

شو في AI؟ | 3 يوليو — اختيار انتباه هجين، معيار وكلاء، اختبار ذاكرة

يومي 📅 2026-07-03
سلام 👋 هلقيت هالعدد من النشرة بيغطي أهم التطورات بالذكاء الاصطناعي لهاليوم، من نماذج الانتباه للـFlashMorph لحد تسريع توليد الصور بالـDiffusion.
#1

FlashMorph: اختيار طبقات هجين للانتباه

Morphing into Hybrid Attention Models
الفريق قدم طريقة جديدة لاختيار أي طبقات بالـTransformer تضلّها full‑attention وأي طبقات تتحوّل لـlinear attention. الطريقة، اللي سماوها FlashMorph، بتبني نموذج ممكن يتحوّل، بتجمّد الأوزان، وبتحسّن بوابات الطبقات على بيانات صناعية طويلة، وبعدين بتحدّد الطبقات وفق ميزانية محددة. بعدين بيعملوا distillation وتدريب إضافي للـlong‑context. التجارب أظهرت إنه FlashMorph بيختار تكوينات هجين أقوى، ويحافظ على استدعاء النصوص الطويلة وأداء البنشمارك، وبنفس الوقت بيقلل تكلفة الاختيار مقارنةً بالطرق القديمة.
ليش بتهمّك؟: لأنها بتقلل عدد طبقات الانتباه الكاملة، FlashMorph بيسمح للنماذج تتعامل مع نصوص أطول بأقل تكلفة حسابية.
🌱 شو إلك منها؟
بتخلي الأنظمة الذكية تقدر تقرأ وتفهم مقالات أو كتب طويلة بسرعة أكبر، زي ما بنقرا قصة طويلة من أولها من غير ما نتعب. هالتحسين ممكن يبان في تطبيقات تلخيص الأخبار أو المساعدة في كتابة تقارير طويلة، بحيث تلاقي الرد أسرع وأدق.
hybrid attention transformer efficiency layer selection long-context hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

AgenticDataBench: معيار شامل لوكلاء البيانات

AgenticDataBench: A Comprehensive Benchmark for Data Agents
الفريق قدم معيار جديد اسمه AgenticDataBench ليقيس أداء وكلاء البيانات اللي مبنيين على الـLLM. جمعوا مهام واقعية من 15 مجال مختلف، وحتى من 5 حالات B2B حقيقية من شركة fintech. إذا ما فيه بيانات واقعية، بيستخدموا LLM لتوليد مهام جديدة مبنية على مهارات مستخرجة من Stack Overflow عبر clustering هرمي. بعدين قيموا أحدث وكلاء البيانات على هالمعيار وطلعوا تقارير تفصيلية على مستوى كل مهارة.
ليش بتهمّك؟: هالمعيار بيساعد الباحثين والشركات يعرفوا وين وكلاء البيانات بيشتغلوا كويس وين لازم يتحسنوا، فبالتالي بيقود لتطبيقات علم بيانات أوتوماتيكية أقوى.
🌱 شو إلك منها؟
تخيل إنه عندك برنامج يقدر يشتغل على بياناتك ويطلع لك تقارير جاهزة بدون ما تحتاج تقعد ساعات تحللها. هالمعيار بيضمن إنه هالبرامج تكون دقيقة وتشتغل على كل أنواع البيانات، سواءً كان عندك فواتير أو بيانات مبيعات. يعني ممكن تشوف هالتقنية داخل أدوات تحليل البيانات اللي بتستخدمها يوميًا على الإنترنت أو في تطبيقات الشركات.
benchmark data agents LLM data science evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

AgenticSTS: اختبار الذاكرة المحدودة للوكيل LLM على المدى الطويل

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
الفريق قدم طريقة جديدة لتحديد شنو الذاكرة اللي يقدر الوكيل LLM يشوفها قبل كل قرار، عن طريق "bounded contract" اللي بيستبدل دمج كل المحادثات بعملية "typed retrieval" منسقة. هالطريقة بتخلي البرايمبت ثابت مهما طول اللعبة، وبتخلّي كل طبقة ذاكرة تنقّص لوحدها لتشوف تأثيرها. جربوا هالنظام على لعبة Slay the Spire 2، اللي بتحتاج مئات القرارات، ولاحظوا إن حتى أقوى النماذج ما قدروا يربحوا على أصعب مستوى. التجربة أظهرت إن إضافة طبقة مهارات استراتيجية زادت عدد الانتصارات من 3 لـ 6 من 10 ألعاب، مع إن الفروقات ما زالت غير حاسمة إحصائيًا.
ليش بتهمّك؟: هالورقة بتعطي الباحثين طريقة واضحة لتقييم كيف الذاكرة المتحكم فيها بتأثر على أداء الوكلاء على المدى الطويل، وبتفتح باب لتصميم وكلاء أقوى وأكفأ.
🌱 شو إلك منها؟
تخيل عندك مساعد ذكي ما بيخلط كل الكلام اللي صار معاك، بس يجيب لك بس المعلومات اللي بتحتاجها بالضبط. هالنظام بيخلي هالمساعد يشتغل أسرع ويعطيك نصايح أدق، زي ما بتستفيد من خريطة طريق واضحة بدل ما تكون مليانة شوارع متشابكة. رح تشوف هالتحسينات بأدوات مثل تطبيقات الدردشة أو الألعاب اللي بتعتمد على ذكاء اصطناعي يخطط لك خطواتك.
LLM agents memory benchmark reinforcement learning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

ريكونتكست: طريقة بدون تدريب لاستغلال الأدلة في التفكير بسياق طويل

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
الفريق قدم طريقة اسمها RECONTEXT، بتشتغل على LLMs بدون ما تحتاج تدريب جديد ولا ذاكرة خارجية. الفكرة إنه بيستغل إشارات الصلة داخل النموذج ليجمع أدلة من النص الأصلي، وبيرجع يلعب فيها قبل ما يطلع الجواب، وبيضل يحتفظ بكل السياق. العملية بتفصل تنظيم الأدلة عن توليد الإجابة، وبتعطي تحسين واضح على استغلال الأدلة عبر تجارب على عدة نماذج طويلة.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج الكبيرة تستفيد أكتر من المعلومات الموجودة، فبتعطي إجابات أدق حتى مع نصوص ضخمة.
🌱 شو إلك منها؟
تخيل إنك عم تقرأ مقال طويل وبدك تلخّصه بسرعة، RECONTEXT بيشتغل زي القارئ اللي بيختار أهم الفقرات قبل ما يكتب الملخص. هالشي بيساعد التطبيقات مثل المساعدات الرقمية أو أدوات البحث لتفهم نصوص طويلة بشكل أحسن، فبتلاقيها بتعطيك إجابات أقرب للواقع.
long-context reasoning LLM inference arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

هل السكيل بيقوي محاكاة المجتمع بالـLLMs؟

Will Scaling Improve Social Simulation with LLMs?
الفريق استكشف إذا كان تكبير حجم نماذج اللغة الكبيرة (LLMs) رح يحل مشاكل محاكاة المجتمع. لقوا إنه مع زيادة حسابات النموذج (من 10^18 لحد 10^20 FLOPs) بتحسن كبير في ثلاث مجالات: نمذجة الآراء، محاكاة السلوك، والتنبؤ الزمني. لكن التحسن أبطأ بالمجالات اللي فيها بيانات قليلة أو آراء غير ممثلة بالإنجليزي، وكمان ما في تحسن واضح في ضبط النموذج مع تحيزات البشر أو تعلم المكافآت المرتبطة. باختصار، السكيل بيقوي المحاكاة بأغلب الحالات، بس فيه استثناءات بالمجالات منخفضة الموارد.
ليش بتهمّك؟: لأنه إذا فهمنا كيف السكيل بيأثر على محاكاة السلوك الاجتماعي، بنقدر نطوّر نماذج تفهم وتنبّئ تفاعلات الناس بشكل أدق.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يتوقع كيف الجماعة رح تتصرف أو شو رأيهم بموضوع معين، زي توقع نتيجة انتخابات أو رد فعل المجتمع على قرار حكومي. هالشي رح يصير أقرب للواقع إذا زاد حجم النموذج، بس لسه في شغلات مثل تحيزات الناس ما بتنحل بسهولة. ممكن تشوف هالتطورات في تطبيقات الدردشة أو التحليل الاجتماعي على الإنترنت.
language models scaling laws social simulation AI research arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

بحث وكيل للبيانات الأرضية (Agentic Search)

Bringing Agentic Search to Earth Observation Data Discovery
فريق Yu وزملاؤه قدموا نظام بحث وكيل يشتغل على استفسارات طبيعية اللغة ويطلعلك مجموعات البيانات والأدوات الجغرافية المناسبة. النظام بيستفيد من Knowledge Graph الخاص بـ NASA وبنقّيه بمقاييس جديدة من خلال تدريب شبكة عصبية على benchmark اسمه NASA-EO-Bench. الجمع بين النموذج العصبي وBM25 رفعوا الدقة كثير، وبعدها ضفوا مرحلة إعادة ترتيب صفرية التدريب باستخدام LLM، وخلّوا النتائج تتحسّن أكتر.
ليش بتهمّك؟: هالورقة بتظهر كيف إن الجمع بين Knowledge Graph وLLM بيقدر يسهّل وصول الباحثين للبيانات الأرضية بسرعة أكبر وبدقة أعلى.
🌱 شو إلك منها؟
تخيّل إنك تحكي للكمبيوتر "بدي صور الأقمار الصناعية للمنطقة اللي فيها محصول القمح اليوم"، والنظام يجيبلك كل البيانات المطلوبة فورًا، زي ما بتسأل صديق. هالشي بيساعد المزارعين، مخططي الطوارئ، والباحثين يلاقوا معلومات دقيقة بدون ما يضيعوا وقتهم يدوروا يدويًا.
agentic search knowledge graph retrieval benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

برنامج‑كـأوزان: برمجة الدوال الضبابية

Program-as-Weights: A Programming Paradigm for Fuzzy Functions
الورقة بتقدّم فكرة برمجة الدوال الضبابية، يعني بنكتب مواصفات طبيعية للدوال وبنحوّلها إلى قطعة نيرونية صغيرة تشتغل محلياً. الفريق استعملوا نموذج 4B اسمه Program-as-Weights (PAW) وتدربوا على مجموعة FuzzyBench اللي فيها 10 مليون مثال، ليطلعوا adapters خفيفة تشتغل على مفسّر Qwen3 خفيف الوزن. النتيجة إنّو مفسّر 0.6B يقدر يحقّق نفس جودة نموذج Qwen3-32B لكن بذاكرة أصغر بكتير وسرعة أعلى على لابتوب عادي.
ليش بتهمّك؟: بـPAW بنقلل تكلفة ووقت تشغيل الدوال الضبابية، وبيخلينا نقدر نستخدم نماذج كبيرة من غير ما نحتاج سحابة غالية كل مرة.
🌱 شو إلك منها؟
تخيّل إنك بدك تصفي رسائل إيميل أو تصلّح ملفات JSON بسرعة، بدل ما تستنى استجابة من خدمة سحابية، هالطريقة بتعطيك برنامج صغير يشتغل على جهازك فوراً. يعني بتصير العملية أسرع وأرخص، وممكن تستخدمها حتى لو ما عندك إنترنت. هالشي ممكن يلاقي تطبيقات في تطبيقات الهواتف أو الأدوات المكتبية اللي بنستعملها كل يوم.
fuzzy functions language models compilation efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

DemoPSD: تلطيف السياسات بتقليل الخلاف

DemoPSD: Disagreement-Modulated Policy Self-Distillation
الفريق بقيادة Yunhe Li قدم طريقة جديدة اسمها DemoPSD لتدريب نماذج اللغة الكبيرة بطريقة ما بتخلّي الطالب يتعلم من المعلم بس بطريقة انتقائية. بدل ما الطالب يلتزم بكل توجيه المعلم، DemoPSD بخلط توزيع المعلم وتوزيع الطالب باستخدام ما بيسموه reverse-KL barycenter، وبيتحكم بالخلط حسب الفرق بين التوزيعات على كل كلمة. هالطريقة بتقلل تسريب المعلومات المفضلة للمعلم وبتحافظ على قدرة الطالب على الاستكشاف، وبتظهر نتائج أحسن على SciKnowEval وGPQA مقارنةً بـ GRPO وSDPO.
ليش بتهمّك؟: لأنها بتخلي نماذج اللغة الكبيرة تتجنّب الاعتماد على shortcuts غير متوفرة وقت الاختبار وتقدر تتعامل مع أسئلة من مجالات جديدة.
🌱 شو إلك منها؟
بتخيلوا إنه هالذكاء الاصطناعي صار أذكى وما بيغلط يجاوب على أسئلة بنصّها بس لأنه استنتج shortcuts من التدريب. يعني إذا سألته سؤال عن طب أو فيزياء، رح يعطيكم إجابة مش بس يكرر نص التدريب. هالتحسين ممكن تشوفوه بأدوات البحث أو المساعدين الرقميين اللي بتستعملوا يوميًا.
self-distillation LLM generalization knowledge distillation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

اختيار بيانات واعي بالخلايا العصبية لتدريب LLM بدون توضيحات

Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation
الفريق Chen و Li قدموا طريقة جديدة اسمها Neuron-OPSD لتدريب نماذج اللغة الكبيرة بدون ما نحتاج لتسميات بشرية. الفكرة إنه بيستخدموا تنشيطات الخلايا العصبية داخل النموذج لتحديد إشي البيانات المناسب وبناء سياق المعلم، بعدين يتعلم النموذج من هالسياق بطريقة on‑policy. هالطريقة ما بتحتاج أي لابل حقيقي وبتحافظ على الأداء داخل المجال المتخصص وبنفس الوقت ما بتقلل من القدرة على التعميم أو من جودة التقدير.
ليش بتهمّك؟: بتخلّي نماذج اللغة تتطور بأقل تكلفة، خصوصاً بالمجالات اللي الخبراء غاليين أو صعب نلاقيهم.
🌱 شو إلك منها؟
تخيل إنه البرنامج الذكي بيتعلم لحالو من شغله بدون ما نحتاج نكتب له تعليمات أو نعلمه يدوياً. هالطريقة بتقربنا من تطبيقات ذكية بالمجالات المتخصصة، مثل الطب أو الهندسة، من غير ما ندفع مبالغ كبيرة على خبراء. رح تشوف هالتطورات بأدوات المساعدة الرقمية اللي بتستعملها يومياً.
self-distillation LLM data selection calibration on-policy arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

مستقبل الـNLP بعيد عن مؤتمرات الـNLP: أنماط الهجرة العلمية

The Future of NLP may not be at NLP Conferences: Scholarly Migration Patterns in Natural Language Processing
الدراسة بتقول إنه الباحثين بالـNLP صرّوا يروحوا يقدّموا شغلهم مش بس بـACL، بل كمان بمؤتمرات الـML العامة. بعد ما طلعت الـLLMs، لقينا إنه الباحثين القدامى خسروا حوالي 19.2 نقطة مئوية من حصة النشر بالمؤتمرات الرئيسية للـACL، وزادوا بحوالي 14.8 نقطة بالمسارات الجديدة Findings، وكمان ارتفعوا 8.6 نقطة بالمؤتمرات العامة للـML. الباحثين الجدد كمان صاروا ينوّعون أماكن النشر، من 84% بـACL في 2019 إلى 74% بسـ2024، بينما زادت مشاركتهم بالمؤتمرات العامة للـML من 5% إلى 21%. التحليل بيظهر إنه النشر بالمؤتمرات العامة بيوفر زيادة ملحوظة في عدد الاستشهادات، وهاد بيأثر على اختيار المكان للنشر.
ليش بتهمّك؟: هالنتائج بتوضح إنه مستقبل بحوث الـNLP رح يتغيّر لتوزيع أوسع بالمؤتمرات، وهاد ممكن يفتح فرص أكتر للباحثين الجدد يلاقوا تأثير أكبر.
🌱 شو إلك منها؟
يعني إذا كنت تقرأ أو تشتغل على أدوات كتابة نصوص ذكية، ممكن تلاقي إنه الفرق بين الباحثين صار أكتر تنوعاً بالمجالات، زي ما بنشوف أكتر تطبيقات ذكية على مواقع التواصل. هالتحول بيخلي المعرفة تنتشر أسرع، وبيظهر في خدمات مثل المساعدين الرقميين اللي بنستعملهم كل يوم.
NLP venues migration citation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

PerceptionRubrics: تقييم بصري يطابق إدراك البشر

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
الفريق قدم PerceptionRubrics، إطار تقييم مبني على rubrics بيركّز على تدقيق تفاصيل الصور بدل المطابقة العامة. استعملوا 1,038 صورة مليانة معلومات مع أكتر من 12,000 قاعدة تقييم خاصة، والقاعدة مشتقة من تسميات (captions) تم إنشاؤها عبر طريقة مراجعة دائرية بين الأقران. النظام فيه آلية Gated Scoring، يعني إذا النموذج أخطأ بحقيقة أساسية بيتنحسب عليه عقوبة حادة مش مجرد متوسط. التجارب أظهرت إن النماذج تنجح بأجزاء صغيرة بس تفشل بالقيود المشتركة، وكمان في فرق واضح حوالي 8% بين النماذج المفتوحة والمغلقة.
ليش بتهمّك؟: هالطريقة بتخلينا نعرف إذا النماذج فعلاً بتفهم الصورة مثل ما بنفهمها إحنا، مش بس بتحقق أرقام عالية على البنچمارك.
🌱 شو إلك منها؟
هالتقييم بيساعد المطوّرين يطوّروا تطبيقات توليد صور ما بتغلط بالمعلومات الأساسية، زي ما بنفحص سلعة قبل ما نشتريها لنضمن إنها تمام. يعني إذا بدك برنامج يضيف تفاصيل دقيقة على صورة عيلة أو يشرح مشهد، هالإطار بيضمن إنه التفاصيل الصح موجودة. ممكن تشوف هالتحسينات بأدوات تعديل الصور أو المساعدين الذكيين اللي بتستعمل صور دقيقة على الموبايل أو الويب.
multimodal evaluation benchmark perception AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

EvoPolicyGym: تقييم تطور السياسات الذاتية ببيئات تفاعلية

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
الفريق قدم طريقة جديدة اسمها Autonomous Policy Evolution، فيها الوكيل بيعدل سياسات تنفيذية بشكل متكرر ضمن ميزانية تفاعل محددة. حطّوا هالطريقة ضمن benchmark اسمه EvoPolicyGym مبني على بيئات RL تفاعلية صغيرة، وباختبارهم شافوا إن GPT-5.5 هو الأقوى عبر 16 بيئة. كمان بيّنوا إنه التحليل على مستوى كل خطوة بيفضح كيف الوكيل بيوزع الميزانية وبيحوّل الملاحظات لتعديلات بارامترية. النتيجة إنه النجاح ما بيعتمد بس على الفوز بمهمة واحدة، بل على اكتشاف آليات مناسبة وتعديل السياسات ضمن feedback محدود.
ليش بتهمّك؟: هالورقة بتفرجينا كيف ممكن نطوّر وكلاء يشتغلوا لحالهم ويحسّنوا سياساتهم بذكاء حتى مع موارد محدودة.
🌱 شو إلك منها؟
تخيل إنه برنامج بيتعلم من ردود فعل المستخدمين ويعدل شغله كل مرة بشكل أحسن، هالشي بيساعد التطبيقات اليومية تكون أذكى وأكتر توافقاً مع احتياجاتنا. يعني إذا بتستعمل تطبيق توصيل أو خدمة توصية، ممكن تشوف تحسينات مستمرة بدون ما تحتاج تدخل يدوي كبير. هالتحسينات ممكن تصير جزء من الخدمات اللي بتستعملها كل يوم، زي المساعدات الرقمية أو تطبيقات الألعاب.
autonomous agents policy evolution benchmark RL evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

التعلم القليل‑اللقطة النشط مع وعي الخلايا العصبية للـ LLMs

Neuron-Aware Active Few-Shot Learning for LLMs
الفريق قدم طريقة جديدة اسمها NeuFS، بتستغل أنماط تفعيل الخلايا العصبية داخل الـ LLMs لتختار عينات غير مُعلَّمة تكون أكتر فائدة للتدريب القليل‑اللقطة. الطريقة فيها معيارين: الأول يضمن تنوّع العينات عبر اختلاف أنماط الخلايا، والثاني يركّز على عينات ممكن تخلي النموذج يهلوس ويقيس اتفاق الخلايا عليها. جربوا NeuFS على ثلاث مجموعات بيانات وشوفوا إنه تفوق الطرق القديمة في مهام الاستدلال وتصنيف النصوص.
ليش بتهمّك؟: بتقلل NeuFS من جهد وتعقيد تصنيف البيانات يدويًا وتخلّي النماذج الصغيرة تعطي أداء أقوى بمجالات متخصصة.
🌱 شو إلك منها؟
إذاً، هالطريقة بتساعد الشركات أو الباحثين يلقوا أسرع وأقل تكلفة لتدريب نماذج اللغة على مواضيع جديدة، زي تدريب برنامج يرد على أسئلة طبية أو قانونية من غير ما يجمعوا آلاف الأسئلة يدويًا. بتشبه لما تختار أفضل أمثلة لتعلم طفل جديد، بدل ما تعطيه كل شيء. ممكن تشوفوا هالتحسينات في تطبيقات الدردشة الذكية أو أدوات الترجمة اللي بتصير أدق بأقل جهد.
active learning few-shot LLM neuron activation NLP arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

اعرف مصدر خبرك: مخزن معرفة عام للـ Media Background Checks

Know Your Source: A Public Knowledge Store for Media Background Checks
الفريق قدم MEDIAREF، مخزن معرفة عام فيه وثائق من الويب تغطي 200 مصدر إعلامي. هالمخزن بيسمح للباحثين يجرّبوا توليد فحوصات خلفية للمصادر (MBC) بتكلفة قليلة وبطريقة قابلة لإعادة الإنتاج. كمان قيموا نماذج LLM المشهورة على هالمهمة، ولقوا إنه MEDIAREF بيساعد على إنتاج فحوصات خلفية أعلى جودة، حسب التقييمات الآلية والنوعية.
ليش بتهمّك؟: هالورقة بتظهر كيف ممكن نزيد موثوقية أنظمة التحقق الآلي من المعلومات عبر فحص مصدّرها، وهاد مهم لتقليل الأخطاء وانتشار الأخبار الكاذبة.
🌱 شو إلك منها؟
تخيل إنك تقرأ خبر وتبغى تعرف إذا الجريدة موثوقة ولا لا، هالمخزن بيجمع لك معلومات عن مصادر الإعلام لتقدر تتأكد بسرعة. يعني مثل ما بتسأل صديقك إذا خبره صحيح، بس هالمرة الصديق هو برنامج بيستند على بيانات موثوقة. ممكن تشوف هالتقنية ضمن تطبيقات الفحص السريع للخبر على الموبايل أو المتصفح.
RAG source-critical reasoning fact-checking knowledge store LLM arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

هولا: ذاكرة هبوكية للـ Linear Attention

A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
الورقة بتقدّم HOLA، طريقة بتضيف مخزن KV محدود للـ linear attention لتحتفظ بالحقائق المهمة بدل ما تنسَها الحالة المتكررة. هالمخزن بيختار تخزين الإشارات اللي عندها بقايا توقعية كبيرة، وبعدها بيقراها بطريقة حادة مش ناعمة. التجربة على نموذج 340M باراميتر على 15B توكن من SlimPajama بتظهر إنه الهبوط في perplexity على Wikitext وصل لـ22.92، وأفضل من Transformer كامل الانتباه. كمان HOLA بيظهر استرجاع أقوى للحقائق حتى على سلاسل طويلة لحد 32k توكن.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة الكبيرة تتذكر تفاصيل أدق بدون ما يضيعوا الذاكرة، فبيتحسن الأداء على مهام الفهم والاسترجاع.
🌱 شو إلك منها؟
تخيّل إنه عندك دفتر ملاحظات صغير بيحفظ أهم الأشياء اللي بتحكي عنها، بدل ما تنسى. هالطريقة بتخلي الروبوتات والأنظمة الذكية تفتكر معلومات دقيقة أكتر، فممكن تشوف إجابات أدق من الشات بوتات أو محركات البحث. يعني إذا بتستعمل تطبيق بيفهم نصوص طويلة، رح يطلعلك نتائج أقرب للواقع.
linear attention memory language modeling retrieval transformers arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

PixelEyes: فك ربط الإدراك عن السبب للبحث البصري الدقيق

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
الفريق لاحظ إن الموديلات الكبيرة للغة المتعددة الوسائط (MLLMs) بتضيع كثير وقتها لأنه بتحاول تفكر وتحدد المكان بنفس الوقت، وهالشي بيخلي المسار طويل ومليان خطوات غير لازمة. لحتى يحلوا هالمشكلة، قدموا PixelEyes، وكيل بيفصل بين التفكير والإدراك: الجزء المتفكر بيقرر شو بدو يدور، وأداة الإدراك المتخصصة بتجاوب وين موجود الشي بدقة عبر قناع segmentation. النظام بيستعمل Mask‑guided Visual Search وSemantic‑region Breadth‑first Search، وتدربوا على مجموعة بيانات PixelEyes‑6K، واختبروا الأداء على benchmark اسمه Pinpoint‑Bench اللي بيقيس الدقة بدون أي إشارة مبدئية للموقع.
ليش بتهمّك؟: فكّ ربط التفكير عن الرؤية بخلي الأنظمة البصرية أسرع وأدق، وبيفتح باب لتطبيقات بتحتاج تحديد موضع الأشياء بسرعة.
🌱 شو إلك منها؟
تخيل إنك بدك تلاقي صديقك بوسط سوق مليان ناس، بدال ما تدور وتلف، بتسأله "وين القميص الأحمر؟" وبعدين بيورّيك بالضبط مكانه. هالطريقة ممكن تحسّن تطبيقات البحث داخل الصور، أو الواقع المعزز، أو حتى المساعدة في التنقل داخل المباني. يعني كل ما تحتاج تدور على شي بصورك أو بالفيديو، PixelEyes بيقلك "هنا" بسرعة وبدقة.
visual reasoning multimodal segmentation benchmark agent hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

فهم تصحيح الأخطاء المفقودة بالمجمع باستخدام الوكلاء

Understanding Agent-Based Patching of Compiler Missed Optimizations
الباحثين Batu Guan وزملاؤه قدموا دراسة منهجية عن كيف الوكلاء يقدروا يصححوا الأخطاء اللي بيغفل عنها المجمع LLVM. حطوا benchmark من قضايا واقعية وقارنوا الباتشات اللي يولدها الوكلاء مع باتشات المطورين من ناحية نطاق التحسين. لقوا إن الوكلاء غالباً بيحسّنوا الأمثلة المعطاة، بس كثير منهم يغطيوا جزء من النطاق أو يتقاطعوا جزئياً مع هدف المطور، وبعضهم بيتجاوزوا الباتش المرجعي. كمان جربوا تقنية استرجاع المعرفة التاريخية من طلبات تحسين سابقة، ولقوا إنها بتقرب التعميم من نية المطورين وتفيد على IR الحقيقي.
ليش بتهمّك؟: هالنتائج بتبين إذا ممكن نوظّف الوكلاء لتقليل جهد المطورين وتحسين أداء الكود بشكل أوسع.
🌱 شو إلك منها؟
تخيل إن برنامج الكمبيوتر يشتغل أسرع بدون ما تحتاج مهندس يضبط كل سطر يدويًا. هالوكلاء بيقدروا يتعلموا من تصليحات سابقة ويقترحوا تحسينات تلقائية. هيك ممكن تشوف تطبيقاتك تشتغل أسرع وتستهلك طاقة أقل.
agents compiler optimization LLVM benchmarking arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

Graph‑Native Reinforcement Learning لتوليد فرضيات علمية قابلة للتتبع

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination
الفريق طوّر مجموعة نماذج اسمها Graph‑PRefLexOR، بتشتغل بنظام reinforcement learning اسمه Group Relative Policy Optimization. هالنماذج بتقسّم عملية التفكير لأربع مراحل واضحة: استكشاف الآلية، بناء الرسم البياني، استخراج الأنماط، وصياغة الفرضية. هيك بنقدر نتبع كل خطوة ونشوف كيف النتيجة بتجي من السبب. التجارب على 100 سؤال من علوم المواد أظهرت تحسين 40‑65٪ مقارنةً بالنماذج الأساسية، خصوصًا بقدرة التتبع.
ليش بتهمّك؟: هالورقة بتخلّي توليد الفرضيات العلمية يكون مفهوم ومتابع، فالباحثين يقدروا يثقوا بالنتائج ويستفيدوا منها بسرعة.
🌱 شو إلك منها؟
تخيل إنه برنامج AI بيساعدك تختار مواد جديدة للمنتجات، وبيشرح لك خطوة بخطوة ليش اختار كل مادة، زي ما الشيف بيشرح مكوّنات الوصفة. هالطريقة بتخلي الفكرة ملموسة وسهلة الفهم، وبتظهر لك بأدوات التصميم أو التطبيقات اللي بتستخدم الذكاء الاصطناعي لتطوير منتجاتك.
graph neural networks reinforcement learning hypothesis generation materials science hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

DiscoBench: اختبار الوكلاء للبحث مع توضيحات

When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
الفريق قدموا benchmark جديد اسمه DiscoBench لتقييم قدرة الوكلاء المدعومة بـLLMs على اكتشاف الغموض بالأسئلة وطلب توضيحات من المستخدم. يحتوي Benchmark على 211 عينة بـ463 حالة غموض موزّعة على 11 مجال واقعي، ويغطي أربع أنواع من الغموض. صمموا كمان محاكي مستخدم لتوليد حوارات متعددة الجولات وقيّموا الوكلاء من أربع زوايا: فائدة المهمة، كشف الغموض، استراتيجية التفاعل، وكفاءة التكلفة. التجارب بينت إن الكشف عن الغموض والطلب لتوضيح فعال مهارات مستقلة، وإن الوكلاء اللي يفضّلوا يكرروا البحث بدل ما يسألوا توضيحات غالباً بيطلعوا أسوأ من التخمين المباشر.
ليش بتهمّك؟: هالورقة بتبين إن الوكلاء لازم يتعلموا يسألوا توضيحات مش بس يدوّروا، وهذا بيقربهم من حل مشاكل البحث الواقعية.
🌱 شو إلك منها؟
تخيل إنك تسأل مساعد ذكي عن شي مش واضح، بدل ما يخلّط عليك ويعطيك معلومات غلط، هو يطلب منك توضيح لتفهم سؤالك تماماً. هالطريقة بتخلي الإجابات أدق وأقرب للي بدك إياه، وبتشوفها في تطبيقات البحث اليومية أو المساعدات الصوتية اللي بتستعملها كل يوم.
search clarification benchmark LLM interaction hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

MrFlow: تسريع توليد الصور بالـ Diffusion بدون تدريب

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
الفريق قدم طريقة جديدة لتسريع نماذج الـ diffusion اللي تولد صور من نص، من غير ما يحتاجوا يدربوا شي جديد. الطريقة، اللي سماوها MrFlow، بتشتغل على مرحلة توليد منخفضة الدقة أولاً، بعدين بتستعمل نموذج GAN خفيف لتكبير الصورة بالمستوى البكسلي، وتضيف شوية ضوضاء خفيفة لتجديد التفاصيل، وأخيراً بتنقّح الصورة بدقة عالية. التجارب على نماذج FLUX.1-dev وQwen-Image ورجعت إنّو MrFlow يسرّع العملية حوالي 10 أضعاف مع الحفاظ على جودة شبه نفس الأصل، وبيقدر يدمج مع استراتيجيات تقليل الـ timesteps ليصل لتسارع حتى 25 مرة.
ليش بتهمّك؟: هالطريقة بتخلّي توليد الصور بالذكاء الاصطناعي أسرع بكتير بدون ما نحتاج نعيد تدريب النماذج، فبصير فينا نستفيد من قدرات عالية بأقل تكلفة زمنية.
🌱 شو إلك منها؟
تخيّل إنك بدك تولد صورة فنية من وصف بسيط، وبدل ما تستنى دقيقة أو أكتر، بتطلع لك الصورة خلال ثواني. هالسرعة بتخلي التطبيقات اللي بتستعمل الذكاء الاصطناعي، مثل أدوات تعديل الصور أو إنشاء محتوى، تكون أسرع وأسهل للاستخدام اليومي. يعني ممكن تشوف هالتحسين مباشرةً على التطبيقات اللي بتستعمل توليد الصور، مثل DALL·E أو أي خدمة مشابهة.
diffusion acceleration text-to-image multi-resolution training-free hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 9
Hybrid attention
Hybrid attention يعني دمج بين أنواع الانتباه المختلفة بالشبكة، عشان النموذج يقدر يركز على تفاصيل محلية وعالمية بنفس الوقت.
Linear Attention
linear attention طريقة تركيز بتقلل التعقيد من O(n^2) لـ O(n)، فبتخلي المعالجة أسرع ومش بتستهلك كتير موارد.
layerwise gates
layerwise gates هي مفاتيح بتتحكم بمرور المعلومات بين الطبقات، بنستعملها لنقفل أو نفتح الإشارات حسب الحاجة.
data agents
data agents هم مكوّنات ذكية بتجمع وتجهّز البيانات بشكل تلقائي، يعني بيشتغلوا كأنهم مساعدين لإيصال الإشي الصح للنموذج.
skill-aligned hierarchical clustering
skill-aligned hierarchical clustering طريقة لتجميع البيانات حسب المهارات المطلوبة، بتبني شجرية من الفئات لتسهيل التدريب.
bounded contract
bounded contract هو اتفاقية محدودة بالوقت أو الموارد، بنستعملها لتحديد حدود استخدام نموذج أو خدمة AI.
typed retrieval
typed retrieval يعني استرجاع معلومات بنوع محدد، مثلاً نطلب نصوص أو صور أو أكواد، عشان نحصل على إشي دقيق.
RECONTEXT
هو مفهوم بيحكي عن إنّو نعيد صياغة أو نعيد وضع النص ضمن سياق جديد، عشان النموذج يفهم أكتر. بنسمع عنه لأنه بساعد تحسين الفهم وتوليد الردود.
associative memory
ذاك النوع من الذاكرة بيمكّن النموذج يربط بين أشياء متعلقة ببعض، متل ما الذاكرة البشرية بتربط إشي بآخر. بنستخدمه لزيادة القدرة على تذكر معلومات سابقة.
🤖 موديلز 2
FlashMorph
FlashMorph هو موديل لتوليد النصوص بسرعة، احنا بنستعمله عشان يخلق محتوى سريع وبجودة معقولة.
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
📏 مقاييس 2
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
Fisher exact
Fisher exact هو اختبار إحصائي بنقيس فيه علاقة بين متغيرين، بنستعمله لتقييم دقة النماذج على بيانات صغيرة.
🗂️ بيانات 1
Slay the Spire 2
Slay the Spire 2 هو مجموعة بيانات من لعبة بطاقات، بنستخدمها لتدريب نماذج تتعلم استراتيجيات اللعب.
كل المصطلحات ←
العدد السابقشو في AI؟ | 2 يوليو — وكلاء العالم المفتوح وتعدد الوسائط
📚 كل الأعداد