📡 أحدث عدد

شو في AI؟ | 13 يوليو — وكلاء AI يتعلموا من العالم المفتوح

يومي 📅 2026-07-13
مرحبا 👋 هلقيت هالعدد بيحكي عن وكّال الذكاء الاصطناعي وكيف عم يتطور لتعامل مع بيئات معقّدة وتطبيقات متعددة
#1

VEXAIoT: إطار عمل تلقائي لاستغلال ثغرات الـ IoT باستخدام وكلاء الذكاء الاصطناعي

VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
الفريق قدم إطار عمل VEXAIoT، وهو نظام متعدد الوكلاء يعتمد على LLM لتصنيف واكتشاف واستغلال ثغرات الـ IoT. الوكيل الأول بيعمل reconnaissance ويحدد الثغرات، والوكيل الثاني بيخطط الهجوم وينفّذ الاستغلال على خدمات الـ IoT. تم اختبار النظام على بيئتي IoTGoat وMetasploitable عبر عشر سيناريوهات مرتبطة بضعف OWASP للـ IoT، وحقق نجاح يوصل لـ 100% بحجم توكن منخفض ووقت تنفيذ أقل من دقيقتين للغالبية. إجمالي النجاح كان 95% على 260 تجربة.
ليش بتهمّك؟: هالورقة بتظهر كيف الوكلاء المدعومين بالـ LLM ممكن يسرّعوا فحص أمان الأجهزة المتصلة بالإنترنت وتقلل الجهد البشري.
🌱 شو إلك منها؟
تخيل إنو في برنامج يقدر يفتّش على أمان الأجهزة الذكية بالبيت، يلاقي الثغرات ويستغلها بنفسه، مثل ما بيعمل الهاكر بس بسرعة وبأمان. هالشي بيساعد الشركات تكتشف المشاكل قبل ما يلاقيها الهاكرز، وبيقلل من مخاطر الاختراق. ممكن تشوف هالتقنية تتطبق بأدوات فحص الأمان اللي بتستخدمها الشركات أو حتى في تطبيقات حماية المنازل الذكية.
IoT security AI agents LLM vulnerability assessment arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

استرجاع الكود المصدري من الدوال الثنائية باستخدام Anchor‑Based Retrieval وتفكير الـ LLM

Practical Source Code Recovery from Binary Functions Using Anchor-Based Retrieval and LLM Reasoning
الفريق قدم لنا خط أنابيب عملي يدمج الهندسة العكسية مع استرجاع الكود من قاعدة بيانات للشفرة، وبعدين يستخدم LLM لإعادة ترتيب النتائج. أول شي، برنامج Ghidra يطلع "anchors" مثل السلاسل النصية والنداءات الخارجية، وبعدين يدوّر بقاعدة بيانات عبر بحث inverted‑index ليلاقي ملفات مرشّحة. أخيرًا، الـ LLM يقيم التشابه بين التفكيك والشفرة المصدرية ويختار الأنسب. التجربة على برنامج tcpdump المشفّر أظهرت تغطية 95.2% من التعليمات، بينما قاعدة GitHub أعطت 35.5% بس بسبب نقص الاسترجاع.
ليش بتهمّك؟: هالطريقة بتقربنا من استعادة الشفرة الأصلية بسرعة ودقة، وبتقلل الاعتماد على التفكيك اليدوي الصعب.
🌱 شو إلك منها؟
تخيل إنك عندك طبق جاهز وتحب تعرف وصفته الأصلية، هالأداة بتساعد الباحثين يكتشفوا الكود اللي ورا البرنامج حتى لو كان متحذف. هالشي مفيد للناس اللي تشتغل بالأمان السيبراني أو بتحاول تصحح أخطاء ببرنامج قديم. ممكن تشوف أثرها بأدوات الفحص اللي تستخدمها الشركات لحماية أنظمتها.
source code recovery binary analysis LLM reverse engineering arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

GenCeption: نماذج توليد الفيديو كمتعلمين شاملين للرؤية

Video Generation Models are General-Purpose Vision Learners
بهالورقة الباحثين بيقترحوا إنو توليد الفيديو بالنصّ هو المفتاح لتدريب نماذج رؤية عامة. بيستعملوا GenCeption، نموذج بيركّز على backbone توليدي diffusion للفيديو، وبيحوّله لنموذج إدراكي يقدر ينجز مهام بصرية مختلفة عن طريق أوامر نصية. النتائج بتظهر إنو GenCeption بيحقق أرفع مستوى دقة بأعمال مثل تقدير العمق، وتحديد الوضعية الكاميرا، وتجزئة التعبيرات، وحتى توقع نقاط 3D، وغالبًا بيقارن أو يتفوق على نماذج متخصصة. كمان النموذج بيستفيد من بيانات قليلة وبيظهر قدرات تعميم من فيديوهات صناعية للواقع الحقيقي وفئات غير متوقعة.
ليش بتهمّك؟: GenCeption بيفتح باب لتدريب نماذج رؤية شاملة بأقل بيانات، يعني بنقّص تكلفة التطوير ونزيد القدرة على تطبيقات جديدة.
🌱 شو إلك منها؟
تخيل إنو في برنامج يقدر يفهم مشاهد الفيديو ويحدد عمق الأشياء أو يحدد موقع الكاميرا بس من خلال أوامر بسيطة، مثل ما بنقول "اعرضلي عمق الغرفة". هالشي بيساعد المطوّرين يصمموا تطبيقات واقعية أسرع، مثل تحسين الواقع المعزز أو الروبوتات المنزلية. ممكن تشوف هالتقنية قريبًا بألعاب الفيديو أو تطبيقات الترجمة الفورية للصور والفيديو.
video generation foundation models computer vision diffusion multimodal hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

Long-Horizon-Terminal-Bench: اختبار الوكلاء على مهام طويلة الأمد

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
الباحثين قدموا Benchmark جديد اسمه Long-Horizon-Terminal-Bench فيه 46 مهمة طويلة بتغطي تسع فئات، من إعادة تجارب علمية لحد ألعاب تفاعلية. كل مهمة متقسمة لمهام فرعية مع مكافآت متدرجة، يعني الوكيل بيحصل على reward مش بس في النهاية. الاختبار بيقيس قدرة الوكلاء على التخطيط الطويل وإدارة السياق الطويل وتعديل الأخطاء بشكل متكرر. النتائج ورّيت إن أقوى نموذج وصل لـ15.2% pass@1 عند حد جزئي 0.95، وهذا واضح إنو في مساحة كبيرة للتحسين.
ليش بتهمّك؟: الـ Benchmark بيكشف قديش الوكلاء لسا ما بيقدروا يشتغلوا على شغل معقّد وطويل، وبيساعدنا نطوّر نماذج أذكى للمهام الواقعية.
🌱 شو إلك منها؟
تخيل إنك عم تحاول تحل مشكلة معقدة مثل تعديل برنامج كبير أو إعادة تجربة علمية، والكمبيوتر بيفهم كل خطوة وبعطيك ملاحظات طول الطريق، مو بس يردلك بنهاية. هالإستراتيجية بتخلي التقنية تساعدنا ننجز شغل أكتر بوقت أقل، وبتظهر قريبًا في أدوات مثل مساعدات البرمجة أو برامج البحث العلمي.
benchmark agents long-horizon evaluation AI hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

أغورا: تحسين تفكير وكلاء LLM بالمزاد لتخصيص المهام

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation
الباحثين اقترحوا إطار اسمه Agora بيستغل آلية مزاد متوافقة مع الحوافز لتوزيع المهام على نماذج خبراء وأدوات مختلفة. الفكرة إن كل خطوة من عملية التفكير بتتحول لإشي قابل للمزاد، وكل نموذج بيقدم عرضه حسب كفاءته الفعلية، فبيوصلوا للمنحل الأنسب مو للغلط. التجارب على خمس Benchmarks ورّيت إن Agora بيتفوق على طرق التوجيه أو السلسلة التقليدية، وكمان بيخلّي فيه تحكم واضح بين التكلفة والجودة عبر ضبط معامل واحد بالمزاد.
ليش بتهمّك؟: هالطريقة بتخلّي وكلاء LLM يختاروا أحسن حل بأقل تكلفة، فبتحسّن أداء التطبيقات الذكية.
🌱 شو إلك منها؟
تخيل إنك عم تحكي مع برنامج بيساعدك بحل مشاكل معقّدة، بدل ما يختار أول حل جاهز، كل حل بيعرض سعره حسب قدرته، فبتاخد النتيجة الأفضل بأقل مصاريف. هيك البرنامج بيشتغل أسرع وأرخص، وبتشوف تحسين بخدمات مثل المساعدات الرقمية أو التطبيقات اللي بتحتاج تفكير معقّد. يعني ممكن تحسّن تجربة البحث أو التخطيط من غير ما تدفع أكتر.
LLM auction task allocation reasoning benchmarks arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

LLM لتصميم الواجهة الأمامية للدوائر: التحديات والفرص

LLM for EDA in Front-End Design: Challenges and Opportunities
الفريق Xu وزملاؤه بيستعرضوا كيف إنّ Large Language Models صارت ممكنة تساعد في مرحلة الـ front‑end لتصميم الرقائق، من قراءة المواصفات لحد توليد كود الـ HDL وبناء الـ testbench. بينوا كمان كيف إنّ الأنظمة الوكيلية مثل OpenClaw ممكن تحول هالمساعدة من مجرد إرشاد لعمل مستقل تمامًا. الورقة بتحلل آخر التطورات في توليد الدوائر والـ testbench من مواصفات مشتركة، وبتوضح تحسين جودة التصميم خلال عمليات الـ high‑level synthesis. أخيرًا، بتناقشوا التحديات الأساسية للدمج بين LLMs وEDA وبتطرحوا فرص مستقبلية لتقوية هالواجهة الذكية.
ليش بتهمّك؟: لأنّ دمج LLM مع أدوات تصميم الرقائق ممكن يسرّع تطوير الشرائح ويقلل زمن الوصول للسوق، وهذا بيأثر على كل شي من الهواتف لحد السيارات الذكية.
🌱 شو إلك منها؟
تخيل إنك تكتب فكرة جهاز إلكتروني، والكمبيوتر يكتب لك الكود ويجهّز الاختبارات لحاله، بدون ما تحتاج تكون مهندس إلكترونيات. هالشي بيخلي تطوير الأجهزة أسرع وأرخص، وبيظهر بأجهزة بتستعملها كل يوم مثل الهواتف أو الأجهزة المنزلية الذكية.
LLM EDA hardware design AI agents front-end design arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models

All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models
arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

فهم آلي ليش المعرفة المحفوظة ما بتعمم خلال Fine‑tuning للـ LLM

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
الباحثين بيظهروا إنو لما بنعمل fine‑tuning للـ LLMs لإضافة معلومات جديدة، النموذج بيمسك المعرفة بسرعة بس ما بيقدر يستخدمها بالمهام اللاحقة. عرّفوا الفجوة بين “المعرفة” و“الاستخدام” باسم Knowing--Using Gap، اللي بتظهر كفرق دقة وتأخير زمني بين الحفظ والتعميم. باستخدام تقنية جديدة اسمها self‑patching، حددوا أماكن التفعيل داخل الشبكة اللي لو نعيد توجيهها بتحسن القدرة على التعميم. بناءً على هالنتيجة، صمموا إستراتيجية بسيطة بتسترجع من 58% لحد 75% من الفجوة المتوقعة عبر تعديل رؤوس النموذج.
ليش بتهمّك؟: هالطريقة بتساعدنا نفهم ليش النماذج بتحفظ معلومات بس ما بتستعملها، وبتعطينا أدوات نصلّح هالعطل ونخلي الذكاء الاصطناعي أذكى بالمهام اليومية.
🌱 شو إلك منها؟
تخيل إنك تعلمت معلومة جديدة، متل رقم هاتف، بس لما تحتاج تستخدمه بنسى كيف تستدعيه؛ نفس الشي بيصير مع الذكاء الاصطناعي. هالبحث بيشتغل على تصحيح هالمشكلة، فبالمستقبل ممكن تشوف تطبيقات تذكّرنا وتساعدنا بأدق التفاصيل من غير ما يخلّوا. يعني ممكن تكون المساعدات الرقمية أذكى وتجاوب على أسئلتك بسرعة أكبر.
LLM fine-tuning knowledge generalization self-patching hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

تدريب ذاتي أثناء الاختبار للـ LLMs بسياق طويل

Self-Guided Test-Time Training for Long-Context LLMs
الفريق اكتشف إنو مجرد توسيع نافذة السياق للـ LLMs ما بيكفي، لأنه مع طول النص بتقل الدقة. جربوا فكرة التدريب أثناء الاختبار (TTT) بس تطبيقها على كل النص كان غالي كتير، وتدريب عشوائي على أجزاء من النص كان بيضيف ضوضا. من هون جابوا طريقة S‑TTT، اللي بتخلي النموذج يحدد أولاً أجزاء الأدلة المهمة وبعدين يتدرب عليها بس، وبهالطريقة حققوا تحسينات لحد 15٪ على مجموعتين اختبارية صعبين.
ليش بتهمّك؟: هالطريقة بتخلّي النماذج الكبيرة تستفيد فعلاً من النصوص الطويلة وتجاوب بدقة أعلى على الأسئلة المعقّدة.
🌱 شو إلك منها؟
تخيل إنك عم تقرأ تقرير طويل وبدك تلاقي الجواب بسرعة؛ هالنظام بيعرف يختار الفقرات المهمة ويتعلم منها، فبيعطيك إجابة أدق. يعني إذا كنت عم تستعمل شات بوت أو محرك بحث، رح تلاقيه بيجاوبك بشكل أوضح حتى لو السؤال بيتعلق بكتاب كامل. هالتقنية ممكن تنظهر قريباً بخدمات الدردشة أو المساعدة الذكية اللي بنستعملها كل يوم.
long-context test-time training LLM reasoning hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

تطور الدقة وأخطاء الفهم البصري في عشر سنين من نماذج Vision‑Language

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
الفريقين Shravan Murlidaran وMiguel P. Eckstein قدموا مجموعة بيانات جديدة اسمها Complex Social Behavior (CSB) فيها مية صورة بتظهر تفاعلات اجتماعية معقّدة. حللوا كيف صارت دقة أوصاف المشاهد تتغيّر من 2017 لحد 2025 عبر أربع نماذج قبل ما تصير Multimodal Large Language Models (MLLMs) وخمسة نماذج MLLM. لقوا إن MLLMs صارت تقريبًا توصل لأعلى دقة بشرية، بس لسا فيه شوية أخطاء بتركّز على المناطق اللي يشتغلوا عليها مقارنةً بالإنسان.
ليش بتهمّك؟: هالنتائج بتبيّن إن نماذج الرؤية‑اللغة صارت تفهم مشاهد اجتماعية معقّدة، وبتقربنا من تطبيقات أكثر واقعية.
🌱 شو إلك منها؟
تخيل إنو برنامج يقدر يشرح لك صورة عائلية معقدة، مثل احتفال أو نقاش، بنفس الدقة اللي يقدر يوصّفها شخص. هالشي بيساعد التطبيقات اليومية مثل المساعدات الذكية أو أدوات التعليم لتفسير الصور بشكل أوضح. يعني لو شفت صورة على الفيسبوك، ممكن البرنامج يشرح لك القصة ويفهم تفاصيل التفاعل بين الناس.
vision-language multimodal dataset evaluation AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

Freya‑TTS: نموذج تركي للـ TTS خفيف وعالي الدقة

FreyaTTS Technical Report
الفريق قدم Freya‑TTS، نموذج تركي للـ TTS ما بيحتاج توكنايزر وبيشتغل بسرعة. هو مبني على Diffusion Transformer (DiT) بـ 183.2M بارامتر وبيستغل الفضاء المستمر المجمد لـ AudioVAE2، فبيحوّل النص للـ latent بجودة 48 kHz. النموذج بيشتغل بثلاث خطوات: يقرأ النص من 92 حرف تركي من غير قواعد أو فونيمايزر، بيعمل denoising غير متسلسل ليطلع كل اللاتنت مرة وحدة، وبعدين يطبق طريقة post‑training من مرحلتين لتثبيت صوت المتكلم وتحسين الأداء على الجمل القصيرة. على benchmark Freya‑TR‑Eval وصل WER 8 % وCER 3 %، وبيشتغل أسرع من الوقت الحقيقي على GPU ومناسب للأجهزة القليلة الموارد.
ليش بتهمّك؟: هالورقة بتخلّي تطبيقات الكلام التركي تكون أسرع وأخف على الأجهزة المتنقلة.
🌱 شو إلك منها؟
بتقدر تشغّل Freya‑TTS على اللابتوب أو على الموبايل وتسمع صوت تركي واضح وسريع. متل ما بتستمع لموسيقى على الموبايل، هالنظام بيحكي النصوص فورًا بدون ما يبطئ الجهاز. هالشي بيفيد التطبيقات اللي بدها تحكي تركي على الإنترنت أو على الأجهزة الصغيرة.
text-to-speech diffusion Turkish low-resource edge deployment arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

تحسين Test-Time Scaling لنماذج VLM الصغيرة

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
الفريقين Baxevanakis وYang جربوا تقنية Test-Time Scaling على نماذج رؤية‑لغة صغيرة باستخدام مجموعة EXAMS-V المتعددة اللغات للـ visual MCQ. قارنوا بين self-consistency وطرق تانية متل PRM‑guided beam search، ولاحظوا إن أهم شي هو طريقة صياغة الـ prompt وقدرة النموذج على إكمال السلسلة. رفعوا حد الـ token لكل سلسلة من 1k لـ 2k زاد الدقة 3.7 نقطة مئوية، بينما زيادة عدد السلاسل ما كان إلها تأثير كبير. النتيجة إن أفضل إعداد وصل لـ84.1٪ وتصدر لوحة Visual MCQ leaderboard.
ليش بتهمّك؟: بتبيّن إنو تحسين بسيط وقت الاختبار يرفع أداء نماذج الرؤية‑اللغة الصغيرة كثير بدون ما نحتاج ندربها من الصفر.
🌱 شو إلك منها؟
مع تعديل بسيط على طريقة سؤال النموذج، بيصير قادر يجاوب على أسئلة الصور بدقة أعلى، متل ما بنقرا سؤال واضح بنفهمه أسرع. هالتحسين ممكن ينعكس على تطبيقات مثل المساعدات الذكية اللي تشرح الصور للمكفوفين أو أدوات البحث بالصور على الموبايل. يعني رح تشوف AI يشتغل أذكى لما يواجه صور وأسئلة يومية.
multimodal test-time scaling VLM benchmark self-consistency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

تدريب بصري قابل للتوسع للذكاء اللغوي (Visual Pretraining)

Scalable Visual Pretraining for Language Intelligence
الفريق بيقول إنو التدريب التقليدي للنماذج الكبيرة بيستند بس على نصوص، بس هالورقة بتثبت إنو إذا استغلينا الصور داخل الوثائق، بنقدر نعلّم نماذج أذكى. عملوا دراسة منهجية على طرق visual pretraining غير مراقبة، واستخدموا وثائق بصرية مباشرة بدون استخراج النص. عبر تجارب على عدة backbones وعلى benchmarks مختلفة، شافوا إنو التدريب البصري دايمًا بيطيّح التدريب النصي من حيث الأداء. النتيجة إنو في طريق فعال لتوسيع الذكاء اللغوي باستخدام الصور.
ليش بتهمّك؟: هالنتيجة بتفتح باب لتطوير نماذج لغوية أقوى بدون الاعتماد بس على النصوص.
🌱 شو إلك منها؟
تخيل إنو برنامج يقرأ المستندات مش بس من الكلام، بل من الرسومات والجداول، وبيفهمهم كمان. هالشي بيساعدك لما ترفع ملف PDF فيه شروحات مرسومة، البرنامج يقدر يجاوبك بدقة أكتر. ممكن تشوف هالتقنية بالمستقبل بأدوات تحرير المستندات أو محركات البحث.
multimodal pretraining foundation-models visual-documents hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

بحث سيناريوهات القيادة الذاتية المتعدد الوسائط

Multimodal Scenario Similarity Search for Autonomous Driving
الفريق قدم إطار عمل متعدد الوسائط لاسترجاع سيناريوهات القيادة الذاتية، بدمج تمثيلات بصرية مع تمثيلات مسار الحركة داخل خط أنابيب موحد. جرّبوا طريقتين معتمدتين على المسار: Exo-Trajectory اللي بيلائم الحركات المحيطة صراحة، وScenarioFormer اللي بيستفيد من transformer لتعلم تمثيل من مسارات الأشياء عبر التعلم المتباين. المقارنة مع أسس بصرية قوية ورّيت إن تمثيلات المسار بتتفوق بأحداث حركة مثل القطع داخل المسار أو التحولات، بينما التمثيلات البصرية بتتفوّق لما تكون المظهر مهم. الجمع بين الاثنين أعطى أفضل نتيجة استرجاع.
ليش بتهمّك؟: هالطريقة بتخلّي الباحثين ومهندسي السيارات يلقوا سيناريوهات مشابهة بسرعة، وبيسهلوا فحص وتطوير نماذج القيادة الذاتية.
🌱 شو إلك منها؟
تخيّل إنك بدك تلاقي فيديوهات لحوادث مشابهة لتجربة مرّيت فيها بالسيارة، هالنظام بيساعدك تلاقيها بسرعة من ملايين اللقطات. يعني بدل ما تقعد تدور يدويًا، النظام يدمج صورة المشهد وحركة السيارات لتلاقي اللي بيشبّه حالتك. ممكن تشوف هالشيء ينعكس بأدوات تحليل بيانات السيارات أو تطبيقات تحسين السلامة على الطريق.
autonomous driving multimodal retrieval scenario computer vision arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

فشل كعملية: تحليل مسارات وكلاء البرمجة في سطر الأوامر

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
الباحثين عملوا أول دراسة واسعة على فشل وكلاء البرمجة اللي يشتغلوا بالـ CLI، وحطّوا إطار يدرس الفشل من بدايته لحد ما يصير غير قابل للإصلاح. جمعوا 3,843 مسار تنفيذ من سبعة نماذج متقدمة على ثلاث منصات (OpenHands, MiniSWE, Terminus2) واختاروا 1,794 مسار صالح للتعليق اليدوي، يعني فوق 63,000 خطوة. لقوا إن الأخطاء عادةً إبيستيمية، بتبلّش بأول شوية خطوات، وغالباً بتضل مخفية لحد ما ما في مجال للإنقاذ. النتيجة إنو لازم نتحقق من الكود بدري ونقّف الأخطاء قبل ما تصير مشكلة نهائية.
ليش بتهمّك؟: هالنتائج بتبين إنو تحسين موثوقية الوكلاء لازم يتركّز على الفحص المبكر مش بس تقييم النتيجة الأخيرة.
🌱 شو إلك منها؟
تخيل إنو عندك برنامج يكتب لك الكود لحاله، بس لو صار فيه غلطة من أول شوية أوامر، ممكن ما يقدر يصلّحها وتضيع الشغلة. الفكرة إنو لازم نراقب البرنامج من البداية ونوقف الأخطاء بسرعة، متل ما بنوقف السيارة إذا حسينا فيها مشكلة قبل ما تصير عطل كبير. هالطريقة ممكن تخلي الأدوات اللي بنستعملها للبرمجة أوتوماتيكيًا أأمن وأسهل للناس العاديين.
LLM coding agents failure analysis software engineering empirical study arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

ProofCouncil: وكيل LLM لحل المسائل الرياضية المفتوحة

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
الفريق قدم ProofCouncil، وكيل LLM مبني على بنية author‑critic، هدفه يشتغل على حل مشاكل رياضية مفتوحة. جربوه ضمن تحدي FirstProof ونجحوا بحل 6 من 10 مسائل بحكم الحكماء، وهذا كان أحسن نتيجة بين الفرق المشاركة. كمان اختبروا الوكيل على 30 مسألة من باحثين، ولقت 5 حلول صحيحة تمامًا و2 واعدة و8 فيها تقدم جزئي. المكتبة اللي بنوا الوكيل فيها أطلقوها ككود مفتوح للكل يقدر يستفيد منها.
ليش بتهمّك؟: هالورقة بتظهر إنو الوكلاء الذكيين ممكن يساهموا بحل مشاكل علمية معقّدة أسرع من قبل، وبتفتح باب لتعاون الإنسان والآلة بالمجال الرياضي.
🌱 شو إلك منها؟
تخيل إنو في برنامج يقدر يساعدك تحل مسائل رياضية صعبة، مثل ما بنستعين بمدرس خصوصي، بس هو برنامج ذكي يشتغل 24 ساعة. هالشي بيسهّل على الطلاب والباحثين إنهم يلاقوا حلول أو خطوات أولية بسرعة، ويمكن يطلعوا بأفكار جديدة من غير ما ينتظروا وقت طويل. ممكن تشوف هالتقنية تدخل بأدوات التعليم أو التطبيقات اللي بتساعد على حل الواجبات.
LLM agent mathematics open problems AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

AutoWorldBuilder: بناء عوالم خيالية بتعاون وكلاء LLM

Fictional Worldbuilding: Multi-Agent LLM Collaboration with Hierarchical Context Compression and Iterative Review
الفريق قدم AutoWorldBuilder، نظام فيه عدة وكلاء LLM يشتغلوا سوا لبناء عوالم خيالية. النظام بيحل مشكلة تضخم السياق عبر ضغط السياق بأربع طبقات بيقلل التوكنات بحوالي 90٪، وبينظم المهام حسب التشابه الدلالي باستخدام جدولة DAG. كمان فيه وكيل مراجعة اسمه Auditor بيقلل الأخطاء ويزيد نسبة القبول من 42٪ لأكثر من 85٪. التجارب على 20 مهمة عالمية باستخدام GPT‑OSS 120B وDeepSeek v3.2 حققت نجاح 95٪.
ليش بتهمّك؟: هالطريقة بتخلي بناء عوالم خيالية أسرع وأكثر اتساق، وبتفتح باب لتطبيقات تانية بتحتاج توليد محتوى معقّد.
🌱 شو إلك منها؟
تخيّل إنك بدك تكتب قصة أو لعبة وتحتاج عالم كامل، هالنظام بيكتب لك كل التفاصيل بسرعة وبلا تناقض. متل ما تطبيق بيساعدك ترتب جدولك، هالمساعدة بترتب الأفكار وتأكد إنو ما في تعارض. ممكن تشوف هالتقنية تطلع بأدوات كتابة تلقائية أو ألعاب تولّد عوالمها لحالك.
multi-agent worldbuilding LLM context-compression AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

KronQ: ضغط LLMs بالـ Kronecker‑Factored Hessian

KronQ: LLM Quantization via Kronecker-Factored Hessian
الورقة بتقدّم طريقة جديدة للضغط بعد التدريب (PTQ) للـ LLMs. الفرق إنو KronQ ما بيفترض إنو كل القنوات الخارجة بتساوي بعضها، بل بيدخل تغاير التدرج (gradient covariance) ضمن حساب الخسارة مع تغاير التفعيل. الطريقة بتشتغل على مستويين: أولاً بتضيف تدوير عشوائي للبعد الخارجي باستخدام تغاير التدرج لتقليل تباين وزن الموديل، وثانياً بتستخرج مقياس حساسية جديد لتوزيع الدقة المختلطة بين الطبقات بناءً على تتبع هيسيان التدرج والتفعيل. النتيجة إنو على نموذج LLaMA‑3‑70B بضغط 2‑bit للوزن بس، KronQ وصل إلى perplexity 7.93 بينما طرق تانية فشلت أو أعطت أرقام فوق 2000.
ليش بتهمّك؟: بتخلّي نماذج اللغة الكبيرة تصير أصغر وأسرع بدون ما تخسر دقة الأداء، فبتفتح الباب لتشغيلها على أجهزة أقل قدرة.
🌱 شو إلك منها؟
تخيّل عندك كتاب ضخيم وبدك تحزّمه بحجم أصغر لتقدر تشيله على ظهرك، KronQ هو الطريقة اللي بتضغط الكتاب من غير ما يضيع معناه. هالشي بيساعد التطبيقات الذكية تشتغل أسرع على جوالك أو على خوادم رخيصة، يعني ممكن تشوف شات بوتات أذكى بدون ما تحتاج سحابة ضخمة.
quantization LLM PTQ Kronecker mixed-precision hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

وكلاء سؤال وجواب متعدّد الوسائط مع ضبط الثقة والتفكير المتزايد

Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026
الفريق قدم حل للـ QANTA 2026، وهو مسابقة بتختبر أنظمة سؤال وجواب بتشتغل على نصوص وصور بتظهر تدريجياً. صمموا عميلين مخصوصين: واحد للـ Tossup بيستعمل نموذج GPT‑4o‑mini مع ضبط الثقة وسياسة حسابية لتقليل الأخطاء من الإشارات الرقمية، والثاني للـ Bonus بيستعمل نموذج GPT‑4o مع توجيه التفكير حسب المقدمة وتكامل الأدلة المتعددة. ما اعتمدوا على استرجاع بيانات أو تجميع نماذج، بل ركّزوا على سياسات تفكير خفيفة وسريعة. النتيجة كانت أعلى درجة على لوحة المتسابقين (leaderboard) بـ 0.402، مع أداء مميز في كل مهمة.
ليش بتهمّك؟: هالطريقة بتظهر إنو ممكن نحقق أداء قوي بموارد محدودة، وهاد مهم للأنظمة اللي لازم تكون سريعة ومشغّلة على أجهزة بسيطة.
🌱 شو إلك منها؟
تخيل إنك عم تلعب مسابقة أسئلة وتظهر لك المعلومات شوي شوي، هالنظام بيعرف يقرر متى يجاوب بثقة وما يضيع وقت. يعني إذا عم تستخدم تطبيق يجاوب على أسئلة من صور أو نصوص، رح يقدر يجاوب أسرع وبأقل أخطاء. ممكن تشوف هالتحسينات بأدوات التعليم أو الألعاب اللي بتعتمد على أسئلة تفاعلية.
multimodal QA confidence calibration GPT-4 benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

SAGEAgent: وكيل ذاتي التطور لاختيار الفحوصات بتكلفة معقولة لتوقع البقاء

SAGEAgent: A Self-Evolving Agent for Cost-Aware Modality Acquisition in Multimodal Survival Prediction
الفريق قدم SAGEAgent، وكيل مبني على LLM بيقرر إشي الفحوصات اللي لازم يشتريها لكل مريض سرطان، وبيوازن بين دقة التوقع وبين عبء الفحص. الوكيل بيستخدم أدوات سريرية بتحوّل التوقعات الرقمية لنص، وبيستدعي episodic memory لتلاقي حالات سابقة مشابهة، وبيضيف نمط قرار جديد للـ semantic memory. التجارب على مجموعة من مرضى الجليوما من TCGA وBraTS أظهرت إن الوكيل بيحقق دقة تنافسية مع تقليل عبء الفحوصات المتوسط بـ55٪.
ليش بتهمّك؟: هالطريقة بتخلينا نحدّ من الفحوصات الزايدة ونحافظ على دقة توقع بقاء المرضى.
🌱 شو إلك منها؟
تخيل إنك مريض سرطان وبدك تتأكد من حالتك، بس ما بدك تروح كل المستشفيات وتعمل فحوصات كتير. بدنا نعرف إيش الفحص اللي فعلاً بيفيد، مش كل الفحوصات، فهالوكيل بيفكر إذا الفحص الجاي ضروري ولا لأ، وبقلل عليك الزيارات والتكاليف. هالشي ممكن تشوفه بأجهزة أو تطبيقات صحية بتساعدك تختار الفحوصات المناسبة.
multimodal survival prediction LLM clinical decision cost-aware arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 7
agent
agent هو كيان ذكي بيقدر يتخذ قرارات ويتفاعل مع البيئة بشكل مستقل، بنستعمله لتصميم روبوتات أو أنظمة توصية
anchor-based retrieval
anchor-based retrieval مفهوم استرجاع معلومات بيعتمد على نقاط مرجعية (anchor) لتحديد أقرب الوثائق للطلب، مش بس بحث عادي، عشان نحسن دقة البحث.
inverted-index
inverted-index هيكل بيانات بيرتب الكلمات إلى قوائم بالوثائق اللي فيها، احنا بنقلب الفهرس عشان نلاقي المستند بسرعة، وبيسهل عمليات البحث.
video generative diffusion
video generative diffusion مفهوم بيولد فيديوهات خطوة بخطوة عبر عملية انتشار (diffusion) من ضوضاء لتفاصيل، بدنا نستخدمه لتوليد مشاهد متحركة.
Long-Horizon-Terminal-Bench
Long-Horizon-Terminal-Bench مجموعة اختبارات بتقيس قدرة النماذج على حل مهام طويلة الأمد على الطرفية، إشي بنستعمله لنقيس الأداء على إشي معقّد.
dense reward
مفهوم بيعطي مكافآت مستمرة خلال التدريب، مش بس مكافأة نهائية، عشان النموذج يتعلم بسرعة أكبر
auction
auction هو مفهوم بيع أو شراء عن طريق مزايدة، بنشوف الناس يرفعوا أسعارهم لحد ما يلاقوا أعلى عرض، بنستعمله في أسواق البيانات أو الموارد الرقمية.
🤖 موديلز 3
LLM
نموذج لغة ضخم بتعلم على مليارات الكلمات وبعدين بيقدر يتنبأ ويكتب نصوص زي ChatGPT و Claude. بدنا نعرف عنه عشان دخل كل حاجة بحياتنا من البحث للكتابة للبرمجة.
GenCeption
GenCeption نموذج توليدي بيستعمل فكرة الإدراك المتداخل لتوليد محتوى، احنا بنستعمله لتوليد نصوص أو صور مع تركيبة معقدة.
V-JEPA
V-JEPA نموذج جديد بيشتغل على تمثيل الفيديوهات بطريقة تشبه JEPA للصور، عشان يتعلم العلاقات الزمنية بين الإطارات، مش بس صور ثابتة.
📏 مقاييس 2
instruction coverage
instruction coverage مقياس بيوضح قديش النموذج غطّى أوامر أو تعليمات مختلفة خلال التدريب، بدنا نعرف إذا النموذج مش عم يفهم كل الأنواع.
pass@1
هيدا مقياس بنقيس فيه إذا النموذج قدر يجيب الجواب الصح بالمركز الأول، يعني بدنا نشوف نسبة النجاح بأول محاولة
🗂️ بيانات 2
IoTGoat
IoTGoat مجموعة بيانات فيها سجلات هجمات على أجهزة إنترنت الأشياء، احنا بنستعملها عشان نتدرب على كشف التهديدات ونفهم إشي المهاجمين بيستغلوه.
Metasploitable
Metasploitable مجموعة بيانات فيها نظام تشغيل فيه ثغرات معروفة، بدنا نستخدمها لتجربة أدوات الاختراق عشان نتعلم كيف نكتشف الثغرات.
كل المصطلحات ←
العدد السابقشو في AI؟ | 12 يوليو — LLM متعدد الوسائط واللغات
📚 كل الأعداد