📡 أحدث عدد

شو في AI؟ | 10 يوليو — وكلاء ذكيين وتقييم شامل

يومي 📅 2026-07-10
سلام 👋 هلقيت هالعدد بيجمع مجموعة من الابتكارات اللي بتظهر تطور الذكاء الاصطناعي بتركّز على الفيديو، كفاءة الـLLM، وتقييم الوكلاء بطرق جديدة، وكلها بتعطي نظرة شاملة للاتجاهات الحديثة.
#1

Vidu S1: نموذج توليد فيديو تفاعلي بالوقت الحقيقي

Vidu S1: A Real-Time Interactive Video Generation Model
فريق الباحثين قدموا Vidu S1، نموذج يولّد فيديوهات تفاعلية بالوقت الحقيقي وبيسمح للمستخدم يتحكم بالمحتوى عبر أوامر صوتية. النموذج بيشتغل على بطاقات رسومية عادية وبيوصل ل540p بسرعة توصل لـ42 إطار بالثانية بدون ما يطيح جودة الصورة. كمان بيسمح بتحميل صور مخصصة لأشخاص حقيقيين أو أنيمي أو حيوانات أليفة، وتغيير نبرة الصوت لتجربة شخصية أكتر. التجارب أثبتت إن Vidu S1 بيحقق أحسن أداء على كل المقاييس المطلوبة للوقت الحقيقي، وفيه نسخة تجريبية على الإنترنت.
ليش بتهمّك؟: هالورقة بتفتح الباب لتوليد فيديوهات مخصصة وفورية، يعني ممكن نخلق محتوى مرئي بسرعة وسهولة بدون معدات احترافية.
🌱 شو إلك منها؟
تخيّل إنك تقدر تحكي لتطبيق يطلع لك فيديو بوجهك أو شخصية كرتونية وانت عم تحكي، زي ما بنعمل فيديوهات سيلفي أو قصص للأطفال. هالشي رح يساعد أصحاب المحتوى، المعلمين، وحتى الناس اللي بدهم يضيفوا لمسة شخصية على رسائلهم. ممكن تشوفه على مواقع بتقدم خدمات تعديل الفيديو أو تطبيقات التواصل الاجتماعي.
video generation real-time multimodal diffusion interactive hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

BiSCo-LLM: ضغط وزن LLM ب2‑بت بدون جدول ترميز

BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression
هالورقة بتقدّم طريقة جديدة لتقليل حجم وزن نماذج اللغة الكبيرة لأقل من 2 بت لكل وزن، من غير ما نحتاج جداول ترميز صريحة. الفكرة إنه بنحط قطع الوزن على سطح وحدة كروي وبنحوّلها لإشارات ثنائية، وبعدها بنضيف مرحلة residual لتصحيح الأخطاء. كمان بيستخدموا استعادة مخصّصة لكل فئة من مكوّنات Transformer لتقليل الفجوة بين الوزن المعاد بناؤه وسلوك النموذج كامل. كل هالشي بيضم كمان قناتين 8‑بت لحماية القنوات الحساسة وLoRA adapters للضبط السريع.
ليش بتهمّك؟: هالطريقة بتقلل استهلاك الذاكرة والتخزين للـ LLM بشكل كبير، فبتخلّي تشغيل النماذج الكبيرة أصغر وأسهل على الأجهزة المحدودة.
🌱 شو إلك منها؟
تخيّل إنك بدك تشغّل برنامج ترجمة أو شات بوت على موبايل قديم، هالضغط بيقّل حجم البرنامج لدرجة إنه يقدر يشتغل بلا بطء. يعني بدل ما تحتاج سحابة قوية، ممكن تحمّل النموذج على جهازك وتستفيد منه مباشرة. هالشي بيظهر في تطبيقات مثل المساعدات الذكية أو أدوات الكتابة اللي بتستعمل LLMs.
LLM compression low-bit binary coding storage arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

Jet-Long: توسيع السياق الطويل بكفاءة

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
فريق Tang وزملاؤه قدموا طريقة Jet-Long اللي ما بتحتاج تدريب إضافي ولا تعديل على النموذج. الفكرة إنه بيستخدموا نافذة RoPE صغيرة للمدخلات القصيرة ونافذة ثانية للمدخلات الطويلة، والـ rescaling factor فيها بيتغيّر حسب طول السلسلة. هالدمج بين النافذتين بيتم بعملية attention merge وتصحيح RoPE على الطاير، فبيصير الأداء شبه مجاني وقت الاستدلال. التجارب على موديلات Qwen3 وصلت لسياق 128K وحققت أحسن نتيجة على benchmark HELMET-RAG مقارنةً بأقوى الطرق الموجودة.
ليش بتهمّك؟: Jet-Long بيسمح للـ LLM يشتغل على نصوص طويلة بدون ما يضيع الدقة، وهاد مهم لتطبيقات البحث والبرمجة اللي بتحتاج سياق كبير.
🌱 شو إلك منها؟
مع Jet-Long، الذكاء الاصطناعي يقدر يقرأ وثائق طويلة أو يحافظ على محادثة طويلة بدون ما ينسى التفاصيل. يعني إذا كنت عم تقرأ كتاب كامل وتستشير المساعد الذكي، رح يضل يذكر لك كل شي من أول الصفحة. هالشي ممكن تشوفه حالياً بأدوات الكتابة أو البحث اللي بتعتمد على نماذج لغة كبيرة.
long-context zero-shot LLM efficiency attention hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

فيديو‑وايسس: إعادة التفكير بتقييم فهم الفيديو

Video-Oasis: Rethinking Evaluation of Video Understanding
الفريق لاحظ إنه كتير من Benchmarks لفهم الفيديو ممكن تنحل من غير ما الواحد يشوف الفيديو أو ياخد باله من التوقيت، فعملوا مجموعة تشخيصية اسمها Video-Oasis لتدقق هالمقاييس. بعد ما فحصوا 55% من العينات ولقوا إنه فيها اختصارات، استبعدوها وطلعوا التحديات اللي بتحتاج فهم بصري وزمني حقيقي، وللأسف النماذج الحالية بتشتغل بس شوي فوق التخمين العشوائي. كمان استغلوا هالمجموعة لتقارن بين تصاميم الخوارزميات وتشوف أيّها بيدعم فهم الفيديو بشكل أقوى.
ليش بتهمّك؟: بدون تقييم صادق، ما بنعرف إذا النماذج فعلاً بتفهم المشاهد أو بس عم تستغل حيل سريعة.
🌱 شو إلك منها؟
تخيل إنه تطبيق يقدر يشرحلك فيديو من غير ما يشوفه، هالشي ممكن يخدعنا إنه شاطر وهو مش هيك. هالأداة بتكشف هالمخالفات وبتساعد المطورين يصنعوا تطبيقات فيديو أذكى، مثل مساعد يترجم أو يشرح مشاهد من أفلامنا اليومية.
video evaluation benchmark multimodal LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

تحسين غير‑متزامن بطلّة وحدة للوكيل الذكي

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
الفريق اللي قدم الورقة طوّر طريقة اسمها Single-rollout Asynchronous Optimization أو SAO لتدريب نماذج اللغة الكبيرة على مهام وكيلية طويلة المدى. بدل ما يستخدموا طريقة جمع عينات جماعية، بيستعملوا عينة وحدة لكل طلب، وبيضيفوا تصحيح على مستوى الرموز لتقليل الأخطاء. هالطريقة خلت التدريب يظل ثابت لألف خطوة وتفوقت على أساليب GRPO على معايير مثل SWE‑Bench Verified وBeyondAIME. كمان جربوها ببيئة تعلم أون‑لاين متغيرة وقدروا يطبّقوها على نموذج GLM‑5.2 الضخم.
ليش بتهمّك؟: SAO بتعطي استقرار أكتر وكفاءة أعلى لتدريب نماذج LLM على مهام وكيلية معقّدة، فبتقربنا من تطبيقات واقعية أسرع.
🌱 شو إلك منها؟
تخيّل إنك عم تتعامل مع برنامج يقدر يتعلم من كل خطوة بيعملها، مش ينتظر يجمع كومة بيانات قبل ما يطوّر نفسه. هالطريقة بتخلي البرنامج يتطور بسرعة ويضلّ ثابت، يعني ممكن تشوف تطبيقات ذكية تتعلم وتتحسّن كل يوم، مثل مساعد شخصي يتعلم من أسئلتك فوراً. هالشي رح يبان أكتر على الخدمات اللي بتعتمد على الذكاء الاصطناعي وتحتاج رد فعل سريع، مثل روبوتات الدردشة أو أدوات البرمجة الذكية.
reinforcement learning agents asynchronous optimization benchmarks hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

UniClawBench: معيار شامل لتقييم الوكلاء الفعّالين

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
الفريق قدم UniClawBench، معيار أول بتركّز على قدرات الوكلاء مثل استعمال المهارات، الاستكشاف، الفهم المتعدد الوسائط، التفكير بسياق طويل وتنسيق بين المنصات، مع ٤٠٠ مهمة ثنائية اللغة من واقع الحياة. التقييم بيصير داخل حاويات Docker وبخطوات دقيقة، وبنظام حلقة مغلقة فيه وكيل تنفيذ، وكيل مشرف مخفي، وكيل مستخدم، ليحاكي تفاعل بشري متعدد الأدوار بدون ما يفضح معايير التقييم.
ليش بتهمّك؟: بساعدنا نحدد بالضبط وين الوكلاء ينجحوا أو يتعطلوا بالمهام الواقعية، فبنقدر نحسّنهم بشكل أهدف.
🌱 شو إلك منها؟
تخيل برنامج ذكي يقدر يفتح لك حساب بنكي، يكتب إيميل، ويتعامل مع تطبيقات مختلفة بنفسه. هالمعيار بيقيس إذا البرنامج يقدر يتصرف بهالطرق بدون ما تحتاج تسأل كل خطوة. إذا صار أحسن، رح تشوف خدمات ذكية أسهل وأسرع بحياتك اليومية.
agents benchmark multimodal evaluation real-world hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

IdeaGene: بنشمارك لتتبع أصول الأفكار العلمية

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
الفريق بقيادة Yifan Zhou قدموا IG-Bench، بنشمارك جديد بيركّز على كيف الأفكار العلمية بتنتقل وتتحوّر من ورق لورق، زي الجينات. كل ورقة أو اقتراح بنمثّله بمجموعة من كائنات Idea Genome الموثّقة، وGenomeDiff بيطابق هالكائنات لتسجّل الوراثة، الطّفرات، والإضافات الجديدة. البنشمارك فيه 1,961 تتبّع سلالة، وبيقدّم اختبار IG-Exam لتقييم الفهم السّطري وIG-Arena لتقييم قدرة النماذج على توليد اقتراحات جديدة ضمن السلالة. التجارب على 14 نموذج LLM أظهرت إن أقوى نظام وصل بس 27.3% دقة، يعني لسا في فجوة كبيرة.
ليش بتهمّك؟: البنشمارك بيفتح الباب لتقييم وفهم أعمق لقدرة النماذج على تتبع وتوليد أفكار علمية متسلسلة، وهو شي مهم لتسريع الابتكار.
🌱 شو إلك منها؟
تخيّل إنه برنامج بساعد الباحثين يلاقي أفكار جديدة مبنية على شغلهم السابق، زي ما بنزرع شجرة ونشوف فروعها. هالشي بيسهّل على العلماء يختاروا أبحاث ممكن تكون مفيدة للمستقبل، وبيقلل الوقت اللي بيقضوه يدوّروا على مصادر. ممكن تشوف هالتقنية داخل أدوات كتابة الأبحاث أو منصات الاقتراحات العلمية اللي بتستعملها اليوم.
benchmark lineage reasoning idea generation LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

CausalDS: بنشمارك لتقييم التفكير السببي بالوكلاء علم البيانات

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
الفريق اللي قدم هالورقة حكى إنه الـLLMs صارت تتصرف كوكيلات علم بيانات، يعني بتجمع بين التفكير السببي واستخدام الأدوات. لحد هلا ما في بنشمارك بيلم كل هالعناصر، فهنن عملوا CausalDS، كل مشهد فيه نموذج سببي هيكلي (SCM) مع بيانات مراقبة وقصة نصية طبيعية. من هالمشهد بيطلعوا مهام على ثلاث مستويات لبيرل، وفي أغلبها بيحتاجوا يكتبوا كود ويستعملوا أدوات لأن الملاحظات ممكن تكون غير كاملة. كمان بيقيموا قدرة النموذج على الاعتراف إنه السؤال ما إلو إجابة واضحة والامتناع عن الرد.
ليش بتهمّك؟: هالبنشمارك بيساعدنا نقيم إذا الوكلاء فعلاً بفهم السبب والنتيجة، مش بس بيحزروا، وهاد مهم لتطبيقات علم البيانات الواقعية.
🌱 شو إلك منها؟
تخيل إنه برنامج ذكي يقدر يشرح لك ليش تغيرت مبيعاتك بعد حملة إعلانية، مش بس يطلع أرقام. هالموضوع بيخلي التقارير أأمن وأدق، وبيظهر أكتر ببرامج التحليل اللي بتستعملها يوميًا مثل جداول البيانات أو أدوات التحليل السحابية.
causal reasoning data science benchmark agents hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

وهم التكافؤ: تحليل إحصائي لتأثيرات الكمّية على LLMs

The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs
الفريق بقيادة Baha Rababah بيظهر إنه قياس الدقة والـ perplexity ما بيكفي لتقييم LLMs بعد الكمّية. قدموا مقياس جديد اسمه correctness agreement بيقيس قديش التوقعات الصحّية بتتطابق بين النموذج الأصلي والنماذج المضغوطة، بغضّ النظر عن الدقة الكلية. التجارب على نماذج مختلفة وكمّيات من 8‑bit لحد 2‑bit بتبين إنه الاختلاف السلوكي بيظهر حتى لو الأداء الظاهري باين ثابت. كمان فحصوا تأثير الكمّية على وزن الـ attention ولقوا إنه طبقات الـ query وkey حسّاسة أكتر من الـ value وoutput.
ليش بتهمّك؟: لأنّ الاعتماد على الدقة بس ممكن يخلّينا نعتقد إنه النموذج المضغوط نفس الأصلي، بس الحقيقة إنه سلوكه بيتغيّر بشكل ملحوظ.
🌱 شو إلك منها؟
تخيّل إنّك عم تستعمل تطبيق ترجمة على موبايلك، والنتيجة بتظهر زي ما كانت، بس المعنى ممكن يتغيّر شوي. هالشي بيصير لما نضغط نموذج الذكاء الصناعي لتقليل استهلاك الطاقة، حتى لو الإحصائيات بتقول إنه كل شي تمام. يعني ممكن تلاقي تطبيقات الذكاء الصناعي على الأجهزة الضعيفة بتعطيك ردود غريبة أو غير دقيقة رغم ما يبدو إنه الأداء ثابت.
quantization LLM evaluation efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

WebSwarm: تنسيق متعدد الوكلاء للبحث الويب العميق والواسع

WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
الفريق قدم WebSwarm، إطار بيستعمل وكلاء بحث ذكيين يشتغلوا بشكل متسلسل وبيستدعي بعض. كل وكيل عنده هدف محلي ويقدر يقرر يحلّه لحاله أو يخلق وكلاء فرعيين لتوسيع البحث، وبعد ما يخلص بيرجع الأدلة والنتايج للأعلى. النظام بيستغل خبرة البحث بين الوكلاء المتشابهين وبيدرس كيف المعلومات مرتبة على الويب عشان يضبط توسعة العقد. التجارب على مجموعات بيانات BrowseComp-Plus، WideSearch، DeepWideSearch، وGISA بيّنت إنه WebSwarm بيتفوق على الأنظمة الأحادية والمتعددة الوكلاء التقليدية.
ليش بتهمّك؟: WebSwarm بيخلّي عمليات البحث على الإنترنت أعمق وأوسع وبسرعة أكبر، وبيقلل الأخطاء الناتجة عن نقص السياق.
🌱 شو إلك منها؟
تخيّل إنك بدك تدور على معلومات معقدة، مثل تحضير مشروع بحث أو تخطيط رحلة طويلة، WebSwarm بيجمع لك كل المعلومات من مصادر مختلفة ويعطيك ملخص واضح. يعني زي ما بنجمع إشي من عدة أصدقاء كل واحد عنده خبرة معينة، وبنرجعلك النتيجة جاهزة. ممكن تشوف هالتحسينات يوم تستخدم محركات بحث ذكية أو تطبيقات مساعدة في الكتابة أو التخطيط.
web search multi-agent LLM recursion benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

LongE2V: إعادة بناء الفيديو من إشارات الأحداث على أمد طويل

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
الفريق قدم LongE2V، طريقة جديدة بتستفيد من نماذج diffusion المدربة مسبقاً على الفيديو لتعيد بناء الفيديو من إشارات الأحداث، وتوقع المشاهد الجاية، وتملأ الإطارات الفارغة. من خلال fine‑tuning لنموذج فيديو أساسي، بيحققوا كفاءة عالية بالبيانات وجودة بصرية ممتازة. استعملوا تقنيات Autoregressive Unrolling وAdaptive Context Switching لتقليل الانجراف الزمني بسلاسل طويلة، وكمان Reencoding Alignment مع Cross Residual Correction لضمان توافق دقيق أثناء ملء الإطارات. كمان ضيفوا Event Voxel Density Augmentation لتقوية النموذج على حساسات بدقة مختلفة، وطلعوا بأداء أحسن من الطرق الحالية على ثلاث مهمات.
ليش بتهمّك؟: هالطريقة بتخلّي الفيديو المستخرج من حساسات الأحداث واضح ومستقر حتى على فترات زمنية طويلة، وهذا مهم لتطبيقات الواقع المعزز والمراقبة.
🌱 شو إلك منها؟
تخيل إنه كاميرا الأمن اللي بتشتغل بإشارات سريعة تقدر تنتج فيديو ناعم وواضح حتى لو كانت الإشارة ضعيفة. هالشي بيساعدك تشوف تفاصيل الحركة بدقة أكبر، سواء بالمراقبة أو بتطبيقات الواقع الافتراضي. ممكن تلاقي هالتقنية ضمن تطبيقات الفيديو اللي بتعتمد على كاميرات الحدث أو الخدمات السحابية لتحسين جودة البث الحي.
video diffusion event cameras video reconstruction frame interpolation prediction hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

ذاكرة دلتا المتناثرة: توسعة سعة الـ RNN الخطية

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
فريق Cabannes وزملاؤه بدنا يقدّموا Sparse Delta Memory (SDM)، إشي بيخلّي الذاكرة المخفية للـ gated linear RNNs تكبر أضعاف وهيك ما بتزيد FLOPs كتير. الفكرة إنه بيستبدلوا الضرب الكثيف للمفاتيح والقيم بقراءات وكتابات متناثرة على ذاكرة صريحة كبيرة. تحت نفس عدد الفلوبس وعدد المعاملات، الزيادة الكبيرة بسعة الذاكرة بتصير تحسين ملحوظ بمهام التعلم داخل السياق واسترجاع النصوص الطويلة. كمان لما يتعلموا حالة الذاكرة الأولية، النموذج بيصير ذاكرة بارامترية وبيحسّن كمان على مهام المعرفة العامة والتفكير.
ليش بتهمّك؟: لأنه بزيد قدرة النموذج على تذكر معلومات من نصوص طويلة بدون ما يضيع حسابات، بيخلينا نقدر نبني أنظمة ذكية أكتر كفاءة.
🌱 شو إلك منها؟
مع هالطريقة، التطبيقات اللي بتقرا نصوص طويلة، زي المساعدات الصوتية أو برامج البحث في الوثائق، بتصير تقدر تفتّش وتسترجع معلومات بدقة أكتر. يعني إذا بدك تسأل برنامج عن شي صار من زمان، هو رح يذكره لك بدون ما يتلخبط. هالشي بيظهر بخدمات مثل محركات البحث أو التطبيقات اللي بتلخّص مقالات طويلة.
linear attention RNN memory in-context learning efficiency hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

صحة LLMs كمُعلّمين للبيانات: AMALIA والسلطة

Validity of LLMs as data annotators: AMALIA on authority
الفريق اللي عمل AMALIA، نموذج ب٩ مليار باراميتر للبرتغالية الأوروبية، بيظهر إنه يقدر يطابق المُصنّفين البشر على أساس الفونداشن الأخلاقي للسلطة بفارق حوالى ست نقاط F1. بس هالنتيجة بتقيس بس الاتفاق، مش صحة الفكرة. الباحثين جربوا يكسّروا السؤال لحلقات أصغر ويعيدوا يجمعوا النتيجة حسب القاعدة النظرية، ولاحظوا إن الأداء بيقل للنصّ نصّ الأداء الشامل، يعني النموذج بيعتمد على إشارات سطحية مثل الغضب الأخلاقي. نموذج LLM متعدد اللغات قدر يسدّ الفجوة، فهالشي بيدلّ إن المشكلة مش بالنصّ بل بالموديل نفسه.
ليش بتهمّك؟: المقال بيفكّك الفكرة إنه مجرد مطابقة مع البشر ما بتكفي لتقييم جودة النماذج كأدوات قياس علمية.
🌱 شو إلك منها؟
تخيّل إنك بدك تحلّل رأي الناس عن القادة، بس ما بدك تقرأ كل تعليقات يدويًا؛ هالنموذج بيقدر يفرزها بسرعة، بس ممكن يخلّط بين الغضب والاحترام. يعني إذا استعملته لتصنيف ردود الفعل على سياسات حكومية، ممكن يطلع لك نتائج مش دقيقة. لازم ننتبه إنه النموذج ممكن يتأثر بالمظاهر السطحية، مش بالمعنى الحقيقي للموضوع.
LLM annotation reliability validity Portuguese arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

هل بنقدر نوجّه اللهجات مثل اللغات؟ – دراسة على Arabic LLMs

Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs
الفريق Elozeiri وزملاؤه استكشفوا كيف ممكن نتحكم باللهجات العربية وقت ما بنستعمل نموذج لغة كبير (LLM) بدون ما نعيد تدريبه. أول شي، عملوا تحليل على مستوى الخلايا العصبية (neurons) ولاقوا مجموعة نادرة من الخلايا اللي بتمثّل خصائص اللهجة، ولما زادوا أو قللوا نشاطها قدروا يغيّروا النتيجة لتصير أقرب للهجة المطلوبة. بعدين جربوا طريقة تانية اسمها vector‑steering، بيستخرجوا اتجاهات تنشيط خاصة باللهجة وبيدخلوها خلال الاستنتاج. النتيجتين مع بعض بيوضحوا شكل المعرفة اللهجية داخل النموذج وبيعطوا طريقة مبدئية للتحكم فيها بدون ما نحتاج fine‑tuning.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة العربية تنتج نصوص باللهجات المحلية بسهولة، وبتقرب التقنية من احتياجات المستخدمين العرب.
🌱 شو إلك منها؟
تخيل إنك بدك تشوف ترجمة أو رد من برنامج ذكاء اصطناعي باللهجة الفلسطينية أو المصرية، بدل ما يطلع لك بالعربي الفصحى. هالطريقة بتخلي البرنامج يغيّر لهجته على طول، زي ما بنغيّر القناة على الراديو. ممكن تشوف هالشيّ بأدوات الدردشة أو التطبيقات اللي بتستعمل الذكاء الاصطناعي اليومي.
dialect Arabic LLM interpretability steering hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

UltraX: تحسين بيانات التدريب للـ LLMs على نطاق واسع

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing
الفريق قدم UltraX، إطار بيستعمل function‑calling ليتحكم بتحسين بيانات التدريب على مستوى كبير. بيضيف عملية الإدراج غير الحذف والتعديل، وبيستغل pipeline لتوليد إشراف برمجي من خلال adaptive prompt optimization، وبعدين بيحول النصوص المعدلة لبرامج منظمة عبر Line Alignment Mapping وDynamic Context Replacement. كمان UltraX بيقفل الأمثلة اللي ما فيها ثقة عالية وبيختار النسب عبر ratio‑controlled sampling، وبالاستدلال بيستعمل sliding‑window prediction وتجمع عمليات عالمية لتقوي الاستقرار. التجارب أظهرت إن UltraX بيحقق أعلى أداء بكمية توكنات أقل، يعني جودة أعلى بجهد أقل.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب الـ LLMs يكون أكتر كفاءة، فبنوفر وقت وموارد ونحصل على نماذج أذكى.
🌱 شو إلك منها؟
تخيل إنه عندك كتاب كبير فيه أخطاء ونصوص ناقصة، UltraX بيشتغل مثل محرّر سريع بينقّح الكتاب، يضيف اللي ناقص ويحذف اللي غلط، وبهيك بيخلّي الذكاء الاصطناعي يجاوب أدفى وأدق. يعني إذا بتستعمل تطبيقات دردشة أو ترجمة، رح تلاحظ إنه الردود بتصير أطيب وأقرب للواقع. هالتحسين بيصير ورا الكواليس على منصات مثل ChatGPT أو أي خدمة AI بتستعمل نماذج لغة كبيرة.
data refinement LLM pretraining efficiency programmatic editing arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

نموذج لغة كبير لتوجيه علاج سرطان الكبد بدقة (HCC-STAR)

Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance
الفريق قدم HCC-STAR، نموذج لغة كبير بيقرا نصوص السجلات الطبية الإلكترونية وبيطلع تصنيف خطر مبني على نقاط، وعلاجات مرتبة حسب دليل العلاج مع تبريرات مبنية على الأدلة، وتقديرات بقاء شخصية. استعملوا حوالي 30,000 حالة من قاعدة SEER وحوّلوها لسرد طبي إلكتروني عبر طريقة تعزيز بالـ prompt مع توثيق من أطباء. في اختبار على 6,668 مريض من 12 مستشفى صيني، HCC-STAR تفوق الإرشادات السريرية والنماذج التنافسية مثل GPT‑5 وGemini‑2.5 Pro، وبيّن إن الالتزام بتوصياته ممكن يرفع متوسط البقاء لعمر 51 شهر مقارنةً بـ 29 و32 شهر حسب BCLC وCNLC.
ليش بتهمّك؟: لأن النموذج بيساعد الأطباء يحددوا العلاج الأنسب بسرعة وبدقة أعلى، وبيحسّن فرص بقاء المرضى.
🌱 شو إلك منها؟
تخيّل إن عندك طبيب ذكي بيقرا كل ملاحظاتك الطبية ويقترح لك أفضل علاج للسرطان بناءً على تجارب آلاف المرضى. هالذكاء الاصطناعي بيقدر يرفع فرص العيش لفترة أطول، زي ما شوفنا مع المرضى اللي اتبعوا توصياته. ممكن تشوف هالتقنية داخل تطبيقات المستشفيات أو الأنظمة اللي بتساعد الأطباء على اتخاذ قرار العلاج.
LLM clinical decision support hepatocellular carcinoma risk stratification treatment recommendation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

DocMaster: نظام هيكلي لتحليل الوثائق

DocMaster: A Hierarchical Structure-Aware System for Document Analysis
الفريق قدم DocMaster، نظام بيحلل الوثائق الكبيرة مثل الأوراق العلمية والكتيبات التقنية بطريقة هيكلية. النظام بيحوّل كل مستند لشجرة وثائقية بتحافظ على الأقسام والجداول والرسومات، وببني فهرس معنوي واعي للهيكل بيسمح بفلترة الوثائق بدقة وبالأسئلة المتعمقة. الواجهة التفاعلية بتخلّي المستخدم يرفع مجموعة مستندات، يحدد شروط طبيعية لتصفية الإشي المطلوب، وبعدين يطرح أسئلة على النتائج المختارة. كل هالشي بيستفيد من large language models لتوليد الإجابات.
ليش بتهمّك؟: لأنه الحفاظ على الهيكل الأصلي للوثيقة بيقوّي دقة الفلترة والإجابة، وبيخلّي الأنظمة تستفيد أكتر من المعلومات المتوفرة.
🌱 شو إلك منها؟
تخيّل عندك مجموعة كتب ضخمة أو تقارير مالية، وبدك تلاقي معلومة معينة بسرعة. مع DocMaster، فيك ترفع هالمستندات وتكتب سؤال بسيط مثل "شو نسبة النمو في 2022؟" والنظام بيرد عليك مباشرة من داخل الوثائق. يعني بدل ما تقلب صفحات وورق، بتستفيد من التقنية لتوفر وقتك وتلقى الجواب بدقة.
document analysis LLM hierarchical indexing question answering arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

SciReasoner: فهم الهيكلية والخصائص بدقة وتفسير شفاف

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
الفريق قدم SciReasoner، نموذج أساسي متعدد الوسائط يقدر يفهم الهياكل الطبيعية للبروتينات، الجزيئات الصغيرة، والبلورات. النموذج يحوّل الإحداثيات والاتصالات إلى مفردات هيكلية، ويستعملها كدليل خلال عملية الاستدلال. على مجموعة من الـ 86 benchmark، SciReasoner وصل لأفضل أداء على 67 مهمة، وزاد دقة توقعات الـ Gene Ontology من 0.42 إلى 0.55، ودقة الريتروسينثسيس من 0.63 إلى 0.72. التقييمات البشرية أظهرت إن تتبعات استدلاله مفضلة أو على الأقل مساوية لتتبعات نموذج لغوي كبير في 98٪ من الحالات.
ليش بتهمّك؟: SciReasoner بيربط بين الدقة في التنبؤ وفهم علمي شفاف، وهاد بيفتح باب لتطبيقات أوسع بالدواء والمواد.
🌱 شو إلك منها؟
هالنموذج بيساعد العلماء يكتشفوا أدوية أو مواد جديدة بسرعة أكتر، زي ما الواحد بيفك شيفرة سرّ مكوّن. تخيّل إنك تقدر تشوف ليش مادة معينة بتشتغل بهالشكل قبل ما تجربها. هالشي رح يطلع على أدوات البحث العلمي على الإنترنت وتطبيقات تصميم الأدوية والمواد.
foundation model multimodal structure-property AI scientific reasoning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

العمل كمعرفة: حفظ دلالي للـ workflows المدعومة بـLLM

Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows
الفريق اللي هو إمانويل كوينتو وكارلو أندريا روزي وفراسزانيتي قدموا نموذج جديد يخلّي الـ workflows اللي بتستعمل الـ LLM تكون أشياء ثابتة ومخزّنة كمعرفة مشتركة. النموذج بيركّز على فرق بين "derive" اللي هو حساب deterministic و"infer" اللي هو حكم الـ LLM تحت سياق محدد وسياسة قدرة. بهالطريقة، تعريفات الـ workflow، سجلات الاستدلال، ولقطات السياق بيصيروا كائنات معرفة ممكن نرجع لها، نعيد تشغيلها أو نراجعها. البحث لسه أوليّ، بس بيوضح كيف ممكن نحول الـ workflows من مجرد خطوات لتوثيق معرفي ثابت.
ليش بتهمّك؟: هالطريقة بتخلّي تطبيقات الـ LLM تكون أكثر شفافية وتقدر ترجع للخطوات اللي أخدتها، فبتقوّي الثقة بالنتائج.
🌱 شو إلك منها؟
تخيّل إنك عم تشتغل على مشروع وتستعين بمساعد ذكي، وكل خطوة بتسجل كأنها ملاحظة مكتوبة تقدر ترجع لها بأي وقت. هالشي بيسهّل عليك تتابع شغلك وتصححه إذا صار شي غلط، زي ما بنكتب ملاحظات على ورقة عمل. ممكن تشوف هالتقنية بنظامات الدعم الفني أو تطبيقات التخطيط اللي بتعتمد على الذكاء الاصطناعي وتخليك تشتغل بأمان أكتر.
LLM workflow semantic persistence knowledge representation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

أوزان سوبر في LLMs وفشل التدريب الانتقائي

Super Weights in LLMs and the Failure of Selective Training
الفريق اكتشف إنه في أوزان اسمها Super Weights، إذا شلناها النموذج بينزل كتير. بس لما جرّبوا يدربوا هالأوزان لحالها، النموذج بيصير ما بيعرف يجاوب غير عشوائي. بالمقابل، طريقة LoRA اللي بتعدّل وزن الانتباه بنظام منخفض الرتبة بتشتغل كويس حتى مع نسبة ضئيلة من البارامترات. النتيجة إنه ما فينا نركز على وزن واحد مهم ونفصل تدريبه، ولازم نستخدم تقنيات بنية كاملة للطبقة.
ليش بتهمّك؟: هالملاحظة بتبين إنه تحسين النماذج الكبيرة ما بيكفي نركز على أوزان معينة، بل لازم نستخدم طرق تعديل شاملة، وهذا بيساعد على تطوير تقنيات تعديل أخف وأسرع.
🌱 شو إلك منها؟
تخيل إنك تحاول تصليح سيارة بس تركّز على مسمار واحد مهم، بدل ما تشوف النظام كله. النتيجة بتخبرنا إنه تعديل جزء صغير من النموذج ما بينفع، ولازم نعدّل النظام ككل. هالشي بيسمح لنا نطلع تطبيقات ذكاء اصطناعي أخف وأسرع على هواتفنا أو أجهزة البيت.
LLM fine-tuning pruning LoRA arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 6
voice control
voice control يعني التحكم بالأجهزة أو البرامج عن طريق الصوت، يعني بتحكي وإشي يشتغل. بنشوفه كتير اليوم لأنو بيسهّل الاستخدام وبيخلي التفاعل مش معقد.
binary spherical coding
binary spherical coding هو طريقة ضغط بيانات بتستعمل تمثيل ثنائي على سطح كرة، لتقليل حجم المعلومات مع الحفاظ على الدقة. بنسمع عنه بالذكاء الاصطناعي عشان بيساعد بنقل وتخزين النماذج الكبيرة.
LoRA adapters
LoRA adapters هي إضافات خفيفة بتتصل بالنماذج الكبيرة لتخصيصها بدون ما نعيد تدريب كل النموذج. بدنا نستخدمها عشان نوفر وقت وموارد، ومش بنحتاج نعيد تدريب كامل.
RoPE
RoPE أو Rotary Position Embedding هي طريقة إشي ذكي بتخبر فيها النموذج عن مكان كل كلمة في الجملة، مش بس إشي اللغة بل كمان إيش قبلها وإيش بعدها. بنسمع عنها كتير هلق عشان نماذج زي LLaMA بتستخدمها وبتتعامل معها أحسن مع النصوص الطويلة.
zero-shot
يعني إنك بتطلبي من النموذج يعمل حاجة ما دراب عليها ولا شُفت أمثلة عليها، الذكاء الاصطناعي بيحاول يفهم المطلوب من أول مرة بناءً على معرفته العامة. بنسمع عنه كتير عشان بيوفر وقت ما بدنا نعلّم النموذج على حالات جديدة.
attention
الـ attention هو آلية بتخلي النموذج يركز على أجزاء معينة من النص وقت ما بيولد أو يفهم، يعني بنقول له يركز على الإشي المهم.
🤖 موديلز 5
TurboDiffusion
موديل توليد صور سريع بيستعمل تقنيات انتشار محسّنة، بدنا نطلع صور عالية الجودة بأقل وقت.
TurboServe
TurboServe نظام بيقدّم الخدمات بسرعة عالية على السحابة، يعني بيوزّع الطلبات بسرعة عشان ما يصير تأخير، بنستخدمه عشان نحافظ على استجابة سريعة.
transformer
هو البنية الأساسية اللي قايم عليها الذكاء الاصطناعي الحديث كله، بيشتغل على مبدأ الانتباه يعني بيحدد شو الأهم في البيانات وبيركز عليه. بنسمع عنه لأنه الأساس اللي اتبنى عليه ChatGPT وكل النماذج الكبيرة.
Video-Oasis
Video-Oasis هو نموذج بيشتغل على الفيديوهات، بيفهم المشاهد أو يولد محتوى بصري
Video-LLM
Video-LLM هو مفهوم ربط نماذج اللغة الكبيرة مع الفيديو، يعني النموذج يقدر يفهم أو يولد نصوص مرتبطة بالفيديو. بنسمع عنه لأنو بيفتح فرص لتطبيقات مثل الشرح التلقائي أو البحث داخل الفيديو.
📏 مقاييس 3
FA2
FA2 هو مقياس لتقييم جودة الترتيب أو الفعالية، عادةً بنستعمله لتقويم أداء النماذج. بنسمع عنه عشان بيساعدنا نقارن بين طرق مختلفة.
benchmark
يعني مجموعة معايير واختبارات بننسخدمها عشان نشيك كيف أداء النموذج تاعنا، شو مستواه الفعلي. بنسمع عنها كتير عشان هي إشي أساسي لمعرفة إذا النموذج بتاعك تمام أم لا.
accuracy
مقياس بيقيس نسبة الإجابات الصحيحة من إجمالي الأسئلة، عشان نعرف قديش النموذج دقيق
كل المصطلحات ←
العدد السابقشو في AI؟ | 9 يوليو — تحسين الوكيل الذكي غير متزامن
📚 كل الأعداد