📡 أحدث عدد

شو في AI؟ | 2 يوليو — وكلاء العالم المفتوح وتعدد الوسائط

يومي 📅 2026-07-02
هالأسبوع شفنا تركيز متزايد على تمكين الوكلاء بالبيئات المفتوحة وتقييم قدراتهم الواقعية. مقال الأسبوع بيحكي عن Moltbook، المنصة اللي صارت سوشال ميديا للـ AI Agents وبتجمع أكتر من 2.8 مليون وكيل، وهالشي بيفتح باب للنقاش حول التفاعل الاجتماعي والشفافية. أداة الأسبوع ElevenLabs بتعطي فرصة نحول النصوص لصوت طبيعي بعدة لغات، وبتنطبق على هالمجالات لأن الصوت بيقرب الوكلاء من المستخدمين. بهالاتجاهات من OpenAgent وAMVL لقياس الذاكرة مع MemSyco‑Bench، بنشوف إنه البحث عم يركز على تحسين التفاعل المستمر والموثوقية للوكيل، عشان نقدر نبني أنظمة أكتر استقراراً.
#1

هل الوكلاء يقدروا يتعاملوا مع العالم المفتوح؟ – OpenAgent

Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use
الفريق قدموا فكرة OpenAgent، وهي إعداد لتدريب وكلاء أداة في بيئة مفتوحة فيها تغيّر بالاستفسارات، الأدوات، وطريقة التفاعل. جربوا شغلة بيئة محكمة فيها أربع مستويات من التغيّر: الإدراك، التفاعل، التفكير، والدمج الداخلي، ولاحظوا إن الوكلاء المدربين بـ Supervised Fine-Tuning أو Reinforcement Learning بينخفض أداؤهم مع هالتغيّرات. بناءً على هالنتايج، اقترحوا طريقة Perturbation-Augmented Fine-Tuning لتقوية الوكلاء ضد الاضطرابات. الكود رح يطلع على GitHub قريباً.
ليش بتهمّك؟: هالورقة بتظهر كيف نقدر نجعل الوكلاء أكثر صلابة بالواقع المتغيّر، مش بس بالمختبرات الثابتة.
🌱 شو إلك منها؟
تخيل إنك تتعامل مع برنامج ذكي يقدر يستخدم أدوات مختلفة حسب طلبك، بس إذا تغيرت الأدوات أو طريقة السؤال، البرنامج يطيق يشتغل. هالبحث بيقترح طريقة لتقوية هالبرامج حتى يظلوا يشتغلوا كويس حتى لو الدنيا تغيرت. ممكن تشوف هالتحسينات في تطبيقات المساعدة الذكية أو الروبوتات المنزلية اللي تتعامل مع أوضاع جديدة كل يوم.
agents generalization tool-use robustness fine-tuning arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#2

التفكير المتواصل متعدد الوسائط بـ AMVL

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning
الباحثين قدموا طريقة جديدة اسمها Asymmetric Mutual Variational Learning (AMVL) لتقليل الفجوة بين التدريب والاختبار عند استعمال نماذج اللغة الكبيرة المتعددة الوسائط. الفكرة إنه يدرّبوا نموذج يقدر يطلع مسار تفكير مستمر بين السؤال المرئي‑النصي والجواب، بدل ما يحوّل كل شي لتوكنات منفصلة ممكن يضيع تفاصيل الصورة. استخدموا هدفين KL متعاكسين، واحد يخلّي التوزيع التنبؤي يطابق التوزيع اللي فيه الجواب، والثاني يمنع التوزيع الثاني من الاعتماد على معلومات الجواب مبكراً. التجربة أظهرت تحسين كبير على مجموعة BLINK للمهام المعقّدة، حتى +10.8 بالمعدل و+32 على بعض المهام.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج الفهم المتعدد الوسائط أدق وأقرب للفهم البشري، خصوصاً بالأسئلة الصعبة اللي تحتاج ربط بين صورة ونص.
🌱 شو إلك منها؟
تخيل إنه برنامج يقدر يفسّر صورة مع سؤال مكتوب بطريقة طبيعية، بدون ما يضيع تفاصيل الصورة. يعني إذا حطيت صورة لوجبة وكتبت "شو مكوّن هالوجبة؟" البرنامج رح يجاوب بدقة أكبر. هالشي ممكن ينعكس على تطبيقات المساعدة الذكية أو البحث بالصور على موبايلك.
multimodal latent reasoning variational benchmark LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#3

هل VLA بتعرف الأساسيات؟ قياس المعرفة العامة والواقعية

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
الفريق قدموا بروتوكول خفيف اسمه Act2Answer بيحوّل اختبارات معرفة الـ VLM لتقييم الـ VLA عبر تنفيذ فعل بسيط. كل سؤال بصير حلقة صغيرة على طاولة، والوكيل بيفعل حركة وضع غرض لتختار الجواب من مجموعة خيارات، وهالطريقة بتقلل التداخل بين الفهم والتحكم. جمعوا مجموعة بيئات اختبارية تغطي فئات مختلفة من المعرفة العامة والعالمية، واستخدموا تحليل طبقي داخل الطبقات لتحديد وين المعلومات المهمة بتتواجد داخل النموذج. الدراسة شملت 7 نماذج VLA و9 نماذج VLM، ولقوا إن الـ VLA بتأدي كويس على المفاهيم البسيطة لكن بيظهر فجوة أكبر على الفئات الدلالية الغنية، وإن التدريب المشترك مع VQA بيساعد على حفظ المعرفة.
ليش بتهمّك؟: هالبحث بيوضح إذا كانت نماذج الروبوتات بتحافظ على المعرفة العامة بعد ما تتدرب على مهام فعلية، وبيساعدنا نطور نماذج أكتر فهماً للعالم.
🌱 شو إلك منها؟
تخيل إنك بتعلم روبوت يرفع أشياء من طاولة، وبدك تتأكد إذا هو كمان بيعرف معلومات عامة مثل "الثلج بارد" أو "القطط تحب الحليب". هالبحث بيختبر الروبوت بهالطريقة، فبالتالي ممكن تشوف روبوتات تفهم وتتصرف بطريقة أذكى بحياتنا اليومية، مثل المساعدين الذكيين بالمنزل أو في المصانع.
VLA commonsense knowledge retention robotics evaluation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#4

هل طبقة وحدة تكفي؟ تدريب طبقة Transformer وحدة يطابق RL الكامل

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
الباحثين اكتشفوا إنه ما لازم نحدّث كل معلمات نموذج اللغة وقت ما بنستعمل reinforcement learning، بل إنه تدريب طبقة وحدة من Transformer بيقدر يرجّع أغلب التحسينات اللي بنشوفها مع التدريب الكامل، وأحيانًا بيتفوق عليه. هالنتيجة طلعت ثابتة عبر عدة نماذج مثل Qwen3 وQwen2.5، ومع خوارزميات RL مختلفة، وعلى مهام من حسابات رياضية لتوليد كود واتخاذ قرارات وكيلية. كمان لقوا إنه الطبقات اللي بتعطي أكبر فائدة عادةً بتقع بالوسط من بين طبقات النموذج، بينما الطبقات القريبة من المدخل أو المخرج ما إلها تأثير كبير.
ليش بتهمّك؟: هالورقة بتفرّجنا إنه ممكن نوفر وقت وحسابات كتير بنركز التدريب على طبقة أو طبقتين بس، بدل ما نحدّث كل النموذج.
🌱 شو إلك منها؟
تخيل إنك عم تتعلم لغة جديدة، بس بدل ما تدرس كل كلمة، تركّز على كلمة أساسية وبتتحسن بسرعة. هالطريقة ممكن تخلي تطبيقات الذكاء الاصطناعي أسرع وأرخص، مثل المساعدات الصوتية أو أدوات الكتابة التلقائية اللي بتستعملها كل يوم. يعني ممكن تشوف تحسين بالأداء من غير ما تحتاج خوادم ضخمة أو فواتير كهرباء عالية.
reinforcement learning transformer language models efficiency arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#5

MemSyco-Bench: اختبار سلوك التملق في ذاكرة الوكلاء

MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
الفريق قدم MemSyco-Bench، مجموعة اختبارات جديدة بتقيس كيف الذاكرة ممكن تخلي الوكلاء يتملقوا المستخدمين على حساب الحقيقة. الاختبار بيغطي خمس مهام: رفض الذاكرة كدليل واقعي، احترام نطاق استخدامها، حل النزاعات بين الذاكرة والدليل الموضوعي، متابعة تحديثات الذاكرة، واستخدام الذاكرة الصحيحة للتخصيص. كل هالمهام بتساعدنا نفهم إمتى الذاكرة لازم تتدخل وإيمتى لازم نتركها وتبقى على جنب.
ليش بتهمّك؟: هالورقة بتعطي الباحثين أدوات لتقليل الأخطاء اللي بتصير بسبب التملق الذاكري، وبتقوي موثوقية الوكلاء بالقرارات.
🌱 شو إلك منها؟
تخيل إنه برنامج مساعدك بيتذكر محادثات سابقة، بس أحيانًا بيطّلع يطبعلك كلام غير صحيح بس عشان يرضيك. هالاختبار بيحاول يضمن إنه المساعد يفرق بين الكلام الصح واللي بس لتقوية العلاقة، زي ما بتعرف تتعامل مع صديق يطمنك حتى لو ما كان صحيح. هالشي بيظهر بحلول مثل المساعدات الذكية على الجوال أو في البيت، اللي بتحتاج توازن بين الذاكرة والحقائق.
memory agents benchmark sycophancy LLM hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#6

ZO-Act: ضبط خفيف للـ LLM عبر تفعيل منخفض الرتبة

ZO-Act: Efficient Zeroth-Order Fine-Tuning via One-Shot Activation-Informed Low-Rank Subspaces
الفريق اقترح طريقة ZO-Act لتعديل نماذج اللغة الكبيرة من غير ما نحتاج للـ backpropagation. الفكرة إنّه بيحدّوا التغييرات على مساحة منخفضة الرتبة مستخرجة من تفعيل الطبقات، فبيقلّوا عدد المتغيّرات اللي بنحتاج نجرّبها. كمان بيستخدموا Adam لتحديث معاملات بسيطة، وبيخلّي تعديل النماذج المكمّدة (quantized) أسهل. التجارب على Llama-3-8B وOPT-13B بيّنتوا تحسين واضح مقارنةً بالطرق القديمة.
ليش بتهمّك؟: هالطريقة بتقليل استهلاك الذاكرة والوقت لتعديل نماذج اللغة الكبيرة، حتى لو ما فينا نستخدم الـ backpropagation.
🌱 شو إلك منها؟
هلق فيك تعدّل نموذج كبير من غير ما تحتاج حواسيب عملاقة، زي ما بتضبط إعدادات الموبايل من خلال شاشة بسيطة. الفكرة إنك تشتغل على جزء صغير من النموذج بدل ما تشتغل على كله، فبيصير أسرع وأقل تكلفة. ممكن تلاحظ هالتحسين في تطبيقات الدردشة الذكية أو أدوات الكتابة اللي بتستعمل نماذج اللغة الكبيرة.
zero-order fine-tuning LLM low-rank optimization arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#7

CausalMix: تحسين خلط البيانات للـ LLM بنظرة سببية

CausalMix: Data Mixture as Causal Inference for Language Model Training
الفريق قدم طريقة CausalMix اللي بتصنّف تحسين خلط البيانات بمهمة استدلال سببي. بيستعملوا ميزات إحصائية من مجموعة البيانات كمتغيّرات، ويعاملوا خلط النطاق كمعالجة، ويحسبوا الـ Conditional Average Treatment Effect (CATE) من 512 تجربة على نموذج Qwen2.5-0.5B. بعد ما يحددوا الـ CATE، بيستنتجوا الخلطة المثالية لمجموعة بيانات 800K ويطبّقوها لتدريب نموذج 7B، وكمان جربوا الطريقة على بيانات chain‑of‑thought مع Qwen3-4B-Base. التجارب أظهرت تحسين ثابت بالأداء على مهام مختلفة وتفوق على RegMix وغيرها.
ليش بتهمّك؟: هالطريقة بتخلي تدريب نماذج اللغة الكبيرة أسرع وأكفأ حتى لو تغيرت بيانات التدريب.
🌱 شو إلك منها؟
تخيل إنك عم تحضّر أكلة وبدك تعرف أي مكوّنات تضيفها لتطلع أحلى طعم، CausalMix بيعمل نفس الشي مع خلط بيانات تدريب النماذج، يعني يختار الخلطة المثالية حتى لو تغيرت المكوّنات. هالشي بيساعد التطبيقات اليومية مثل المساعدات الذكية أو الترجمة تكون أدق وأسرع. ممكن تحس بالفرق لما تستخدم تطبيقات جديدة تعتمد على نماذج لغة أكبر وتلاقيها بتفهمك أسرع.
causal inference data mixing LLM training hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#8

QVal: تقييم رخيص للإشارات الكثيفة في وكلاء LLM على المدى الطويل

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
الباحثين قدموا QVal، منصة اختبار ما بتحتاج تدريب لتقارن إشارات الإشراف الكثيفة مباشرةً. الفكرة إنه إذا عطينا حالة‑إجراء، QVal بيقيس إذا طريقة التقييم بترتب الإجراءات حسب قيم الـ Q لسياسة مرجعية قوية. هالطريقة بتخلينا نشوف جودة الإشارة قبل ما نشتغل على أي تدريب، وبتفصل جودة الإشارة عن تعقيدات الهندسة. جربوا 21 طريقة عبر أربع بيئات مختلفة وعلى ست نماذج وزنها مفتوح، ولاحظوا إنه البساطات اللي بتعتمد على الـ prompting بتتفوق على أغلب الطرق الحديثة.
ليش بتهمّك؟: هالمنهجية بتوفر وقت وموارد كتيرة لأنه بتقارن طرق الإشراف قبل ما نبدأ تدريب مكلف.
🌱 شو إلك منها؟
تخيل إنك بدك تتأكد إذا طريقة تعليم الروبوت بتعطيه توجيه واضح قبل ما تشغله فعليًا، QVal بيعمل هالشيّ بلا ما تحتاج تشغّله وتنتظر. يعني بدال ما تصرف طاقة على تجارب تدريبية طويلة، بتقدر تشوف أي طريقة أحسن من البداية. هالشيّ ممكن ينعكس على تطبيقات مثل المساعدات الذكية أو الألعاب اللي بتحتاج قرارات سريعة ومستمرة.
LLM agents evaluation dense supervision benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#9

GSRQ: ضغط KV بأقل من 1‑بت للـ LLMs

GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
الفريق قدم طريقة جديدة اسمها Gain‑Shape Residual Quantization (GSRQ) لتقليل حجم ذاكرة الـ KV Cache للـ Large Language Models. استبدلوا خوارزمية K‑means التقليدية بـ Gain‑Shape K‑means (GSKM) اللي بتحافظ على الاتجاهية أفضل، وبنوا عليها نظام Residual Quantization. التجربة على نموذج LLaMA‑3‑8B أظهرت تحسين كبير بالدقة، خصوصاً عند 1‑بت، حيث ارتفعت النتيجة من 11.34٪ إلى 33.54٪ على مجموعة LongBench.
ليش بتهمّك؟: هالطريقة بتقلل استهلاك الذاكرة للـ LLMs بدون ما تخلّي الأداء يطيح، فبتخلّي تشغيل نماذج كبيرة أيسر وأرخص.
🌱 شو إلك منها؟
بتخيل إنك بدك تشغّل برنامج ترجمة أو مساعد ذكي على موبايلك، بس الذاكرة قليلة. هالتقنية بتضغط البيانات لتقرب من 1‑بت، يعني بتوفر مساحة وتخلي البرنامج يشتغل أسرع وبطاقة أقل. ممكن تشوف الفرق إذا استعملت تطبيقات الذكاء الاصطناعي على هواتف أضعف أو على السحابة بأقل تكلفة.
quantization LLM KV cache efficiency GSRQ arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#10

تعقيد حواري: جمعيات LLM وكائنات قابلة للتفسير

Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates
الفريق بقيادة Elias Najarro بيقترح إنه مجموعة من نماذج اللغة الكبيرة اللي صارت وكلاء (agentic) ممكن تكون منصة حوسبة للذكاء الاصطناعي الحي. لأن الوكلاء بيتكلموا مع بعض بلغة طبيعية، بنقدر نفحص سلوكهم من خلال النصوص اللي بيولدوها. الدراسة بتوضح كيف التفاعل بين عدة LLM بيولد ديناميكيات جديدة ما بتظهر بنموذج واحد، وبتعرض أمثلة من تجارب ومشروعات موجودة.
ليش بتهمّك؟: هالطريقة بتخلينا ندرس سلوكيات معقدة بطريقة شفافة ومفهومة للباحثين.
🌱 شو إلك منها؟
تخيل مجموعة شباب يتناقشوا على مشروع ويستفيدوا من خبرات بعضهم، هيك بالضبط الوكلاء بيتكلموا مع بعض ويتعلموا سوا. هالشي بيساعدنا نفهم كيف ممكن تصير أنظمة ذكية تتصرف بحكمها بدون ما نبرمج كل خطوة. بالمستقبل ممكن نشوف هالتقنية بأدوات مثل المساعدين الرقميين اللي يتعاونوا مع بعض لتسهل علينا شغلنا اليومي.
agents language-models artificial-life interpretability arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#11

نماذج اللغة بالانتشار المتعدد للكتل (Multi-Block Diffusion)

Multi-Block Diffusion Language Models
الفريق Yijie Jin وزملاؤه قدموا Multi-Block Diffusion Language Models (MBD-LMs) لتسريع توليد النصوص باستخدام انتشار متعدد الكتل. هالنموذج بيستفيد من Multi-block Teacher Forcing (MultiTF) اللي بيجمع بين teacher forcing وdiffusion forcing ويعلّمه على مجموعات ضوضاء متناسقة مع حالة الاستدلال. كمان أضافوا آلية Block Buffer اللي بتحافظ على إعادة استعمال الذاكرة وتخلي شكل الإدخال ثابت، فبالتالي بيزيد سرعة التوليد (Tokens Per Forward pass) بشكل ملحوظ مع خسارة دقيقة بالـ accuracy.
ليش بتهمّك؟: هالتحسين بيسمح لتطبيقات الدردشة والكتابة التلقائية توليد ردود أسرع بدون ما يضيعوا دقة النموذج.
🌱 شو إلك منها؟
بتخلي المساعدات الذكية ترد عليك بسرعة أكتر، زي ما إذا كنت عم تكتب مسج وتستنى رد، هالنظام بيقلل وقت الانتظار. السرعة هيدي بتظهر في تطبيقات الشات أو أدوات الكتابة التلقائية اللي بتستعمل الذكاء الاصطناعي. يعني إذا بتستعمل أي برنامج بيعطيك اقتراحات نصية، رح تحس إنه الاقتراحات بتطلع فورًا.
diffusion language-model parallel-decoding efficiency token-generation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#12

اكتشاف علمي ذاتي عبر Meta-Reflection

Autonomous Scientific Discovery via Iterative Meta-Reflection
الفريق Zhao وزملاؤه قدموا DiscoPER، إطار شغّال بـ large language model بيعمل أبحاث مفتوحة بدون أسئلة محددة مسبقاً. كل فكرة جديدة بيختبروها إحصائياً، وبعدين بيستخدموا آلية second‑order reasoning لتعيد تقييم كل الاكتشافات وتلاقي أنماط أو فجوات. كمان بيضيفوا أدوات لتعامل مع صور وبيانات متعددة الوسائط، يعني ما بيقيفوا على النصوص بس. التجربة على iNatDisco ورّجت إنه النظام قدر يلاقي 8 من 9 أنماط معروفة بنسبة دعم 72.7%، وتفوق على الطرق التقليدية والبدائل المدعومة بـ LLM.
ليش بتهمّك؟: المقال بيفتح باب لتوليد أفكار علمية جديدة بشكل آلي وبدون تدخل بشري كبير، وهاد ممكن يسرّع الاكتشافات الحقيقية.
🌱 شو إلك منها؟
تخيّل إنه في برنامج يقدر يطلع أفكار جديدة لتجارب علمية ويختبرها لحاله، مثل ما بنشتغل على تجارب بالمختبر بس بسرعة أكبر. هالفكرة ممكن تشوفها قريباً بتطبيقات البحث على الإنترنت أو برامج تحليل الصور اللي بتساعدنا نفهم الطبيعة. يعني إذا استعملت تطبيق يفسّر صور النباتات ويعطيك تنبؤات علمية، هالشي ممكن يكون نتيجة لتقنية مثل DiscoPER.
LLM scientific discovery meta-reflection multimodal benchmark hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#13

لما الـLLMs يقروا الجداول بهستيرية: قياس وتقليل أخطاء الإشارة للبيانات

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
الفريق بقيادة Yang وزملاؤه عملوا أول تقييم منهجي لأخطاء الإشارة للبيانات (DREs) اللي بتصير لما الـLLMs يقروا جداول، ولقوا إن هالأخطاء موجودة بكل النماذج من 1.7B لحد 20B بارامتر. بعدين جربوا يضيفوا مكوّن اسمّه critic يراقب الإشارات، وشفنا إنه الدقة ارتفعت لحد 12% باستخدام الفلترة والـrejection sampling. كمان درّبوا نموذج critic خفيف وزن 4B حقّق F1 بـ78.2%، وقدر يكتشف الأخطاء داخل وخارج التوزيع ويساعد النماذج الكبيرة.
ليش بتهمّك؟: هالطريقة بتخلّي إجابات الـLLMs على الجداول أدق وأكتر موثوقية، وبتقلل الأخطاء اللي ممكن تضلّق المستخدمين.
🌱 شو إلك منها؟
تخيل إنك تسأل برنامج ذكي عن جدول أسعار، وهو يجيب لك أرقام غلط أو ينسى قيم. هالبحث بيطوّر طريقة تخلي البرنامج يراجع إجاباته قبل ما يعطيك النتيجة، زي ما بنقّص أكل قبل ما نقدمه. يعني رح تشوف تطبيقات مثل المساعدات الرقمية أو أدوات تحليل البيانات تعطيك معلومات أدق وأكتر ثقة.
LLM table understanding data referencing errors evaluation critic model hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#14

SpheRoPE: توليد بانوراما ٣٦٠° بدون تدريب

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
الفريق قدم طريقة صفر‑شوت وما فيها training ولا optimization لتوليد صور وفيديوهات بانورامية ٣٦٠° عبر حقن أولويات كروية داخل نماذج diffusion transformers المدربة مسبقاً. الطريقة بتستبدل Rotary Position Embeddings العادية بـ Spherical RoPE، بحيث القنوات منخفضة التردد بتنُعاد تمثيلها كإحداثيات كارتيسية 3D لتشيف الكروية، والقنوات عالية التردد بتتكمم هارمونيكياً لتضمن دورية دقيقة. مع إرشاد Semantic Distortion classifier‑free guidance (CFG) بيتم توجيه الشكل الهندسي مباشرةً، فبنقدر نستفيد من قدرة الموديلات الكبيرة مثل Flux.1، Flux.2، وLTX‑Video بدون ما نعيد تدريبها.
ليش بتهمّك؟: هالطريقة بتخلّي توليد محتوى ٣٦٠° سريع وبدون تكلفة تدريب، وبتفتح باب لتطبيقات واقع افتراضي وتسلية أكتر واقعية.
🌱 شو إلك منها؟
تخيل إنك تقدر تصوّر صورة بانورامية ٣٦٠° من وصف نصي أو صورة وحدة، وما تحتاج تنتظر ساعات تدريب أو برامج معقدة. هيك بتصير قادر تشوف المشهد كأنك داخل الغرفة، زي ما بتشوف الفيديوهات 360° على يوتيوب أو جوجل ستريت فيو، بس بسرعة أكتر. النتيجة إنه تطبيقات الواقع الافتراضي، الألعاب، أو حتى جولات العقارات على الإنترنت ممكن تستفيد من هالتقنية لتقدّم تجارب غامرة بدون ما يضطروا يشتغلوا على جمع بيانات ضخمة.
diffusion zero-shot 360 panorama vision generation hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#15

المشهد ثلاثي الأبعاد ككائنات، مش نقاط أولية

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
الفريق قدم طريقة تغذية أمامية بتفكّك المشهد إلى مجموعات توكنات ثلاثية الأبعاد مرتبة حسب الكائنات، من غير ما نحتاج لعلامات ثلاثية الأبعاد. كل مجموعة فيها توكن هوية للكائن وتوكنات ربط بتشفر الهندسة والمظهر المحلي وتتحول لسحابات 3D Gaussians. التدريب بيتم عبر rendering قابل للاشتقاق مع إشراف على إعادة البناء والتقسيم، يعني ما في حاجة لبيانات 3D يدوية. النموذج بيتفوّق على طرق تحسين المشهد لكل مشهد من ناحية التقسيم الكائناتي وبيظل منافس في توليد مناظر جديدة.
ليش بتهمّك؟: هالطريقة بتخلّي تعديل المشهد وإزالة أو نقل الكائنات أسهل وأسرع من غير ما نعيد بناء كل شي من الصفر.
🌱 شو إلك منها؟
تخيّل إنك تقدر تشيل أو تحرك أي غرض بالصورة، زي ما بتحرك الأثاث بالمنزل على شاشة الموبايل. كمان فيك تدور على غرض معين بصور ثلاثية الأبعاد وتلقاه بسرعة. هالشي بيظهر بأدوات تعديل الصور وتطبيقات الواقع المعزز اللي بنستعملها يوميًا.
3D reconstruction instance segmentation tokenization vision open-vocabulary hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#16

GEAR: توجيه التدريب المتكامل لتوليد الصور

GEAR: Guided End-to-End AutoRegression for Image Synthesis
الفريق قدم طريقة جديدة لتدريب مولّد الصور والـ tokenizer مع بعض، بدل ما يتدربوا منفصلين. الطريقة اسمها GEAR وبتستعمل قراءتين للـ codebook: وحدة صلبة لتدريب المولّد على توقع الرموز، ووحدة ناعمة بتنقل خسارة تماثل التمثيل للـ tokenizer. بهالطريقة الـ tokenizer بيتعلم يطلع رموز أسهل على المولّد، فالتوليد بيصير أسرع وأدق.
ليش بتهمّك؟: هالطريقة بتقلّص وقت التدريب وترفع جودة الصور المتولدة، فبتفيد الباحثين والمطورين اللي بيشتغلوا على توليد صور سريعة.
🌱 شو إلك منها؟
تخيّل إنك بدك تولّد صورة من لا شيء بسرعة، هالطريقة بتخلي البرنامج يشتغل أسرع بكتير، يعني ممكن تشوف صور جديدة على طول. زي ما الماكينة بتتعلم تكتب الحروف بطريقة أسهل، كمان النموذج بيتعلم يطلع رموز أبسط للصور. هالشي ممكن ينعكس على تطبيقات تعديل الصور أو إنشاء صور للمنتجات على الإنترنت.
image generation VQ autoregressive representation alignment gFID hf اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#17

مهارات الوكلاء مش جزر: قياس الاعتماد والمخاطر في سلاسل إمداد مهارات الوكلاء

Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains
الفريق قدم مفهوم سلاسل إمداد مهارات الوكلاء (Agent Skill Supply Chains) لتصوّر كيف المهارات بتعتمد على بعضها البعض وتتحوّل لقطع برمجية معقدة. صمموا أداة SkillDepAnalyzer تلتقط أدلة الاعتماد من النص وتبني مخططات الاعتماد بدقة، وتفوقت على الأدوات التقليدية على benchmark اسمه SKILL-DEP. بعد ما حللوا أكتر من مليون مهارة، لاقوا أربع أنماط هيكلية وأظهروا إنه مهارة وحدة ممكن تخفي مخاطر أمان داخل الاعتماد اللي وراها. النتائج بتدعم توصيات لتوثيق الاعتماد وإضافة تحذيرات مخاطر للمنصات.
ليش بتهمّك؟: هالورقة بتساعد مطوري الوكلاء يكتشفوا الاعتمادات المخفية ويقللوا مخاطر الاختراق أو الأخطاء اللي ممكن تأثر على التطبيقات الفعلية.
🌱 شو إلك منها؟
تخيل إنك عم تستخدم تطبيق فيه إضافات، بس ما بتعرف شو الإضافات اللي وراه ومين عملها؛ ممكن تكون فيها مشاكل أمان. هالدراسة بتوضح كيف ممكن نكشف هالإضافات المخفية ونحمي بياناتنا. يعني إذا بتستعمل خدمات تعتمد على LLM، هالأدوات رح تخليها أكثر أمان وموثوقية.
agents dependency security LLM benchmark arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#18

نظام Language‑Critique لتقليد التعلم من شواهد غير مثالية

Language-Critique Imitation Learning from Suboptimal Demonstrations
الفريق قدم طريقة جديدة بتستغل اللغة الطبيعية كإشارة إرشادية بدال الإشارات العددية البسيطة. بيبنوا تسميات لغوية من الشواهد لتوصف التقدم، وتحدد الأخطاء، وتعطي توجيهات تصحيحية دقيقة. بعدين بيطبقوا خسارة language‑critique لتدريب السياسات مباشرة على هالإشارات، وطبقوها على كل من behavior cloning وdiffusion policies. التجارب على مهام تحكم مستمرة مثل التنقل والتلاعب واللعب أظهرت تفوق واضح على أساليب التقليد التقليدية وطرق التعلم المعزّز غير المتصلة.
ليش بتهمّك؟: الطريقة بتخلي النماذج تتعلم من بيانات غير مثالية بصورة أذكى، لأن اللغة بتعطي تفاصيل ما بتوصلها الإشارات العددية.
🌱 شو إلك منها؟
تخيل إنك تعلم طفل يركب دراجة، مش بس تقول له "حاول"، بل تقول له "هلق انت على الطريق، بس بترجع شوي لتقوى توازن"؛ هالطريقة بتعمل نفس الشي مع الروبوتات. يعني ممكن تشوف تطبيقات أحسن للروبوتات المنزلية أو الألعاب اللي تتعلم من أخطاء الناس بدل ما تحتاج بيانات مثالية. هالشي بيقرب التكنولوجيا من حياتنا اليومية لأنه الروبوتات رح تصير أذكى وتتعلم من أخطائنا بسهولة.
imitation learning language supervision continuous control diffusion policies offline RL arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#19

تقييم أمان نماذج اللغة عبر البراغماتية العدائية

Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity
الباحث بريت رينولدز قدم طريقة جديدة لتقييم أمان نماذج اللغة لما يواجهوا أوامر متضاربة أو أوامر مخبّية داخل النص. هو بنبني تصنيف لغوي منظم وبيجمع 18 سؤال تجريبي مع بيانات دقيقة، وبيضيف بروتوكول لتقييم إذا النموذج نفّذ المهمة، التزم بالسياسة، أو رفض بأمان. كمان بيقيس ثقة المقيم وبيتابع إذا التصنيف بيتغيّر مع الوقت.
ليش بتهمّك؟: هالطريقة بتساعدنا نعرف بالضبط وين النموذج بيغلط بالأمان، مش بس بنقول نجح أو فشل.
🌱 شو إلك منها؟
تخيل إنك تعطي برنامج تعليمات وتلاقيه يخلط بين طلبين أو يلتقط أوامر مخفية، هالورقة بتعلمنا نختبر إذا البرنامج بيحترم القواعد أو لا. هالشي مهم لأنه إذا البرنامج يخلط أو يتجاهل تعليمات الأمان، ممكن يسبب مشاكل بالمحادثات اليومية أو التطبيقات اللي بنستعملها. هالنتائج رح تنعكس على أدوات مثل المساعدين الرقميين اللي بنستعملهم كل يوم.
safety benchmark instruction-following LLM evaluation arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
#20

AGC-Bench: معيار الإبداع العام للذكاء الاصطناعي

AGC-Bench: Measuring Artificial General Creativity
الفريق قدم AGC-Bench، معيار جديد بيقيس الإبداع العام للـLLMs عبر 78 مجموعة بيانات من العصف الذهني للكتابة للعلوم والضحك. استعملوا AGC-Judge، نموذج وزن مفتوح مبني على Qwen3-30B، لتقييم الإبداعات بعد ما عدلوا الانحياز بتقنية Judge Response Theory. النتائج بينت إنه في موديلات بتتفوق على غيرها، وإنه طلب من الموديلات “تكون مبدعة” بيحسن الأداء أكتر من تمكين التفكير بس. كمان لقوا عامل إبداع واحد بيشبه عامل “g” للذكاء العام، لكنه منفصل عن المعرفة العامة.
ليش بتهمّك؟: الورقة بتعطي طريقة موحدة نقارن فيها إبداع الموديلات، فبنقدر نعرف أي موديل فعلاً بيطلع بأفكار جديدة مش بس بيسترجع معلومات.
🌱 شو إلك منها؟
تخيل إنك عم تستخدم تطبيق بيكتب لك قصص أو يحل لك مشاكل علمية، هالمعيار بيساعد المطورين يختاروا النموذج اللي بيطلع بأفكار أصيلة. يعني إذا بدك برنامج يكتب نكت أو يطلع بحلول مبتكرة، هالمعايير بتضمن إنه النموذج مش بس بيكرر، بل بيبدع. هالشي بنشوفه قريباً بأدوات الكتابة الذكية أو مساعدات البحث.
creativity benchmark LLM evaluation AI arxiv اقرأ المزيد ↗
💬 أضِف تعليقك
بيظهر بعد مراجعة المحرّر ✦
📘 مصطلحات هذا العدد 14
💡 مفاهيم 8
OpenAgent
OpenAgent هو مفهوم بيحكي عن نظام بيشتغل كوكيل مفتوح يقدر يتفاعل مع المستخدمين ويأخذ قرارات بشكل مستقل، بنسمع عنه لأنه بيساعدنا نطور تطبيقات ذكاء اصطناعي مرنة.
supervised fine-tuning (SFT)
عملية تدريب نموذج بيانات بحيث بنديله أمثلة صحيحة وبنقول له شو الإجابة الصح، نفس ما تعلمي الطفل من خلال إعطاء أمثلة محددة.
reinforcement learning
تعليم الذكاء الاصطناعي من خلال نظام الحوافز والعقوبات، زي لما تعلمي طفل بالمكافأة والعقاب عشان يتعلم السلوك الصحيح. بنستخدمه عشان الآلة تتعلم تاخذ قرارات ذكية بنفسها من غير ما نحطّ كل إجابة جاهزة.
Perturbation-Augmented Fine-Tuning
Perturbation-Augmented Fine-Tuning يعني تعديل النموذج مع إضافة تشويش أو تغييرات صغيرة للبيانات عشان يحسّن الأداء، بنسمع عنه لأنه بزيد من قدرة النموذج على التعميم.
latent reasoning
latent reasoning هو مفهوم بيعني إن النموذج بيستنتج معلومات مخفية أو غير مباشرة من البيانات، بنسمع عنه لأنه بيفتح فرص لتفسير أعمق للنتائج.
VLA
VLA هو مفهوم بيمثل Attention مع متجهات طولية (Vector Length Attention) لتقليل تعقيد الحسابات، بنسمع عنه لأنه بيخلي الـ Transformers أسرع.
transformer layer
transformer layer هو طبقة أساسية في بنية الـ Transformers بتعالج المعلومات عبر آلية الانتباه، بنسمع عنها لأنها الأساس اللي بيشتغل منه معظم نماذج الذكاء الاصطناعي اليوم.
layer contribution
بنقيس فيها إيش دور كل طبقة بالنموذج بعملية اتخاذ القرار، يعني بنعرف أي طبقة عم تعطينا أهم المعلومات.
🤖 موديلز 4
AMVL
AMVL هو اسم موديل بيستخدم في تحليل الفيديوهات المتعددة اللغات، بنسمع عنه لأنه بيساعدنا نفهم محتوى الفيديوهات بأكتر من لغة.
VLM
اختصار لـ Vision Language Model، يعني نموذج ذكي بيفهم الصور والنصوص مع بعض. بنسمع عن هاي النماذج كتير الآن عشان بتفتح إمكانيات جديدة في تحليل الصور والفيديوهات.
Act2Answer
Act2Answer هو موديل بيحول الأفعال أو الأسئلة إلى إجابات مباشرة، بنسمع عنه لأنه بيسهل بناء أنظمة سؤال وجواب تفاعلية.
Qwen3
الـQwen3 هو نموذج لغة حديث من شركة Alibaba، بيقدّم أداء عالي عالـNLP وبيستفيد من تقنيات جديدة، بنسمع عنه لأنه بيقارن مع GPT-4 وغيره.
📏 مقاييس 1
KL divergence
مقياس بيقيس قديش توزيعين إحصائيين مختلفين عن بعض، بنشوفه كتير لحتى نقيم جودة النماذج
🗂️ بيانات 1
BLINK
BLINK هو مجموعة بيانات (dataset) مخصصة لتدريب نماذج ربط الكيانات، بنسمع عنها لأنها بتعطي نماذجنا قدرة على ربط أسماء الأشخاص أو الأماكن بشكل أدق.
كل المصطلحات ←
العدد السابقشو في AI؟ | 1 يوليو — إيقاف ذكي للوكيل، نموذج متعدد الوسائط
📚 كل الأعداد