#1
LOCOS: تقييم مساهمة اللوجيت يكشف رؤوس الاسترجاع غير الحرفية
Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
الفريق اللي بيقودها Aryo Pradipta Gema وBeatrice Alex وPasquale Minervini قدموا طريقة جديدة اسمها Logit-Contribution Scoring (LOCOS) لتحديد أي رؤوس الانتباه بالـ LLM بتكتب إجابات غير حرفية من السياق. الطريقة بتقيس إسهام دائرة الـ OV لكل رأس باتجاه تمثيل كلمة الجواب، وبتقارن بين المواقع اللي فيها المعلومة والمواقع اللي ما فيها، كل هاد بتم في تمريرة واحدة. جربوها على نماذج Qwen3 وGemma-3 وOLMo-3.1، ولاحظوا إن إلغاء الرؤوس اللي حددتها LOCOS بيقلل ROUGE-L أسرع من أي طريقة سابقة، وحتى ما بيأثر على مهام تانية زي الاستدعاء البراميتري أو الحسابات الحسابية. البحث ظهر على Hugging Face Daily Papers وجمع 12 upvote، وهو أصلاً preprint على arXiv.
ليش بتهمّك؟: لأنها بتخلينا نعرف أي أجزاء الموديل بتستخلص معلومة من غير ما تنسخها حرفيًا، فبنتحكم أفضل بتفسير سلوك النماذج الطويلة.
🌱 شو إلك منها؟
هالطريقة بتساعدنا نفهم كيف الذكاء الاصطناعي بيسترجع معلومات من الذاكرة بدل ما ينسخ نصوص جاهزة، زي ما بنحكي لصاحبنا قصة من الذاكرة مش من ورقة مكتوبة. يعني إذا استخدمنا موديلات تفهم وتلخص، بنحس بثقة أكبر إنه ما عم يسرق نصوص من الإنترنت. ممكن نشوف هالتحسينات بأدوات الكتابة الذكية أو محركات البحث اللي بتعتمد على ملخصات طويلة.