#1
LOCOS: تقييم مساهمة اللوجيت يكشف رؤوس الاسترجاع غير الحرفية
Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
الفريق اللي بيقودها Aryo Pradipta Gema وBeatrice Alex وPasquale Minervini قدموا طريقة جديدة اسمها Logit-Contribution Scoring (LOCOS) لتحديد أي رؤوس الانتباه بالـ LLM بتكتب إجابات غير حرفية من السياق. الطريقة بتقيس إسهام دائرة الـ OV لكل رأس باتجاه تمثيل كلمة الجواب، وبتقارن بين المواقع اللي فيها المعلومة والمواقع اللي ما فيها، كل هاد بتم في تمريرة واحدة. جربوها على نماذج Qwen3 وGemma-3 وOLMo-3.1، ولاحظوا إن إلغاء الرؤوس اللي حددتها LOCOS بيقلل ROUGE-L أسرع من أي طريقة سابقة، وحتى ما بيأثر على مهام تانية زي الاستدعاء البراميتري أو الحسابات الحسابية. البحث ظهر على Hugging Face Daily Papers وجمع 12 upvote، وهو أصلاً preprint على arXiv.
ليش بتهمّك؟: لأنها بتخلينا نعرف أي أجزاء الموديل بتستخلص معلومة من غير ما تنسخها حرفيًا، فبنتحكم أفضل بتفسير سلوك النماذج الطويلة.