#1
لما توكنات EOS ما بتتفق: مشكلة طول النصوص في التقطير على‑السياسة
When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
الباحثين اكتشفوا إنو لما الطالب (model) يتعلم من معلم (teacher) بطريقة on‑policy distillation، أحياناً بيطلع ردود طويلة كتير لدرجة ما بيوصل للحد المسموح. السبب الأساسي هو إنو توكنات EOS اللي بيستعملها الطالب والمعلم ما بتتطابق، حتى لو مجموعات التوقف معلن عنها نفسها. هالاختلاف بيمنع الطالب يوقف على الوقت المناسب وبيخلي النص يطول. حلّوا المشكلة إنهم عالجوا التوكنات المتكافئة كإجراء إيقاف موحد، ولقوا إنو هالطريقة بتقلل طول النصوص بشكل كبير.
ليش بتهمّك؟: هالملاحظة بتساعدنا نتحكم بطول النصوص المنتجة من النماذج، فبنقلل استهلاك الوقت والموارد.