#1
TTPO: تحسين السياسة وقت الاختبار للـ LLM
TTPO: Test-Time Policy Optimization
الفريق Wang وزملاؤه قدموا طريقة جديدة اسمها Test-Time Policy Optimization (TTPO) لتدريب نماذج اللغة الكبيرة وقت ما بنستخدمها، من غير ما نحتاج لتسميات صحيحة. الفكرة إنه إذا كان في تصويت أغلبية للجواب، بنستغل الردود المتوافقة مع هالتصويت ونقويها عبر On-Policy Self-Distillation، وبنعاقب الردود المتعارضة باستخدام Grouped RL. كمان بيتم اختيار الكلمات على مستوى التوكن لتقليل الأخطاء وتخفيف العقاب على الأخطاء الواثقة. النتيجة إنه TTPO توصل لأداء يساوي الطرق المدربة بتسميات صحيحة على خمس Benchmarks وتزيد من دقة Qwen3-1.7B من 38% لـ45% بدون أي تسميات.
ليش بتهمّك؟: هالطريقة بتخلّي نماذج اللغة تتعلم وتتحسّن مباشرةً على المهمات بدون ما نحتاج نجهّز بيانات معلمة، فبتقصر وقت التطوير وتقلّل التكاليف.