#1
LongStraw: تدريب RL بسياق طويل تحت ميزانية GPU ثابتة
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
الفريق Zhou وزملاؤه قدموا LongStraw، نظام تنفيذ بيشتغل مع سياقات مليون توكن تحت ميزانية GPU ثابتة. الطريقة بتستغل Group Relative Policy Optimization وبتقليل الرسم البياني للتدريب عن طريق حذف autograd من الـprompt المشترك وتخزين الحالة الضرورية بس. جربوها على موديلات Qwen3.6-27B وGLM-5.2 وحققوا تدريب مجموعات توكنات بأكثر من 2 مليون على 8 أو 32 بطاقات H20 بدون ما يزودوا الذاكرة كتير.
ليش بتهمّك؟: هالطريقة بتخلّي تدريب نماذج كبيرة بسياق طويل يصير ممكن على أجهزة GPU محدودة، يعني بنقرب التقنية من التطبيقات الواقعية.