#1
See2Think: هل الموديلات المتعددة الوسائط فعلاً بتستعمل الحالات البصرية المتوسطة؟
See2Think: Do Multimodal Models Really Use Intermediate Visual States?
الفريق قدم See2Think، إطار تقييم موحد بيجمع بين See2ThinkBench ومكوّن Visual Action-of-Thought (VAoT). See2ThinkBench فيه 1200 سؤال مفتوح بيعتمد على الصورة، موزعين على 12 فئة من مهام التفكير الهيكلي ثنائي الأبعاد، المشاهد ثلاثية الأبعاد، والتفكير بالعالم الحقيقي. VAoT بيسجّل الأفكار النصية، الإجراءات البصرية، الحالات المرسومة، والتفكير اللاحق تحت أربع إعدادات استدلال متحكم فيها. النتائج بتوضح إن الأداء البصري بيعتمد كتير على النموذج والبيئة، وإن توليد الصور الدقيقة هو أضعف نقطة بالعملية.
ليش بتهمّك؟: هالورقة بتفرجينا إذا النماذج فعلاً بتستفيد من الصور الوسيطة ولا لا، وبتساعدنا نطور أدوات تقييم أدق.