LLaVa-CoT: как улучшить модели визуального языка
LLaVa-CoT: как улучшить модели визуального языка Авторы исследования разработали подход к обучению и инференсу визуальных языковых моделей (VLM), вдохновлённый технологией o1-preview от OpenAI. Они собрали 100 тысяч примеров из открытых VQA-бенчмарков и с помощью GPT-4o сгенерировали для них CoT-синтетику, включающую развёрнутое описание проблемы, описание изображения, пошаговое решение задачи и финальный ответ. Затем провели дообучение модели Llama-3.2-11B-Vision-Instruct на этих данных. В результате модель показала улучшение результатов: средний показатель вырос с 56,6 до 63,5. Дополнительное улучшение на полтора пункта удалось достичь благодаря методу Stage level Beam Search, который оптимизирует процесс вывода за счёт ветвления на уровне целых блоков CoT. По заявлениям авторов, их модель превосходит Gemini-1.5-Pro и приближается к Claude3.5-Sonnet, хотя до уровня GPT-4o ещё далеко.