Обработка изображений в LLaMA 3.1: ключевые особенности
Обработка изображений в LLaMA 3.1: ключевые особенности В LLaMA 3.1 для работы с изображениями используется модель ViT-H/14 с 630 миллионами параметров. Она обучалась на наборе из 2,5 миллиарда пар изображений и текстов. Изображение делится на патчи 16x16, проходит через линейное преобразование и трансформерные слои, в результате чего формируется представление из 2 308 токенов. Это представление через кросс-аттеншен блоки подаётся в языковую модель (LLM). Особенность подхода заключается в том, что веса LLM остаются замороженными, обновляются только веса визуального энкодера и адаптера изображений. Это позволяет сохранить производительность модели на текстовых задачах. При работе с видео количество кадров на претрейне составляет 16, а на файнтюне — 64. Их сводят к фиксированной размерности и добавляют в LLM через кросс-аттеншн. В процессе обучения применяются различные методы, включая hot-swap и Rejection sampling. Модель с 405 миллиардами параметров демонстрирует результаты 80,2 пункта в бенчмарке VQAv2 и 84,8 пункта в TextVQA, но уступает Claude 3.5 в некоторых других тестах.