PaliGemma: новая VLM-модель на базе PaLI и Gemma
PaliGemma: новая VLM-модель на базе PaLI и Gemma PaliGemma — это VLM-модель, которая объединяет технологии семейств PaLI и Gemma. Она способна обрабатывать изображения и видео, воспринимая последнее как последовательность кадров. Обучение модели проходит в четыре этапа: сначала PaLI и Gemma обучаются отдельно на данных одного типа, затем происходит совместное обучение на мультимодальных задачах с миллиардом сэмплов, после чего модель дообучается на данных с более высоким разрешением изображений и адаптируется под конкретные задачи. Одной из ключевых особенностей PaliGemma является использование подхода prefix-LM, который позволяет большему количеству токенов активно участвовать в процессе обработки информации. В задаче генерации описаний для изображений на датасете COCO модель показала результат 141,9 балла при разрешении 224 пикселей и 144,6 — при 448 пикселях. В задаче визуальных вопросов и ответов VQAv2 результаты составили 83,2 и 85,6 балла для разрешения 224 и 448 пикселей соответственно.