InternVL: сближение визуальных и языковых моделей
InternVL: сближение визуальных и языковых моделей Развитие визуальных моделей отстаёт от языковых, но авторы модели InternVL пытаются сократить этот разрыв. Модель объединяет визуальный энкодер InternViT-6B и языковую прослойку QLLaMA с 8 миллиардами параметров. Обучение проходило в три этапа: контрастивный претрейн, генеративный претрейн и файнтюнинг. На контрастивном этапе модель училась сопоставлять изображения и тексты, используя данные из LAION, COYO, CC12M. На генеративном — создавать описания для картинок, опираясь на COCO и TextCaps. В результате появились две модели: InternVL-C (contrastive) и InternVL-G (generative). В задаче мультиязычного поиска изображений по тексту InternVL-C показала recall@10 на уровне 95,1%, а InternVL-G — 96,6%. В zero-shot классификации видео точность InternVL-C составила 76,1%, 75,5% и 67,5% на наборах Kinetics-400, Kinetics-600 и Kinetics-700 соответственно.