Google выпустила мультимодальную EmbeddingGemma 2
Google выпустила мультимодальную EmbeddingGemma 2 Первая версия принимала только текст. Новая построена на Gemma 4 и переводит текст, код, изображения, видео и аудио в общее векторное пространство — числовое представление разных типов данных. Их можно смешивать на входе. Всего у модели 740 млн параметров, но загружать её целиком необязательно: текстовая часть занимает 270 млн, а энкодеры изображений и аудио — модули для преобразования этих данных в векторы — подключаются отдельно по необходимости. Контекст вырос до 8 тысяч токенов — единиц входных данных, которые модель обрабатывает за раз. Это около 5,5 минут аудио или 29 изображений. На текстовых задачах качество осталось на уровне первой версии, на коде заметно улучшилось. В анонсе Google заявлен лучший результат среди мультимодальных эмбеддеров — моделей для такого числового представления данных — размером до 1 млрд параметров. Веса модели открыты под лицензией Apache 2.0. анонсе Google: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/ Веса модели открыты: https://huggingface.co/google/embeddinggemma-2 Источник: https://t.me/data_secrets/10110 #RealVibe #AI #AI_Новости