👀 ИИ научится воспринимать мир как человек? — 1 октября 2026 г. в 06:00:15.362
👀 ИИ научится воспринимать мир как человек? Сначала каждая ИИ-модель работала с одним типом данных, например текстами или изображениями. Потом их объединили в VLM — к языковой модели подключили визуальную через программный адаптер. А пару лет назад появился тренд на омни-модели, которые понимают разные типы данных без адаптеров. Алексей Григорьев, руководитель команды алайнмента VLM, считает, что это может привести к скачку в развитии ИИ. Омни-модель (от лат. omnis — «всё») — это нейросеть, которую с самого начала учат работать и с текстами, и с изображениями. Создавать такие нейросети сложно, но «растить» одну модель вместо нескольких гораздо эффективнее. Сервисы на базе омни-моделей работают лучше, так как «под капотом» не нужно переключаться между нейросетями. Самое интересное в омни-моделях — синергия: улучшение одной из модальностей улучшает и другую. Именно так случилось во время обучения омни-модели Alice AI на текстовых данных: она стала лучше обрабатывать и картинки тоже. Омни-модели улавливают связи между изображениями и текстом (например, пишут стихи по фотографии) и за счёт этого оказываются ближе к целостному восприятию мира, свойственному людям. У омни-моделей даже могут появиться эмерджентные свойства — способности, которые не закладывали при разработке. Например, они могут научиться понимать физику реального мира. Сейчас инженеры работают над тем, чтобы сбалансировать качество текстовой и визуальной выдачи внутри одной омни-модели. А в будущем разные модальности окончательно сольются в единую эффективную систему. Подписывайтесь 👉 @techno_yandex