Генерирую, следовательно, вижу — 13 июля 2026 г. в 11:58:15.333
Генерирую, следовательно, вижу У компьютерного зрения до сих пор не было своей LLM. Определение глубины, сегментация объектов, восстановление положения камеры и отслеживание человеческого тела — всё это в CV обычно требует отдельных моделей. Их, конечно, можно собрать в одну систему. Но от этого они не начинают делиться знаниями: каждая по-своему представляет сцену, требует собственных размеченных данных, выходных модулей и настройки. Решить проблему взялись исследователи Google DeepMind, MIT и Оксфорда — они превратили модель для генерации видео в универсальную систему компьютерного зрения. GenCeption умеет по одному ролику определять глубину сцены, положение камеры, границы объектов, направление поверхностей и координаты человеческого тела. В основе системы лежит открытая видеомодель Wan 2.1. Для дообучения команда создала всего 7,5 тыс. синтетических роликов в Blender. В них использовали 800 цифровых персонажей, 200 движений, разные камеры, освещение и окружение. Вместе с видео движок сразу выдавал точную глубину, положение камеры, маски объектов и координаты тела. Этого оказалось достаточно, чтобы GenCeption сравнялась или обошла несколько специализированных систем. В отдельных задачах ей понадобилось в 7-500 раз меньше данных. Модель, обученная преимущественно на синтетических людях, смогла работать с реальными съёмками, животными и роботами. Авторы объясняют предобучением. Чтобы правдоподобно продолжать видео, генератору приходится неявно усвоить трёхмерную геометрию, постоянство объектов, движение и простейшие физические закономерности. Обычно эти знания нужны ему для создания следующего кадра. GenCeption заставляет использовать их в обратную сторону — чтобы понять уже показанную сцену. Впрочем, до полноценного «зрения общего назначения» ещё далеко. Сейчас это набор заранее заданных задач, сведённых к одной архитектуре. Модель также довольно тяжёлая: версия на 14 млрд параметров обрабатывает 81 кадр примерно за 10 секунд на TPU и требует до 42,8 ГБ памяти. Но это понимают и сами авторы. GenCeption для них — доказательство самой идеи: генерация видео может стать для компьютерного зрения общим способом предобучения, а не только инструментом производства роликов. Примерно как предсказание следующего слова когда-то оказалось полезно далеко за пределами продолжения текста. @anti_agi

