Нейросеть научилась прогнозировать события на видео с точностью до 99%. — 21 июня 2026 г. в 16:00:05.233
Нейросеть научилась прогнозировать события на видео с точностью до 99%. Исследователи из МФТИ, Института AIRI и Университета Иннополис разработали уникальный метод DyGEnc. Он учит большие языковые модели детально понимать видео, отслеживая движения и взаимодействия объектов. Эта технология, результаты работы над которой опубликованы в журнале Technologies, в первую очередь предназначена для умных роботов, помогающих в быту, логистике и на производстве. Метод работает изящно: он сжимает видеоряд в специальный граф событий, где предметы становятся вершинами, а их действия — связующими ребрами. Затем эта выжимка передается нейросети. По словам соавтора проекта Дмитрия Юдина, такой подход собирает картину из понятных кусочков, не позволяя алгоритму забывать начало длинных роликов или выдумывать несуществующие детали. Тесты показали фантастические результаты. На базе STAR (9 тысяч бытовых видео) метод правильно ответил на 99% вопросов о взаимодействии предметов и предсказал 97% следующих действий. На сверхсложном наборе AGQA из 2,27 млн вопросов точность подскочила с 54% до 93%. Весь исходный код уже выложен в открытый доступ на GitHub. Технологию успешно проверили в деле на реальном роботе-манипуляторе. Он получал живые голосовые задания на русском языке (например, «подъехать к столу и взять предмет») и выполнял их, анализируя видео с камер в реальном времени. Точность работы не падала ниже 90% даже при сильных искусственных помехах. Как отмечает главный автор метода Сергей Линок, впереди следующий важный шаг — создание архитектуры, которая сможет принимать видео напрямую, полностью минуя промежуточный этап текстовой разметки.

