🌊 🧠 Следующий скачок автономности может прийти не из языка
🌊 🧠 Следующий скачок автономности может прийти не из языка Большие языковые модели хорошо умеют работать с текстом. Но дрон существует в физической среде: вокруг него движутся объекты, меняется ветер, течение, волна, видимость и положение самого аппарата. Поэтому особенно интересно развитие world models. Например, V-JEPA 2 обучалась более чем на миллионе часов видео, а для адаптации к планированию действий робота разработчикам потребовалось менее 62 часов роботизированных данных. Логика здесь отличается от обычной генеративной модели. Система учится строить скрытое представление происходящего и прогнозировать, как состояние мира изменится дальше. Для автономного аппарата такая модель должна постоянно оценивать примерно следующее: 🔹 куда через несколько секунд переместится другой объект 🔹 что изменится после собственного манёвра 🔹 какие части наблюдаемой среды связаны между собой 🔹 какое действие приведёт систему к нужному состоянию Причём есть признаки, что такие представления действительно начинают содержать физику. В работе Interpreting Physics in Video World Models исследователи обнаружили внутри видео-моделей распределённые представления скорости, ускорения и направления движения. Пока V-JEPA 2 демонстрировалась на роботизированных манипуляторах, поэтому переносить результат непосредственно на БЭК или АНПА рано. Тем не менее, направление выглядит логичным развитием. Морскому дрону в конечном счёте важнее не описать окружающую обстановку словами, а предсказать, что с ней произойдёт после его следующего действия. Подписывайтесь на канал ИЦ Маринет 5.0 в МАКС