H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning
H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning JEPA Яна Лекуна получила иерархическую версию — H-JEPA. JEPA — архитектура, которая учится представлять происходящее и предсказывать дальнейшее развитие событий, а не угадывать следующий токен (фрагмент текста) или пиксель. Подробнее об идее JEPA. В новой работе о H-JEPA этот подход применили к планированию на длинном горизонте — на много действий вперёд. В Visual AntMaze, виртуальной среде для проверки того, как робот перемещается по лабиринту, доля успешных прохождений выросла с 18% до 73%. При этом затраты на планирование сократились. Вместо одной world model — модели мира, предсказывающей, как меняется среда, — здесь несколько уровней с разным временным масштабом. Верхний намечает дальний маршрут, следующий раскладывает его на конкретные подцели, а нижний выбирает действия, которые нужно выполнить сейчас. Верхние уровни сами учатся отбрасывать детали, несущественные для долгосрочного плана. В лабиринте это выглядит так: точное положение ног робота из представления исчезает, но сохраняется информация о том, где он находится и как устроен маршрут. Подробнее об идее JEPA: https://t.me/data_secrets/8915 новой работе о H-JEPA: https://alphaxiv.org/abs/2610.06805 Источник: https://t.me/data_secrets/10122 #RealVibe #AI #AI_Новости