41 миллион токенов на крышку — 17 сентября 2026 г. в 18:27:15.416
41 миллион токенов на крышку Робота, обученного работать в одной лаборатории, нельзя просто перенести в другую. Меняются камеры, освещение, расположение оборудования и конструкция захвата — и визуально-языковая модель действий, или VLA, перестаёт узнавать знакомую задачу. Обычно для неё приходится заново собирать демонстрации и проводить дообучение. Но всё это дорого и нудно. Почему бы не спихнуть это на ИИ? Так подумали исследователи из Токийского университета, RIKEN, NYU и Google DeepMind и создали проект WetRobo. Вместо готовой политики в новую лабораторию переносят робота, базовый код и Codex, который осматривается на месте и сам пишет управление под конкретную установку. В набор вошли рука AgileX Piper, камеры, захват, правила безопасности в AGENTS.md и по 15 записанных человеком демонстраций для трёх операций. Учёный формулирует задачу обычным текстом. Codex на базе GPT‑5.6‑sol анализирует изображения и состояние робота, пишет программы, запускает их и исправляет после неудачных попыток. Так агент научил робота поднимать крышку чашки Петри, снимать крышку с бутылки и открывать инкубатор. Для чашки он подключил SAM 3, восстановил трёхмерную сцену по RGB-D-кадрам и проверял захваты в MuJoCo до отправки команд роботу. С бутылочной крышкой Codex не стал использовать готовые демонстрации. В одной лаборатории он нашёл крышку через OpenCV, сделал три пробных движения и вычислил, как перемещение руки отражается на изображениях с камер. Первые три захвата не удались. После этого агент изменил положение кисти, зажал крышку, трижды повернул и поднял её. Ту же задачу повторили в другой лаборатории — с иным захватом, числом камер, освещением и расположением оборудования. Здесь Codex написал другое решение: использовал AprilTag для определения координат и MuJoCo для проверки столкновений. Робот снял крышку в обеих установках. На первый успешный захват потребовалось: ▪️ 41,4 млн токенов и 1 час 2 минуты в лаборатории X; ▪️ 23 млн токенов и 49 минут в лаборатории Y. Для сравнения авторы дообучили VLA-модель π0.5 на 25 видеозаписях из лаборатории X в течение 100 тыс. шагов. Она справилась в исходной установке, но провалила ту же задачу в лаборатории Y. Codex адаптировался в обеих. Теперь ждём, когда он научится перемещать роборуку, и в захвате окажется уже ближайший исследователь! @anti_agi

