Исследователи представили RoboDrop — фреймворк отбора данных для дообучения vision-lang...
Исследователи представили RoboDrop — фреймворк отбора данных для дообучения vision-language-action (VLA) моделей. Проблема в том, что после масштабного предобучения адаптация к но… RoboDrop оценивает каждый образец онлайн по локальной совместимости градиентов вдоль траектории обучения: во время одного разогревочного прохода градиент образца сравнивается с градиентами семантически и визуально близких валидационных примеров. Оценки агрегируются на уровне эпизода, после чего простое автоматическое правило превращает их в решение о фильтрации. Метод проверен на контролируемых искажениях наблюдений и действий, на естественно неоптимальных демонстрациях в симуляции и на реальных данных. Для российского производства это означает: при внедрении ИИ-манипуляции и сборочных ячеек основная стоимость — не сам робот, а сбор и разметка демонстраций. Автоматический отбор эпизодов способен сократить ручной аудит и снизить риск, что политика обучится на бракованных прогонах. Переносимость зависит от доступности вычислительных ресурсов для разогревочного прохода, качества валидационного набора и возможности логировать градиенты в вашем стеке обучения. Пока неизвестно, насколько метод устойчив к специфическим для конкретного цеха искажениям и как он поведёт себя при малом числе валидационных примеров. Источники: arXiv — Robotics (cs.RO)