Исследователи представили первый комплексный бенчмарк для оценки предобученных vision-l...
Исследователи представили первый комплексный бенчмарк для оценки предобученных vision-language моделей (VLM) в задаче zero-shot планирования мультироботного сбора фруктов. Тесты п… Результат двойственный. Передовые VLM действительно выдают рабочие планы для нескольких манипуляторов без дообучения на целевой среде — это снижает потребность в сборе данных под каждый новый сад. Но практическое развёртывание ограничивают две вещи: точность генерации 3D-путевых точек и координация рук с учётом столкновений в общем рабочем пространстве. Авторы прямо называют эти ограничения ключевыми для реального внедрения. Для российского производства это означает следующее. Подход переносим туда, где уже есть манипуляторы и камеры, а номенклатура меняется сезонно: садоводство, тепличные комплексы, сортировка и упаковка плодоовощной продукции. Архитектурно ценно разделение ролей — VLM отвечает за верхнеуровневый план, а отдельный дешёвый верификатор страхует коллизии. Такой контур можно пробовать на отечественных интеграциях, не дожидаясь «идеальной» модели. Ограничения тоже честные. Zero-shot-план не отменяет калибровки, точной 3D-локализации и защитных зон; качество зависит от доступности камер, вычислителя под инференс VLM и стабильности освещения. Пока неизвестно, как метод поведёт себя на реальном оборудовании и на российской номенклатуре — это следующий шаг проверки, а не готовое решение. Источники: arXiv — Robotics (cs.RO)