⚙️ #Технологии #Автономность — 30 сентября 2026 г. в 04:47:56.674
⚙️ #Технологии #Автономность Стартап Гарварда и MIT? Нет, это свежая работа Стэнфорда и Калтеха. Команды The Movement Lab и Калифорнийского технологического соединили GPT Astra с человекоподобным роботом Unitree G1. И получилось не просто «болтающий» андроид — G1 самостоятельно обследует незнакомую кухню, запоминает расположение предметов, а затем по голосовой команде находит и приносит таблетки, открывает ящики, выбрасывает мусор. 👀 Главный инженерный ход — не end‑to‑end VLA (когда нейросеть напрямую генерит движения), а чёткое разделение уровней. GPT Astra отвечает за понимание задачи, выбор навыка и переключение между ними. А вся низкоуровневая механика — навигация, планирование траекторий, визуальное сервоуправление, коллизионный контроль — остаётся на борту G1. Между ними — стандартизированный интерфейс-API, через который VLM вызывает конкретный навык с нужными параметрами (например, Pick получает точку на изображении + указание руки). 🚀 Ключевое новшество — пространственная память. Перед выполнением миссии робот сам исследует среду, собирая SLAM-геометрию, стереоданные и семантику. Затем Real2Sim строит цифровую копию помещения в Isaac Sim. Это позволяет VLM оперировать не картинками, а координатами: «аптечка была на столе слева от холодильника» превращается в метрическую цель для навигации. Для захвата Astra даёт лишь 2D‑точку (0–1000) — локальный модуль сам сегментирует объект, восстанавливает глубину через Fast‑FoundationStereo, генерирует хват аналитически, планирует движение с проверкой коллизий по всей траектории (swept volume), а визуальный сервоцикл на 250 Гц корректирует ошибки. Если хват не удался — модуль пробует другой вариант, и только когда локальные попытки исчерпаны, возвращает ошибку VLM для перепланирования. В итоге получается архитектура, где VLM (секундный такт), навыки (50 Гц) и управление руками/телом (250 Гц) работают на своих временных масштабах, не мешая друг другу. Это не просто демка, а явный аргумент в пользу «гибридного» подхода вместо тотального end‑to‑end. Лимиты есть: навыковый набор фиксирован (нет «вытереть стол» простым запросом), Real2Sim требует подготовки, а Astra даёт задержки на стыках навыков. Но сама постановка вопроса — как спроектировать интерфейс между «мозгом» и «телом» — уже задаёт вектор на годы вперёд. #УчиДрон