Архитектура Vision-Language-Action (VLA) моделей традиционно использует центральный LLM... — 2 августа 2026 г. в 16:05:34.849
Архитектура Vision-Language-Action (VLA) моделей традиционно использует центральный LLM для перевода визуальных данных в действия робота, что требует значительных вычислительных ресурсов. Исследователи представляют TurboVLA — новую парадигму, заменяющую цепочку V→L→A на прямое отображение V+L→A. Система независимо кодирует визуальные наблюдения и языковые инструкции, обмениваясь информацией напрямую, без использования крупной языковой модели как посредника. Согласно данным из arXiv, подход позволяет достигать частоты 32 Гц на видеокарте RTX 4090 при использовании менее 1 ГБ видеопамяти. Это снижает накладные расходы памяти и вычислений при каждом вызове политики управления. 🔹 Первый Нейронный