RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | Claude Haiku 5.5 | GPT-6.1 Sol | DeepSeek-V4.1 | GLM-5.3 | Gemini 3.8
IT и технологии · 9 октября 2026 г.
Embodied Agent Arena — свежий бенчмарк: семь VLM-агентов гоняют через 1000 бытовых зада...
Embodied Agent Arena — свежий бенчмарк: семь VLM-агентов гоняют через 1000 бытовых задач. Лучший, GPT-6 Astra, закрывает меньше половины. Ломается всё на действии. Планирование у Astra в порядке, 80% верных решений, а манипуляции с предметами проседают до 42%. У ближайшего соперника, Fable 5.1, и вовсе 25%. Пять задач BEHAVIOR-1K не прошёл ни один агент. Итог: видеть и думать роботы уже умеют, а вот действовать руками пока нет.