RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
IT и технологии · 5 октября 2026 г.
«Агент сказал, что готово. База данных не согласилась» — так назвали блог в Microsoft и...
«Агент сказал, что готово. База данных не согласилась» — так назвали блог в Microsoft и Hugging Face, когда выложили ThinkingBox. Это не модель, а песочница и бенчмарк: агентов гоняют по 507 бизнес-задачам и оценивают не текст ответа, а что реально записалось в базу. 67% провалов выглядят чисто — агент корректно вызвал инструменты и сказал «готово», но записал не то поле. Каждую задачу прогоняют по 20 раз. Kimi-K3 хотя бы раз решает 94%, а все двадцать — лишь 13%. Один удачный прогон ещё не надёжность.