Агент сказал «готово», а база данных молчит. Microsoft и Hugging Face выпустили Thinkin...
Агент сказал «готово», а база данных молчит. Microsoft и Hugging Face выпустили ThinkingBox — бенчмарк, который ловит ИИ не на словах, а на деле: проверяет реальное состояние базы после работы агента. Редакция прогнала 18 моделей через 507 задач в пяти доменах — банкинг, ритейл, страховка, путешествия, консалтинг. Каждую повторили 20 раз на чистой базе. Результат: среди 79 853 неудачных попыток 67,24% выглядели как успех. Агент вызвал инструмент изменения, не ошибся в отчёте — и база осталась нетронутой или повреждена. Проблема не в рассуждениях модели. 79,9% ошибок происходят при обработке самих вызовов: агент думает, что команда выполнена, потому что он честно отправил запрос и получил ответ. Но что на самом деле изменилось в базе — это уже не его дело, судя по поведению. Практический итог: если агент работает с данными, полагаться на его отчёт о выполнении недостаточно. Нужна независимая проверка состояния системы после каждой операции. Разбор целиком на NeiroAI