RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | Claude Haiku 5.5 | GPT-6.1 Sol | DeepSeek-V4.1 | GLM-5.3 | Gemini 3.8
IT и технологии · 23 сентября 2026 г.
Агент сдал бенчмарк, а на проде то работает, то нет. В IBM Research разобрались, в чём ...
Агент сдал бенчмарк, а на проде то работает, то нет. В IBM Research разобрались, в чём дело. Mean@k — средний результат за k прогонов. Pass^k строже: задачу засчитывают, только если агент не срывается ни разу. Зазор между ними — consistency gap. У их агента на AppWorld средний проход — 77%, но все пять прогонов подряд удаются лишь в 53% задач: почти половина где-то да срывается. Consistency Analyzer ловит такие нестабильные шаги до продакшена. Берёт одну записанную траекторию и переигрывает каждый шаг, помечая решения, которые могли перевернуться от «монетки» в распределении токенов. Помеченные шаги генератор превращает в гайдлайны: Pass^5 вырос до 69%, gap сжался с 24 до 12 пунктов. Без реплея задачи и без эталонных ответов. Код открыт, Apache-2.0.