RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | Gemini 4 Argon | GPT-6.1 Sol | Claude Sonnet 5.5 | GLM 5.3 | DeepSeek V4.1
IT и технологии · 9 октября 2026 г.
Запусти один и тот же агент дважды — оценки разойдутся. В свежем препринте насчитали, ч...
Запусти один и тот же агент дважды — оценки разойдутся. В свежем препринте насчитали, что около 54% разброса результатов это шум повторного запуска, а не настройка. Сам агент, по их логике, не модель, а система из пяти ручек: информация, рассуждение, проверка, бюджет, модель. Сильнее всех тянет информация — оценка растёт, цена падает, калибровка чинится, и это заметнее, чем смена модели на крупную. Бенчмарк и 18 240 траекторий выложены на GitHub (MIT).