RAG | Нейросети | ИИ | AI | Агенты | GPT-6 Sol | Claude Opus 5.5 | Mistral Large 4 | Gemini 4 Argon | Grok 4.7 | DeepSeek V4
IT и технологии · 13 августа 2026 г.
Evo-Bench — первый бенчмарк, где модель сама пишет себе агентскую обвязку: промпты, код...
Evo-Bench — первый бенчмарк, где модель сама пишет себе агентскую обвязку: промпты, код, инструменты. GPT-5.6 Sol выжала +16.6 очка, Claude Opus 4.8 — +16.1. Почти догнали эталон 47.5. На общих задачах автоподгонка бьёт ручную настройку. Офис почти не двигается. Модели часто сдаются раньше времени, зато обвязку переносят на другие модели.