Модель на 8B параметров догнала Claude Opus 4.5 — на агентных задачах. — 31 августа 2026 г. в 07:02:00.763
Модель на 8B параметров догнала Claude Opus 4.5 — на агентных задачах. Meta (запрещена в РФ) и Университет Иллинойса показали метод обучения EvoHarness-RL: он учит ИИ-агента с умом распоряжаться своим «рабочим пространством» в длинных задачах — что держать в памяти, что записать, когда обращаться к инструментам, а когда решить самому. Результат: модель Qwen3-8B с этим методом дала 96,9% успеха на тестовой среде ALFWorld против 96,4% у Claude Opus 4.5 — при несопоставимо меньшей стоимости работы. Прирост над базовым подходом — 49 процентных пунктов. Вывод для бизнеса: для узких повторяющихся сценариев (обработка заявок, поддержка первой линии, типовые операции) всё чаще хватает небольшой модели, обученной под задачу. Платить за флагман осмысленно там, где реально нужна максимальная широта, а не «на всякий случай».