ИИ-модели оказались зумерами — 12 мая 2026 г. в 12:41:00.177
ИИ-модели оказались зумерами Ведь они тоже быстро теряют интерес и начинают сыпать ошибками. На задачах из 20 взаимодействий даже топовые Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4 теряют в среднем 25% от содержания делегируемых им документов, говорит новый бенчмарк от Microsoft. DELEGATE-52 предлагает LLM решить задачи по 52 направлениям: от написания кода до кристаллографии и работы с белковыми структурами. Тест проверяет, может ли модель выполнить длинную цепочку реалистичных правок над документом или набором файлов — разбить, пересобрать, конвертировать, — а затем вернуть всё обратно без потери смысла, структуры и мелких деталей. Результат оказался удручающим. Самая эффективная модель, Google Gemini 3.1 Pro, готова к работе с 98% точности только в 11 из 52 доменов. В 20 направлениях она исказила итоговый результат на 20% или больше. 11 успешных направлений — это код на Python, правила для поиска malware, описания электронных схем, звёздные каталоги, данные о спутниковых орбитах, структуре белков, библиотечные каталоги, журналы радиолюбительской связи, лингвистическая разметка предложений, электронный документооборот (EDIFACT) и шахматные партии. Даже бухгалтерия, которую легко представить как «табличную» и формализованную задачу, у Gemini не вошла в зону готовности: модель сохранила лишь 80-90% содержания. Там, где становилось больше естественного языка, редкой предметной логики и длинных неповторяющихся сущностей, LLM быстро терялась — не помогали и агентские возможности. При этом бенчмарк не упирался в гигантские окна контекста: в основном эксперименте модели давали документы на 2-5 тыс. токенов и ещё 8-12 тыс. токенов отвлекающих, но тематически близких файлов. Интересным оказалось и проявление ошибок. В более слабых моделях контент удалялся целиком, в более мощных — искажался. Ну и сами ошибки не накапливались во время теста, а происходили единоразово — так модель теряла от 10 до 30 баллов за одно взаимодействие. Как бороться с неискусственным СДВГ? Исследователи предлагают учить и тестировать модели именно на длинных цепочках правок, где результат проверяется через обратимость, и уменьшать количество контекстного шума. Иначе автономного ассистента из всяких Cowork в реальности так и не выйдет. @anti_agi

