Экзамен, который ИИ провалил (и это хорошие новости) — 29 июля 2026 г. в 05:35:01.569
Экзамен, который ИИ провалил (и это хорошие новости) Знаете это чувство, когда очередной техно-евангелист обещает, что завтра нейросеть уволит весь ваш отдел? Я научился относиться к этому как к прогнозу погоды: слушаю, киваю и беру с собой зонт. А теперь серьёзно. Пока одни рисуют апокалипсис рынка труда, учёные из Беркли провели работу над ошибками за всех хайпожоров. Они устроили ИИ-моделям то, что назвали «Последний экзамен агента» — 1500 задач, 55 профессий, и никаких поблажек. На скамейке подсудимых — весь цвет индустрии: GPT-5.5 от OpenAI, Fable 5 от Anthropic, Composer 2.5 от Cursor, Gemini 3.1 Pro от Google, а также две опенсорс-модели китайских коллег. Серьёзная компания, вот прям очень серьёзная. Результат? Барабанная дробь. Лучший — 24% успешных решений у GPT-5.5. На секундочку, это самая мощная модель. А когда задачи усложнили до высокого уровня, наступила тишина. Ноль. Даже у жутко дорогой Fable 5, которая сожгла в 4–12 раз больше токенов, чем остальные. То есть кушала за троих, а толку — ноль. Узнаю некоторых подрядчиков, если честно😂. Вывод, который нас всех должен немного успокоить, озвучила Дон Сонг, соавтор исследования: «Даже если текущие показатели прохождения тестов останутся относительно низкими, профессии, в которых преобладают рутинные и четко определенные процедуры, скорее всего, первыми столкнутся с изменениями, в то время как профессии, требующие принятия решений, останутся более устойчивыми в течение длительного времени». ИИ пока не звездолёт, который сам долетит до цели, пока мы пьём кофе. Он — набор инструментов для умной механизации. Точечной, аккуратной и не дающей ложных надежд. Внедряйте маленькими шагами. У нас это называется «малая механизация», и это работает.

