☝🏻Claude Opus 4.8 впервые сдвинул с мёртвой точки самый сложный ИИ-бенчмарк ARC-AGI-3 🧠 — 2 июня 2026 г. в 13:28:31.543
☝🏻Claude Opus 4.8 впервые сдвинул с мёртвой точки самый сложный ИИ-бенчмарк ARC-AGI-3 🧠 Версия модели в режиме High заняла первое место в интерактивном тесте на общий интеллект, набрав 1,4% на закрытом наборе (1,5% на публичном лидерборде) при стоимости одного прогона около 10 тысяч долларов. Для сравнения: месяцем ранее Opus 4.7 набирала здесь лишь 0,18%, а GPT-5.5 — 0,43%, тогда как люди решают эти задачи на 100%. 🔻ARC-AGI-3 — состоит из 135 интерактивных сред — по сути мини-игр (видео выше☝🏻), вручную собранных командой геймдизайнеров. Модель не получает ни инструкций, ни правил, ни описания цели: она должна сама исследовать каждую среду, сама понять, как та устроена, сама выяснить, что считается победой, и сама перенести это понимание на следующие, всё более сложные уровни. ☝🏻☝🏻Но главное — не сама цифра, а то, как именно играет Opus 4.8. Модель впервые начала читать среду на уровень абстракции выше предшественницы — как объекты и системы, а не как набор картинок. На одной из игр она вывела правило зеркального отражения. Opus 4.7 на том же уровне потратил 136 действий грубым перебором и так и не сформулировал правило. ☝🏻☝🏻☝🏻То, о чем я говорил в прошлом видео Opus 4.7 нахватало абстракции. Новый рекорд получился показательным в двух смыслах. 🔻С одной стороны, это первый заметный качественный сдвиг на бенчмарке, который у всех держался у нуля: модель стала строить осмысленную картину мира, а не тыкаться вслепую. С другой — разрыв с человеком всё ещё почти на два порядка, а вместе с новыми способностями появились и новые способы уверенно ошибаться.

