Кто круче управляет компанией — ИИ или скрипт на 200 строк? — 21 июля 2026 г. в 12:49:04.531
Кто круче управляет компанией — ИИ или скрипт на 200 строк? Мы всё спорим, какая модель умнее: кто лучше пишет код, кто быстрее считает, у кого длиннее контекст. Но управление компанией — это не одна задача. Это тысяча связанных решений на длинной дистанции, где последствия приходят с задержкой, а данные вокруг далеко не всегда точны. И вот с этим у ИИ всё сложно. Наткнулся на свежий бенчмарк CEO-Bench, который проверяет способность моделей вести компанию к цели. Авторы из Princeton University называют это steering intelligence. Условия: агент управляет SaaS-стартапом 500 дней через программный интерфейс — 34 инструмента, база из 19 таблиц, живой рынок. На старте $1 млн и ноль клиентов. Метрика одна — сколько денег на счёте в конце. Актуальный результат (лидерборд обновляется, я смотрю на сегодняшний): Rule-Based Baseline — $15,76 млн Claude Fable 5 — $12,63 млн GPT-5.6 Sol — $11,31 млн Claude Opus 4.8 — $2,40 млн Выше стартового миллиона удержались только три модели. Но самое интересное — их обошёл baseline. Простой алгоритм, который фиксирует цены и тарифы, концентрирует привлечение на узкой группе клиентов и подстраивает мощности под реальное потребление. Никакого интеллекта в цикле принятия решений. По разбору авторов, успех коррелирует с тремя вещами: умением вычитывать скрытую структуру из данных, просчитывать последствия и подстраиваться под давление конкурентов. А сыпется большинство моделей на другом. Они не могут удержать вместе рост, качество и денежный поток на длинной дистанции. Дисциплинированная стратегия в жёстких рамках обыгрывает свободную импровизацию умной модели. А я как раз недавно писал пост о harness engineering. Сильная модель без внешнего контура (правил, границ, критериев решения) на коротком горизонте выглядит блестяще, а на дистанции в 500 дней проигрывает скрипту. 👉 Вывод для тех, кто уже сажает ИИ на управленческие задачи: вкладываться стоит не в модель поумнее, а в контур вокруг неё. Правила, память, сверка с данными, понятные критерии выбора. Для калибровки: теоретический потолок в этой симуляции авторы оценивают в $2,2 млрд. То есть лучший результат — меньше процента от возможного. Бенчмарк далёк от насыщения, и это, пожалуй, главная новость: управлять вдолгую пока из моделей не умеет почти никто. Кому интересно, репозиторий CEO-Bench и статья.

