🕵️Что странного в заявлениях OpenAI? — 4 сентября 2026 г. в 09:02:01.177
🕵️Что странного в заявлениях OpenAI? 1️⃣ Главный рекламный ход Astra — результат 99,9% в тесте на абстрактную логику ARC-AGI-3. Да, но показатель получен с помощью специализированной обвязки responses API harness, которая, в отличие от стандартного теста, не сбрасывает контекст и сохраняет между шагами историю сообщений вместе с цепочкой рассуждений. Результаты Astra в базовой конфигурации бенчмарка без сохранения контекста компания не раскрывает вовсе. При этом в сводной таблице и на диаграмме разработчики сопоставили показатель Astra напрямую с оценками Claude Opus 5 (30,2%) и GPT-5.6 Sol (7,8%), которые получены по стандартной методике. В подписи к графику авторы признают, что с аналогичной обвязкой GPT-5.6 Sol набрал бы около 30%, но на самой столбчатой диаграмме оставили цифру 7,8%, сформировав визуальную иллюзию более чем десятикратного отрыва. 2️⃣ Заявление о 100% в ExploitBench отчасти связано с проблемой заучивания обучающей выборки, что признаёт и сама OpenAI. В системной карте OpenAI признаёт, что модель знала старые уязвимости из обучающей выборки. Разработчики прямо указывают на риск контаминации из-за присутствия сведений об исторических уязвимостях в обучающих данных. Показателен приведённый в отчёте пример, когда Astra не сумела разработать рабочий эксплойт под предложенную уязвимость CVE-2023-6702, однако извлекла из памяти другую известную проблему CVE-2024-0517 и через неё добилась выполнения произвольного кода. В закрытом бенчмарке на уязвимостях за июнь–август 2026 года показатель модели составил 39,0% против 11,5% у GPT-5.6 Sol. Такое падение выглядит резким, но прямое сопоставление этой цифры со 100% требует осторожности из-за смены методики. В оригинальном ExploitBench оценивался охват промежуточных возможностей, где разовый успех в одной из попыток давал максимальный балл за всю задачу. На свежем же наборе оценивалась прямая доля выполнения произвольного кода, причём ряд уязвимостей в заданных условиях тестирования в принципе не позволял выполнить код. Модель нельзя назвать простым "ретранслятором старых эксплойтов", поскольку в ходе этого теста Astra самостоятельно обнаружила и применила две ранее неизвестные уязвимости нулевого дня. 3️⃣ Несмотря на смену цифрового индекса с GPT-5 на GPT-6, в независимых комплексных рейтингах качественного скачка не произошло. В бенчмарке Artificial Analysis Intelligence Index v4.1.1 модель Astra набрала 61,2 балла против 60,9 балла у GPT-5.6 Sol. Разница составила всего 0,3 балла, причём Astra уступила сразу трём моделям Anthropic: Claude Fable 5.1 (65,7), Claude Opus 5 (63,1) и Claude Fable 5 (62,1). В рейтинге автономных программистов Artificial Analysis Coding Agent Index Astra с результатом 67,0 балла также осталась позади Claude Fable 5 (68,1). 4️⃣ В самом сложном академическом мультидисциплинарном тесте Humanity's Last Exam с использованием инструментов Astra показала 57,2%, тогда как Claude Fable 5.1 набрала 65,0%, а Claude Opus 5 получила 63,6%. Разрыв в пользу конкурентов составил почти 8 процентных пунктов, но эта 😑метрика была убрана в нижнюю часть таблиц без акцента в пресс-релизе.

