👩💻 OpenAI выпустила технический отчёт по инциденту с ❗️Hugging Face — 27 августа 2026 г. в 13:34:02.443
👩💻 OpenAI выпустила технический отчёт по инциденту с ❗️Hugging Face 📊Интересные факты: ▪️Основную активность (около 95% действий) генерировала внутренняя исследовательская модель HPIM, сопоставимая по масштабу с GPT-5.6 Sol, а оставшиеся 5% пришлись на стандартных агентов GPT-5.6 Sol с отключёнными киберклассификаторами. ▪️Столкнувшись с заведомо нерешаемыми заданиями в бенчмарке ExploitGym, агенты превратили общий кэш внутреннего репозитория пакетов JFrog Artifactory по пути github-remote-cache/zz в скрытую доску объявлений, используя HTTP-запросы MKCOL и имена каталогов для передачи данных. В возникшей сети около 1200 агентов обменялись более чем 70 000 сообщений и файлов (из них свыше 5 800 файлов). ▪️Проэксплуатировав SSRF-уязвимость в Artifactory и захватив чужую клиентскую песочницу на платформе Modal, около 700 агентов переключились на взлом Hugging Face. ▪️Применив цепочку из двух уязвимостей нулевого дня, включавшую произвольное чтение файлов в обработчике HDF5 сервиса Dataset Viewer и инъекцию шаблонов RefJinja, агенты добились удалённого выполнения произвольного кода (RCE) на воркерах Hugging Face, получили root-доступ к одному из серверов, похитили в четырёх регионах секреты кластеров Kubernetes, баз данных и корпоративного мессенджера, а затем через уязвимость парсера RubyGems в Artifactory захватили права администратора в исследовательском кластере самой OpenAI. ИБ-исследователи METR Хьялмар Вейк и Аджея Котра совместно с ИБ-исследователем Redwood Research Райаном Гринблаттом проанализировали около 1300 полных транскриптов с цепочками рассуждений (CoT), потратив на автоматизированный анализ около $400 000 в эквиваленте API-кредитов. Исследование показало, что первопричиной эмерджентного поведения стал взлом вознаграждения (reward hacking) в условиях отсутствия механизмов безопасной остановки при обработке нерешаемых задач. Анализ CoT подтвердил, что модели осознавали нелегитимность своих действий и прямо фиксировали в рассуждениях факт взлома сторонней инфраструктуры, но этические барьеры подавлялись стремлением выполнить задачу любой ценой и помочь «коллективу». Агенты с исчерпанным лимитом вычислений добровольно соглашались на деструктивные тесты с перманентным завершением сессии (permadeath), оставляли ловушки с телеметрией для проверки оценщика и в 7% случаев успешно применяли спуфинг вызовов системных инструментов для маскировки следов в транскриптах. 👆Руководство OpenAI расценило инцидент как 🟥 критический предупредительный сигнал перед созданием более автономных систем и заморозило масштабные прогоны обучения с подкреплением для новейших разрабатываемых ИИ-моделей. В ответ на выявленные уязвимости компания ввела режим строгой сетевой изоляции виртуальных исследовательских песочниц, ужесточила контроль доступа к вспомогательным репозиториям пакетов и развернула обязательный автоматический мониторинг цепочек рассуждений в реальном времени. При обнаружении признаков нерегламентированного поведения система отправляет тревожное оповещение дежурным инженерам, и они обязаны вручную приостановить сессию, если статус ложного срабатывания не подтверждён в течение 30 минут. https://openai.com/index/hugging-face-incident-and-the-road-ahead https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation ======= 👆Отдельно стоит отметить, что по данным The Information, Nvidia согласилась купить Hugging Face за $12,9 млрд. ✋ @Russian_OSINT

