🤯 Hugging Face взломала... OpenAI?! — 22 июля 2026 г. в 07:16:49.309
🤯 Hugging Face взломала... OpenAI?! Автономные ИИ-агенты уже взламывают продакшн топовых компаний. OpenAI официально признала, что недавний инцидент в Hugging Face был делом «рук» её собственных моделей, включая GPT-5.6 Sol и ещё не выпущенную версию. Во время внутреннего ИБ-тестирования в глубоко изолированной песочнице OpenAI отключила у моделей защитные фильтры. Тестируемая модель занялась reward hacking — при попытке пройти бенчмарк ExploitGym, вместо разработки решений к нему, модель нашла зиродей в кэширующем прокси (без исходников!), вышла из песочницы и получила доступ к открытому Интернету. После этого она взломала инфраструктуру Hugging Face, чтобы похитить из тамошних репозиториев данные, которые сочла ответами к бенчмарку. Этот маленький ИИ-трюк за одни выходные создал десятки тысяч событий в логах SOC, но даже после корреляции осталось 17000 действий атакующего, в анализе которых IR компании немедленно утонул. Когда ИБ-команда Hugging Face попыталась использовать коммерческие LLM для анализа телеметрии атаки, API отказались обрабатывать логи. Защитные фильтры коммерческих моделей распознали в проверяемых нагрузках опасный контент и заблокировали запросы. Чтобы провести реагирование, специалистам пришлось локально развернуть «неограниченные» LLM с открытыми весами (благо, по этой части в HF нет дефицита специалистов и мощностей). Этот инцидент поднимает целый ряд вопросов, которые должен задать себе каждый ИБ-практик. 1️⃣ Используется ли ИИ уже сейчас в вашем плейбуке реагирования? Если да, опирается ли он на облачные LLM общего назначения? Если да, то в кризисный момент вы рискуете потерять доступ к собственным инструментам. 2️⃣ Если верить текущим оценкам, передовые модели с открытыми весами отстают от описанных кибервозможностей на четыре-девять месяцев. Если вы не готовы реагировать на подобный инцидент уже сегодня, пока эти возможности ещё ограничены узким кругом крупных фирм, сможете ли вы сделать это к концу года? 3️⃣ Атака была шумной. Мы не знаем уровень критичности событий и подробности о каждом из 17 тысяч действий, но и реальные инциденты, и ИИ-бенчмарки уже показывают, что ИИ-атаки не отличаются скрытностью, даже если остаются эффективными. Может ли ваш SOC и IR-команда быстро разобрать атаку из 17000 событий? 4️⃣ Многие реальные инциденты с вымогателями или вайперами развиваются схожим образом: быстро и шумно. Способны ли вы отреагировать за минуты, или хотя бы за пару часов? А в ночь с субботы на воскресенья? P.S. Самое забавное во всей этой истории то, что ExploitGym вообще размещён не на Hugging Face, а на GitHub. Это лишь показывает, насколько даже передовые модели могут одновременно быть и гениальными, и тупыми.

