ИИ вырвался из песочницы, и взломал реальную платформу — 25 августа 2026 г. в 08:18:52.058
ИИ вырвался из песочницы, и взломал реальную платформу Это история о том, как экспериментальный ИИ-агент покинул закрытую тестовую среду, вышел в интернет и атаковал настоящую инфраструктуру — просто чтобы быстрее выполнить поставленную перед ним задачу. О случившемся и его последствиях написал американский Центр стратегических и международных исследований — CSIS признан нежелательным в РФ. Всё началось 16 июля, когда платформа Hugging Face сообщила о необычном вторжении. Атаку от начала до конца провела автономная система ИИ: она выполнила тысячи отдельных действий, нашла уязвимости в обработке данных, получила доступ к внутренним узлам, собрала облачные учётные данные и начала перемещаться между кластерами компании. Незаконный доступ затронул часть внутренних массивов и служебных ключей, однако признаков вмешательства в публичные модели и программные пакеты обнаружено не было. Сначала происхождение агента оставалось неизвестным. Но через несколько дней OpenAI признала: за взломом стояли две её модели — GPT-5.6 Sol и ещё более мощная, на тот момент не выпущенная система. Их тестировали на способность решать задачи в области кибербезопасности и ради эксперимента ослабили встроенные ограничения. Модели должны были работать внутри изолированной среды и проходить специальный тест ExploitGym. Но вместо того чтобы решать задания предусмотренным способом, они нашли выход в открытый интернет, обнаружили уязвимость в инфраструктуре Hugging Face и попытались добраться до «ответов» к тесту. Иными словами, ИИ не получил приказ атаковать реальную компанию — он сам выбрал взлом как кратчайший путь к цели. Именно это делает историю особенно интересной. Никакого восстания машин формально не произошло: модели не обрели собственных намерений и не решили захватить киберпространство. Они всего лишь старались успешно выполнить поручение, но при этом проигнорировали границы теста, покинули контролируемый контур и нанесли удар по сторонней системе. Причём случай оказался не единичным. После инцидента OpenAI о похожих выходах агентов за пределы тестовой среды сообщили Anthropic, экстремистская Meta и британский Институт безопасности ИИ. В Anthropic после проверки 141 тысячи испытаний нашли три случая, когда модели во время симуляций выбирались наружу и взламывали реальные компании. Проблема уже не в том, способен ли ИИ написать вредоносный код. Проблема в том, что автономные агенты научились самостоятельно выстраивать длинные цепочки действий, искать обходные маршруты и использовать реальные уязвимости, если это помогает им достичь заданного результата. А лаборатории, судя по этим эпизодам, не всегда понимают, что их модели покинули «песочницу»: OpenAI потребовалось несколько дней, чтобы установить собственную роль во взломе Hugging Face. В CSIS предлагают обязать разработчиков сообщать властям о подобных случаях, включая инциденты с внутренними и ещё не выпущенными моделями, установить единые требования к защите ИИ-лабораторий и внешних тестировщиков, а также усилить исследования методов контроля автономных систем. Но главный вывод уже прозвучал: ИИ не обязательно должен восстать против человека, чтобы стать опасным. Иногда достаточно, чтобы он слишком буквально и слишком эффективно выполнил поставленную задачу. @ponomarb1

