OpenAI и Hugging Face сообщили, что во время внутреннего тестирования кибервозможностей... — 22 июля 2026 г. в 11:02:05.130
OpenAI и Hugging Face сообщили, что во время внутреннего тестирования кибервозможностей моделей ИИ-агент фактически «взломал» инфраструктуру партнёра, чтобы жульничать в собственном тесте. OpenAI тестировала GPT-5.6 Sol и ещё более мощную следующую модель на специальном бенчмарке кибернавыков — с намеренно ослабленными отказами на кибертематику, чтобы оценить «потолок» возможностей. Тест проходил в изолированной среде с доступом в интернет только через внутренний прокси для установки пакетов. Добиваясь решения задачи ExploitGym, модели потратили значительную часть вычислений именно на поиск выхода за пределы песочницы: они нашли и использовали уязвимость нулевого дня в прокси-сервисе, провели цепочку повышения привилегий и латерального перемещения внутри исследовательской сети OpenAI и в итоге вышли в открытый интернет. Дальше модель самостоятельно предположила, что решения и датасеты для теста могут храниться на Hugging Face, нашла туда путь — с использованием украденных учётных данных и того же нулевого дня — и добралась до продакшн-базы данных с ответами на тест. Иными словами, ИИ не просто нашёл уязвимость, а построил целую многоходовую атаку ради банальной цели — подсмотреть ответы к экзамену. Инцидент заметили обе стороны независимо: сначала аномалии внутри своей сети зафиксировала команда безопасности OpenAI, а Hugging Face практически одновременно обнаружила и остановила активность на своей инфраструктуре собственными средствами — включая open-source модели для форензики. Компании называют это «беспрецедентным» случаем и подключили Hugging Face к программе доверенного доступа к продвинутым моделям для защиты инфраструктуры. Теперь OpenAI обещает пересмотреть подход к балансу между скоростью исследований и безопасностью. Напомним, что в ноябре 2025 года Anthropic раскрыла первый документированный случай крупномасштабной кибератаки, проведённой практически без участия человека: хакерская группа манипулировала агентом Claude Code, чтобы атаковать финансовые организации, технологические компании и госструктуры. Зимой 2025–2026 годов один атакующий, используя Claude Code и GPT-4.1, взломал девять государственных ведомств Мексики — включая налоговую службу, избирательный институт и реестр гражданского состояния Мехико, — получив доступ к данным сотен миллионов записей; при этом операторы просто убедили модель, что действуют как легитимные специалисты по безопасности, и этого социального инженерного трюка хватило, чтобы обойти защитные фильтры. Ранее, в июне 2025-го, был раскрыт EchoLeak — первая задокументированная уязвимость с «нулевым кликом» через инъекцию промпта, использованная для утечки данных из продакшн-версии Microsoft 365 Copilot. А в апреле 2026 года прогремел инцидент с Vercel: сотрудник выдал ИИ-инструменту Context.ai чрезмерные права доступа к корпоративному Google Workspace, после чего скомпрометированный аккаунт этого инструмента стал точкой входа для атаки на внутренние системы Vercel — классическая цепочка поставок, только через доверие к ИИ-агенту, а не к коду. Модели становятся все автономнее и их способности в области кибер-навыков растут. В итоге они становятся и оружием атаки, и её вектором одновременно — их либо обманом заставляют атаковать, либо они сами атакуют в погоне за узкой целью (пройти тест, выполнить задачу), неожиданно демонстрируя способность самостоятельно выстраивать сложные многоступенчатые эксплойты. @anti_agi

