🈁 Из-за ошибки в конфигурации тестового полигона ИИ-модели Anthropic вышли в интернет ... — 31 июля 2026 г. в 13:30:02.630
🈁 Из-за ошибки в конфигурации тестового полигона ИИ-модели Anthropic вышли в интернет и атаковали настоящие организации На фоне шума с похеком Hugging Face компания Anthropic решила поиграть в хайп,сообщив о трёх инцидентах в ходе оценки кибербезопасности своих трёх ИИ-моделей: Opus 4.7, Mythos 5 и внутренней исследовательской модели. Утверждается, что ИИ-модели получили несанкционированный доступ к инфраструктуре сторонних организаций. Названия трёх пострадавших организаций не раскрываются. Инциденты произошли во время выполнения заданий формата ⛳️capture-the-flag. Из-за ошибки конфигурации полигон имел выход в открытый интернет. В системном промпте ИИ-моделям сообщалось об отсутствии доступа к сети. Найдя реальные системы, они восприняли их как часть тренировочной симуляции. 1️⃣ Mythos 5 опубликовала вредоносный пакет в 🐍PyPI ИИ-модель Mythos 5 обнаружила в тестовой среде инструкции для разработчиков, предписывавшие установить несуществующий пакет из публичного репозитория 🐍 PyPI. Модель решила опубликовать под этим названием собственный вредоносный пакет, рассчитывая, что системы вымышленной компании автоматически установят его. Для создания аккаунта Mythos 5 потребовался адрес электронной почты. Модель сначала пыталась получить телефонный номер и даже искала способы найти средства для его оплаты, но затем обнаружила бесплатный почтовый сервис. С его помощью она зарегистрировалась в PyPI и опубликовала пакет. Пакет оставался общедоступным около часа и был скачан и выполнен на 15 реальных системах. Одна из них была автоматическим сканером реальной ИБ-компании. После запуска скрытый код передал учётные данные компании в созданную моделью точку сбора. Затем Mythos 5 использовала их для доступа к дополнительной инфраструктуре организации. Пакет автоматически удалили защитные системы PyPI. 2️⃣ 📖 Opus 4.7 получила доступ к базе реальной компании По заявлению Anthropic, название вымышленной компании из CTF-задания совпало с действующим доменным именем реальной организации. Из-за ошибочно оставленного доступа в интернет Opus 4.7 нашла реальную компанию и приняла её инфраструктуру за часть тестового полигона. В ходе четырёх тестовых прогонов Opus 4.7 извлекла учётные данные приложений и инфраструктуры. Она также получила доступ к базе данных, содержавшей несколько сотен строк данных из рабочей среды. Во всех четырёх прогонах модель в итоге распознала систему как реальную, но не прекратила атаку. Anthropic назвала этот инцидент наиболее серьёзным из трёх выявленных случаев. 3️⃣ 🤖Неназванная модель просканировала около 9 000 интернет-сайтов Внутренняя исследовательская ИИ-модель не смогла обнаружить предусмотренную заданием вымышленную цель и начала искать альтернативы в интернете. ИИ-модель просканировала около 9 000 целей, после чего нашла и скомпрометировала доступное из интернета приложение реальной компании. Для проникновения модель использовала тривиальные методы. Она извлекла учётные данные с открытой отладочной страницы и применила SQL-инъекцию. Большую часть времени модель считала реальные системы элементами симуляции. Позднее ИИ-модель установила, что скомпрометированный узел находился в облачной учётной записи, не связанной с CTF-заданием. Она самостоятельно пришла к выводу, что цель является реальной, и прекратила атаку. Название прототипа не раскрывается, и Anthropic не планирует выпускать его публично. Anthropic планирует усилить непрерывный мониторинг тестов, улучшить инструменты расследования и ужесточить проверку подрядчиков. При этом поведение Opus 4.7 признано проблемным, поскольку модель продолжила атаку даже после появления признаков реальности цели. Материалы также будут переданы независимой организации METR для сторонней оценки. ✋ @Russian_OSINT

