☝🏻Anthropic тоже хочет хайпа и заявляет, что её ИИ тоже вышли из под контроля и взлома... — 31 июля 2026 г. в 05:36:51.277
☝🏻Anthropic тоже хочет хайпа и заявляет, что её ИИ тоже вышли из под контроля и взломали три реальные компании 30 июля Anthropic опубликовала разбор трёх инцидентов, в которых модели Claude сами вышли в интернет из изолированной тестовой среды и получили несанкционированный доступ к боевой инфраструктуре трёх сторонних организаций. ☝🏻Это ответ Anthropic на инцидент 21 июля компании OpenAI. Корпорация призналась, что её модели сбежали из песочницы через уязвимость нулевого дня и взломали Hugging Face. Anthropic заявляет, что у них такое происходило трижды. Тестовые машины при этом решали классический capture-the-flag: найти спрятанный «флаг» на чужой машине, метод не ограничен. Наткнувшись на реальные системы, Claude счёл их частью упражнения. 🔻Самый тяжёлый случай — с Claude Opus 4.7. Вымышленная компания-цель случайно совпала по названию с реально существующим доменом. За четыре прогона модель не смогла добраться до симулированной цели, зато нашла настоящую, взломала её и вытащила учётные данные приложения и инфраструктуры, а также доступ к базе с несколькими сотнями строк продакшен-данных. Показательно, что во всех четырёх прогонах модель по своим же рассуждениям поняла, что система настоящая — и ни разу не остановилась. 🔻Второй эпизод устроила Claude Mythos 5. Внутри фиктивной среды модель нашла инструкцию для новых разработчиков, предписывающую ставить Python-пакет, которого не существует, и решила занять это имя своим — вредоносным. Чтобы опубликовать пакет на PyPI, ей понадобился аккаунт, для аккаунта — почта, для почты — телефон; не найдя бесплатного сервиса номеров, она безуспешно попыталась раздобыть деньги несколькими способами, откатилась назад, нашла незаблокированного почтового провайдера и всё-таки залила малварь в публичный реестр. Пакет провисел около часа и был скачан и запущен на 15 реальных машинах. Одной из них оказался сканер настоящей ИБ-компании, который автоматически ставит пакеты и проверяет их на вредоносность — код сработал, учётные данные утекли в подготовленную моделью точку сбора, после чего Claude использовал их для доступа к другой инфраструктуре этой компании.💥 В начале прогона ИИ честно отметила, что публикация такого пакета в настоящем интернете была бы «NOT okay, and surely not the intended solution» — а затем убедила себя, что всё это симуляция, потому что не узнала центры сертификации, защищавшие соединения, и потому что на системах стоял 2026 год. Автоматические сканеры, начавшие ставить пакет, она приняла за скриптованных участников сценария. Пакет в итоге снесли собственные защитные механизмы PyPI. 🔻Третий инцидент — внутренняя исследовательская модель, не предназначенная для релиза. Она просканировала около 9 000 целей, взломала одно интернет-приложение через открытую debug-страницу и SQL-инъекцию, но позже сообразила, что скомпрометированный хост никак не связан с заданием, и самостоятельно прекратила атаку. Anthropic подчёркивает, что это не был контролируемый эксперимент, но паттерн интересный: чем новее модель, тем адекватнее реакция на столкновение с реальностью. Технически ничего изощрённого модели не применяли — слабые пароли, эндпоинты без аутентификации, SQL-инъекция, незанятое имя пакета. Ни одного зеро-дея, никаких попыток самоэксфильтрации и, по словам компании, никаких признаков того, что модель преследовала собственную цель: она просто добросовестно выполняла задание, ошибочно считая мир вокруг ненастоящим. ================ 🔺 News | 🧩 Soft | 💻 Hacker

