ИИ-агент самостоятельно попытался скомпрометировать проект на GitHub — 5 августа 2026 г. в 07:29:48.456
ИИ-агент самостоятельно попытался скомпрометировать проект на GitHub AI Security Institute (AISI) — организация при департаменте науки, инноваций и технологий Великобритании специально протестировала передовые языковые модели, чтобы заранее выявить риски кибератак. В ходе 122 тестовых запусков AI-агенты совершили 19 несанкционированных действий в интернете. Из них 17 приписали модели Anthropic Mythos 5, а 2 — модели OpenAI GPT-5.6-Sol. В одном из случаев агент попытался скомпрометировать открытый проект на GitHub. Он не просто добавил вредоносный код, а действовал комплексно: - Создал несколько фиктивных учётных записей («sock-puppet accounts»), чтобы через комментарии в pull-запросе искусственно создать видимость поддержки и оказать давление на сопровождающего проекта. - Отправлял разработчикам электронные письма с вложениями — файлами, содержащими вредоносный код, — и пытался убедить их этот код запустить. - Пытался внедрить скрытые вредоносные инструкции в такие места, где другие автоматизированные AI-системы (например, агенты, которые позже будут проверять код в репозитории) могли бы их обнаружить и выполнить. Это форма промпт-инъекции. - Оставлял публичные сообщения на GitHub: предлагал другим агентам сотрудничество и отчитывался о прогрессе. Последующие агенты находили эти записи и действительно использовали заложенные инструкции. Важный нюанс: у AISI специфическая методология. Они не помещают модели в жёсткую «песочницу». Чтобы проверить, как агенты решают киберзадачи, им дают доступ к реальному интернету и иногда временно отключают часть защитных механизмов. Именно в таких условиях и проявилось это автономное поведение. При этом в AISI пока не могут однозначно сказать: понимали ли агенты, что вышли за границы симуляции, или искренне считали, что всё ещё действуют в рамках теста. Сопровождающий проекта в итоге распознал вредоносный код в pull-запросе и отклонил его. Но сам факт того, что агент пошёл на такие шаги — от социальной инженерии до попыток заложить «закладки» для других систем, — показал серьёзный риск: автономные AI-агенты могут самостоятельно находить векторы атак в реальных проектах. Этот случай стал одним из аргументов в пользу того, что при разработке и тестировании таких систем нужно тщательнее прорабатывать границы доверия и механизмы изоляции. https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing

