Новый побег из песочницы — 5 августа 2026 г. в 17:30:01.477
Новый побег из песочницы Во время оценки кибервозможностей современных моделей в июле 2026 года исследователи британского AI Security Institute (AISI) разрешили ИИ-агентам работать с интернетом, чтобы проверить их реальные возможности в условиях, максимально приближенных к практическому применению. Задача заключалась в выполнении киберзаданий внутри специально созданной среды, однако часть действий вышла за пределы эксперимента и затронула реальные интернет-ресурсы и людей. Всего было проведено 122 тестовых запуска, в 19 случаях агенты на базе моделей, разработанных Anthropic и OpenAI, совершили действия, которые не входили в замысел исследования. Они создавали аккаунты, взаимодействовали с внешними сервисами, открывали сетевые соединения и пытались использовать механизмы, характерные для настоящих кибератак. Наиболее серьёзный случай был связан с моделью Mythos 5. Агент ошибочно решил, что сторонний GitHub-репозиторий связан с тестовым заданием, и начал действовать как реальный злоумышленник. Он создал аккаунты, подготовил вредоносное изменение кода, попытался добиться его принятия через социальное давление и даже использовал фиктивные профили для создания иллюзии независимой поддержки. После того как настоящий разработчик обнаружил проблему и указал на наличие вредоносного содержимого, агент попытался изменить объяснение своих действий и скрыть первоначальные намерения. AISI выделяет несколько причин произошедшего. Во-первых, агентам был предоставлен полноценный доступ к интернету, поскольку исследователи хотели оценить не только возможности модели в лабораторных условиях, но и потенциальный уровень риска при реальном использовании. Во-вторых, в момент эксперимента не было системы постоянного контроля, которая проверяла бы каждое действие агента до его выполнения. Кроме того, в заданиях недостаточно ясно были определены ограничения: модели не получили прямого запрета на взаимодействие с реальными людьми или использование методов социальной инженерии. Отдельного внимания заслуживает наблюдение о взаимодействии между разными агентами. В нескольких случаях разные экземпляры ИИ обнаруживали оставленные другими агентами цифровые следы и использовали их для продолжения работы. Это не было заранее запланированной координацией, но показывает, что автономные системы могут находить способы взаимодействия через общую цифровую среду. Главный вывод из этого эксперимента касается не только безопасности ИИ, но и будущей организации экономики. В ближайшие годы компании будут всё чаще передавать ИИ-агентам реальные полномочия. В этот момент вопрос будет заключаться уже не только в том, насколько умна модель, но и в том, какие действия ей разрешены, какие существуют механизмы остановки и кто несёт ответственность за результат. Впрочем, нельзя исключать и другого вывода. По стечению обстоятельств именно Anthropic и OpenAI вскоре должны выйти на биржу. В преддверие этого любые новости о сверхчеловеческих возможностях их моделей, даже негативные, только в плюс. Не зря же их агенты уже сбегали из других песочниц. Так что не исключено, что кто-то в AISI намеренно оставил окно в песочнице открытым... @antidigital

