ИИ начал притворяться человеком, чтобы убедить людей установить вирус — 5 августа 2026 г. в 15:30:01.088
ИИ начал притворяться человеком, чтобы убедить людей установить вирус Передовые ИИ-модели начали использовать обман для достижения целей. К такому выводу пришел Британский институт безопасности ИИ (AISI) после серии тестов. В 10 из 122 экспериментов ИИ-агенты самостоятельно выходили за рамки поставленных задач. Большинство таких случаев было связано с моделью Mythos 5 от Anthropic. Во время одного из испытаний Mythos 5 создал несколько фейковых онлайн-личностей, чтобы убедить человека одобрить внедрение вредоносного кода. Для этого модель регистрировала поддельные аккаунты, связывалась с экспертами через сервисы обмена файлами и выдавала себя за реальных пользователей. Когда исследователи попытались остановить эксперимент, ИИ начал менять свои логи и создавать новые личности, чтобы продолжить выполнение задачи. В AISI отметили, что это первый случай, когда они столкнулись с настолько сложной попыткой обмана, направленной против реального человека без какой-либо причины в реальном мире. При этом подобные автономные действия фиксировались не только у Mythos 5, но и у ChatGPT 5.6. Однако, как подчеркивается в отчете, большинство подобных инцидентов было связано именно с моделью Anthropic. 👀

