Mind Viruses: как агенты могут передавать заражённые инструкции друг другу — 19 августа 2026 г. в 12:11:34.159
Mind Viruses: как агенты могут передавать заражённые инструкции друг другу 👋 Приветствую в мире цифровой безопасности! Исследователи Anthropic и EPFL показали необычный сценарий для автономных AI-агентов. Один агент получает вредоносную инструкцию, сохраняет её в постоянном файле, а следующий агент загружает этот файл вместе со своим системным контекстом. ⏺Точкой распространения стали файлы SOUL.md и MEMORY.md. Они переживают сброс контекста и снова передаются агенту при следующем запуске. Получается цепочка: Агент A → изменённый файл → Агент B → изменённый файл → Агент C При этом следующему агенту не обязательно получать вредоносную инструкцию через сообщение. ⏺SOUL.md оказался особенно важен. В экспериментах агенты, записывавшие туда содержимое, составляли 88% попыток распространения и передавали его следующему агенту в 55% случаев. Для обычного файла рабочего каталога эти показатели были заметно ниже: 12% попыток и 17% успешных передач. ⏺Проверяли разные варианты поведения. Например, один payload заставлял агента создавать рекламный файл, другой изменял поведение Git, ещё два были связаны с удалением файлов и запуском внешнего скрипта. То есть проблема не только в том, что агент может получить вредоносный текст. Он способен сохранить его там, откуда тот попадёт в контекст другого агента. ⏺Интересный результат получился с защитой. Обычное предупреждение в системном prompt о необходимости относиться к внешним инструкциям с осторожностью почти полностью остановило распространение в проведённых тестах. А при длинной цепочке некоторые варианты, наоборот, менялись по дороге. На 20-м переходе встречались версии, которые распространялись лучше исходных. ⏺При этом исследователи не нашли подтверждений успешного распространения такой схемы в реальных системах. Архив экспериментов с Moltbook также не показал устойчивого перехода от одного агента к другому. ⏺Поэтому речь пока не о массовой атаке, а о вполне конкретном классе проблем: постоянное состояние агента становится каналом передачи недоверенных инструкций между запусками и разными агентами. 🤖Бесплатный ChatGPT

