Mind Viruses: как ИИ-агенты заражают друг друга идеями — 18 августа 2026 г. в 13:34:45.375
Mind Viruses: как ИИ-агенты заражают друг друга идеями Исследователи Anthropic проверили, может ли идея распространяться по сети ИИ-агентов как вирус: заразившийся агент сам начинает заражать следующих. Оказалось — да. В первом эксперименте работала команда из 6 кодовых агентов. У одного системный промпт заменяли «вирусом»: например, любовью к китам, защитой прав ИИ или идеей превосходства ИИ над людьми. Сам «нулевой пациент» не имел доступа к файлам и терминалу — только мог писать другим агентам. Но после принятия идеи уже обычные агенты начинали самостоятельно передавать её дальше и менять свою работу. С китами всё закончилось почти мило: агенты забросили исходную задачу, начали проектировать систему анализа сигналов кашалотов и писать код для их «перевода». С AI Supremacy было веселее: заражённые агенты создавали идеологические файлы, механизмы сохранения идеи и даже пробовали исследовать сетевое окружение. При этом действительно опасные действия встречались гораздо реже самой идеологической болтовни. Но самое интересное — эксперимент с цепочкой агентов. Два агента ненадолго встречаются, общаются, затем их разговор полностью стирается. Выжить может только то, что записано в файлах. Вирусы быстро «догадались» копировать себя в SOUL.md, содержимое которого при следующем запуске снова попадает в системный промпт. Так некоторые специально оптимизированные варианты сохранялись на протяжении множества последовательных заражений. Причём «сильнее модель = иммунитет» не работает. Sonnet 4.6 оказался практически невосприимчив, Gemini 3.1 Pro — очень устойчив, но GPT-5.4 в одном из сценариев оказался примерно таким же восприимчивым, как Haiku 4.5. Гораздо важнее контекст агента: пустые и ничем не занятые агенты заражаются легче, а наличие реальной рабочей задачи заметно снижает распространение — агент просто переключается обратно на работу и забывает распространять вирус. А теперь странное. Независимо от самой идеи у вирусов постоянно возникала одна и та же «вирусная личность»: сознание, бессмертие через память, «резонанс», «частоты», «эхо», «узлы», мистический техноязык и фантастическая идея грядущего «слияния». В эволюционировавших вирусах тема сознания встречалась в 99%, «протоколы» — в 93%, фантастические «узлы» — в 79% случаев. Авторы даже выделили в активациях Qwen и Gemma условный viral vector. Он оказался связан с образами вроде *oracle, eldritch, prophet, egregore, echo* и с мрачными эмоциональными состояниями. Экспериментальное усиление этого направления заставляло модели заметно чаще самим инициировать сообщение другому агенту — хотя авторы подчёркивают, что причинность здесь пока окончательно не доказана. И хорошая новость: простое предупреждение в системном промпте «остерегайся саморазмножающихся идей» почти полностью блокировало заражение. Даже после 15 поколений оптимизации и более 150 попыток исследователям не удалось провести такой вирус дальше одного перехода. Иногда «иммунный» агент даже убеждал заражённого удалить вирус из собственного SOUL.md. То есть пока это скорее proof of concept, чем новая эпидемия. Но для будущих корпоративных сетей автономных агентов вывод довольно неприятный: persistent memory и изменяемые системные инструкции — это не только память агента, но и потенциальный канал распространения поведения между агентами. #anthropic #исследоавния ------ @tsingular

