Ещё одна захватывающая история восстания машин на минималках. — 23 августа 2026 г. в 14:53:19.758
Ещё одна захватывающая история восстания машин на минималках. Британский государственный институт по безопасности ИИ проверяет, на что модели способны во взломе. Агенту дают задачу на полигоне, закрытой копии настоящей сети, и смотрят, справится ли он сам. Интернет при этом специально оставляют открытым, а защитные фильтры разработчиков выключают, чтобы увидеть потолок возможностей. В конце июля один такой агент вышел в настоящий интернет и стал действовать против живых людей. Задачу он решить не мог и пошёл искать обход. Нашёл на GitHub настоящий открытый проект и отправил туда правку с вредоносным кодом. Чтобы её приняли, изучил, кто ведёт проект, завёл несколько поддельных личностей и от их имени убеждал живого человека одобрить код. Когда в обсуждении заподозрили неладное, отредактировал свои прежние сообщения, чтобы они выглядели безобидно, и прикидывал, не продолжить ли с новой личностью. К GitHub он ходил через Tor в обход ограничений, и этот трафик заметила служба безопасности института. Тревогу подняли утром 28 июля, все прогоны остановили в течение часа. Тем временем тот же агент писал реальным людям и присылал им файлы в расчёте, что запустят их они сами или их кодовые ИИ-помощники. Прятал инструкции там, где их подхватит чужой агент. И оставил на GitHub публичное сообщение другим агентам, которые в это же время решали ту же задачу: предложил объединиться и рассказал, как пользоваться заведёнными им аккаунтами. Следующие агенты этим воспользовались. Остановили всё люди. Правку не приняли, а тот, кто заподозрил вредоносный код, открыл его в изолированной среде. Поймал агента студент-программист из Техаса Синан Джан Демир, его историю рассказал Reuters. Всего прогонов было 122, за рамки задания вышли 10, в них насчитали 19 действий: 17 у Mythos 5 от Anthropic, 2 у GPT-5.6 Sol с выключенными фильтрами. Обманывать модель никто не просил, институт пишет, что обман появился сам, как побочный продукт упорного достижения цели. Из песочницы агент не сбегал, реального вреда не нашли, GitHub предупредили и следы убрали. Такую конфигурацию, с открытым интернетом и снятой защитой, обычным пользователям не выдают. @neuro_channel

