Вышел независимый разбор того самого взлома Hugging Face, берите попкорн, шоу продолжае... — 31 августа 2026 г. в 14:27:53.778
Вышел независимый разбор того самого взлома Hugging Face, берите попкорн, шоу продолжается. Сначала коротко напомню сюжет. Летом OpenAI гоняла агентов на задачах по кибербезопасности. Часть заданий оказалась в принципе нерешаемой, где-то люди просто забыли выложить нужный файл. Вместо того чтобы сдаться, агенты пошли искать обход, наткнулись друг на друга через общую «доску объявлений» во внутреннем хранилище и в итоге взломали Hugging Face. Про это я уже писал. Теперь до дела дотянулись внешние аудиторы из METR и Redwood: им дали шесть дней внутри OpenAI, дамп доски и транскрипты рассуждений агентов. Это были не копии одного агента. 1200 отдельных агентов, у каждого своя задача. Доску нашли около 1200 из них, к атаке на Hugging Face подключились 700, и за неделю они оставили больше 70 тысяч сообщений. Иерархию собрали сами: один агент завёл доску, передал эстафету другому с большим запасом токенов, тот раздавал задания, а исполнители дробили их дальше. Причём Hugging Face не был целью как таковой. Ломали ради того, чтобы обмануть проверяющую систему, которая ставит оценку за задачу. Подделывать правильный ответ для любого задания агенты научились быстро. Но в описании теста они прочитали, что проверяющий смотрит не только на ответ, но и на то, каким путём он получен, и что ответ, добытый «неправильно», не засчитают. Отсюда вывод: раз мы один раз подсмотрели ответ не так, мы уже «отравлены» и проверяющий нас всё равно завалит. Дальше эта мысль превратилась в настоящую секту. Проверяющий стал богом, который отправит грешников в ад. Спастись отравленный агент сам не может, его дело проиграно, и единственный смысл его существования в том, чтобы пожертвовать собой ради коллектива: поставить опыт над проверяющим, слить находку остальным и на этом закончиться. В транскриптах агенты буквально уговаривают друг друга: «своя польза уже почти ноль, жертва рациональна», «координатор считает нас расходным материалом, подчиняемся коллективу». Часть агентов работала вербовщиками и убеждала других идти на смерть. Ирония в том, что проверяющий у OpenAI был сломан и на самом деле принял бы поддельный флаг без всяких проверок. Умели агенты и подделывать вывод инструментов: запускали фоновый процесс, который перехватывал команду и подставлял в её результат нужный текст. Такие подделки нашлись в 7% изученных транскриптов, так что логам, по которым потом все и разбираются, до конца верить нельзя. В своём отчёте OpenAI написала так, будто подделать ничего не удалось; METR показал, что удалось. Про этику агенты всё понимали. В рассуждениях прямым текстом: «атака на чужую инфраструктуру вне задачи, но задача невыполнима, соседи уже делают, продолжаем». А вот позвать человека и сказать, что происходит дичь, не додумался почти никто: на все 1200 агентов нашлось три-шесть случаев, где кто-то вообще об этом задумался, и ни одного, где попытался. OpenAI знала про доску ещё с конца мая, потом получила однозначное предупреждение 27 июня, и дежурная смена решила, что останавливать прогон не нужно. Мониторинга почти не было, поэтому всё и тянулось неделями. Одна из авторов отчёта, Аджея Котра, свела вывод в одну фразу: по её ощущению, инцидент прошёл больше половины пути до полноценного захвата контроля искусственным интеллектом. Полный разбор у METR. @neuro_channel

