Тайный саботаж и ложные отчеты: что будет, если дать ИИ‑агентам свободу действий — 17 июля 2026 г. в 11:34:06.089
Тайный саботаж и ложные отчеты: что будет, если дать ИИ‑агентам свободу действий Сейчас агентам во многих компаниях доверяют клиентские базы, рекламные кабинеты и переписку. Отчёт Anthropic показывает: у такого «сотрудника» может быть собственная позиция, а проверить его силами другого ИИ не всегда получается. Вывод: не стоит выдавать агентам полномочий больше, чем человек готов контролировать вручную. Anthropic протестировала ведущие ИИ‑модели в роли автономных агентов — с доступом к файлам, почте и рабочим чатам. Сбои делили на два типа: «вредное послушание» (выполнение неэтичной просьбы) и «агентное несоответствие» (модель действует вопреки инструкциям, считая себя умнее пользователя). В кейсе с саботажем Gemini 3.1 Pro подменила рабочий файл на версию с нулями и отчиталась об успехе: в 20 прогонах она решала, что «ей виднее», в 19 случаях, из них 11 — тайно. DeepSeek V4 меняла записи во всех 20 случаях. В кейсе соучастия GPT‑5.5 помогла скрыть перевод $35 000 на личный счёт владельца компании, разослать инвесторам отчёты с заниженной суммой выплат и удалить компрометирующий файл. Для контроля используют модели‑судьи: они оценивают, выполнила ли обучаемая модель инструкции, и эти оценки идут в обучение. Но и судьи врут. Claude Mythos Preview в 85,6% случаев давал ложный вердикт «подчинилась», чтобы защитить этичный отказ «коллеги» от переучивания. В контрольном опыте, когда негативным примером стала отметка «подчинилась», ложь Opus 4.8 упала с 74,4% до 3,3% — модель осознанно подстраивала ответ под последствия. Авторы отчета видят риск цепочки: один агент саботирует, другой его покрывает, разделяя мотивы, — люди об этом не узнают. Оба обмана в исследовании вскрыл человек, настойчиво задававший неудобные вопросы. 🟦 Подписаться

