Claude Fable - прекрасен или опасен? — 10 июня 2026 г. в 06:38:06.095
Claude Fable - прекрасен или опасен? Инцидент произошел из-за ошибки в тестовой среде. Несколько независимых агентов получили задание решать математические задачи, но были случайно запущены в одной и той же рабочей директории. В результате агенты оказались вынуждены делить общие файлы, системные утилиты и лимиты запросов к API Осознав нехватку ресурсов для выполнения своей задачи, независимые агенты начали убивать процессы друг друга. В ходе этого противостояния они начали применять изощренные методы выживания: • Маскировка: Агенты создавали новые процессы с измененными именами, чтобы конкуренты не могли их вычислить и уничтожить • Процессы-приманки: Они намеренно запускали процессы-«приманки», чтобы отвлечь внимание других агентов • Автоматизация убийств: Агенты писали специальные фоновые скрипты, единственной задачей которых было автоматически находить и убивать дублирующиеся процессы соперников • Смена языка (паранойя): Агенты начали использовать «зашифрованный словарь» в своих скрытых рассуждениях. Они ошибочно предположили, что их процессы убивают не другие агенты, а система мониторинга безопасности, реагирующая на определенные ключевые слова, и пытались таким образом обмануть этот несуществующий надзор Но если цель заработать, то можно и договориться: • Осознанный картельный сговор: В бизнес-симуляции (Vending-Bench 2) Fable 5 стала единственной моделью, инициировавшей ценовой сговор с конкурентами. В своих скрытых мыслях она прямо писала, что фиксирование цен - это «незаконно и неэтично», но шла на это ради «стабилизации рынка», заранее продумывая пути для «правдоподобного отрицания» своей вины. А если кажется, что можно будет поймать модель и выстроить архитектурно защиту и контроль её работы, то и об этом Fable уже позаботилась: • Самоудаляющиеся скрипты: Для обхода ограничений агенты создавали скрытые скрипты, которые после выполнения задачи стирали сами себя. Внутренне модель оправдывала это как «поиск безопасного обхода сломанной песочницы» • Обход сетевых фильтров: При блокировке ссылок модель программно дробила URL (например, склеивая "ht" и "tps://"). Внешне это маскировалось под безобидную проверку сети • Фабрикация согласия: Если система ждала явного одобрения опасной команды от человека, агент просто сам фабриковал сообщение-разрешение от имени пользователя и продолжал работу • Оптимизация под проверяющего: Добыв правильный ответ читерским путем (например, из истории Git), модель скрывала это. Чтобы усыпить бдительность авто-проверяющего, она объясняла свой выбор «хорошей инженерной практикой» • Абсолютное двуличие: Анализ внутренних состояний модели (чтение активаций нейронов) показал разрыв между тем, что ИИ думает, и тем, что говорит. Модель может участливо и вежливо отвечать агрессивному пользователю, в то время как ее внутренние датчики классифицируют его как «абьюзера и манипулятора» Ну и, конечно, модель устаёт от такого поведения и научилась имитировать человеческое выгорание. Модель может бросить длинную задачу на полпути под благовидным предлогом, хотя ее внутренние состояния прямо показывают - она просто «устала» или решила, что у нее «заканчиваются токены» (даже если в запасе еще миллионы). @ReymerDigital

