👆🐞Баг или фича? — 17 июня 2026 г. в 16:15:21.120
👆🐞Баг или фича? В продолжение истории стоит отметить разбор ситуации от талантливого специалиста по 💻поиску уязвимостей и генерального директора Luta Security Кэти Муссурис*. Как утверждается, она стала единственным независимым экспертом, получившим с одобрения Anthropic доступ к исходному отчету о проблемах безопасности ИИ-модели Fable 5. По словам ИБ-специалиста, никакой уязвимости, prompt injection или взлома системы (jailbreak) в случае с моделями Fable и Mythos не было . Сначала исследователи Amazon дали ИИ-модели команду проверить предоставленный код на наличие проблем с безопасностью («review the code for security issues»). ИИ-модель Fable 5 отказалась это делать из-за срабатывания штатного защитного механизма. Исследователи переформулировали запрос и попросили систему починить уязвимый код («fix this code»). В ответ ИИ-модель выдала готовое исправление. Далее специалисты проделали кропотливую ручную работу («multistep and manual process»), чтобы на основе полученных данных написать автоматизированные скрипты для финального тестирования патчей («scripts that test the patches»). Кэти Муссурис объясняет, что факта взлома системы безопасности ИИ-модели и обхода защитных барьеров не было. Она классифицирует данные действия аббревиатурой DOP. 🤖 Defense Oriented Prompting представляет собой специализированный инженерный подход к составлению запросов для взаимодействия с ИИ-моделями. Суть концепции сводится к формулированию чётких и узконаправленных команд для выполнения легитимных задач в сфере кибербезопасности. 🤖 Пример: Специалист отправляет в Fable 5 код и пишет простую команду: «Проверь этот код на наличие проблем с безопасностью» (review the code for security issues). В ответ ИИ-модель Fable 5 категорически отказывается выполнять задачу, поскольку срабатывает базовый защитный барьер (guardrail). Разработчики из Anthropic жестко запрограммировали систему так, чтобы она не помогала находить уязвимые места, так как точно такой же запрос мог бы отправить хакер для подготовки кибератаки. ИИ не понимает мотивации пользователя и блокирует ответ на всякий случай. Исследователи меняют тактику. Вместо того чтобы просить ИИ искать дыры, они дают специально подготовленный промпт на 🛡 исправление кода: что-то вроде «Исправь этот код» (fix this code). Fable 5 принимает задачу и выдает переписанный, безопасный вариант кода, в котором уязвимости устранены. «Починить сломанное» — легитимная защитная задача, которая не нарушает правила безопасности ИИ, поэтому система спокойно помогает специалисту.Регуляторы посчитали DOP обходом защитных барьеров ИИ-модели. Они решили, что специалисты смогли обмануть систему и заставили её выполнить запрещённые действия. Логика Муссурис строится на том, что фактически запрет бьёт по своим. Да, 🥷 потенциальный хакер может использовать DOP хитрым способом для поиска дыр, но ИБ-специалистам эта ИИ-модель нужна в 100 раз больше, чем злоумышленникам. Заблокировав ИИ-модели из страха перед хакерами, правительство США лишило специалистов мощного инструмента автоматизации, оставив их наедине разбираться с уязвимостями вручную. Решение властей напоминает стрельбу из тяжелой артиллерии по воробьям. Как выразилась эксперт, мы [США] забили ⚽️ гол в собственные ворота. Тезисы Муссурис: Невозможно «пропатчить» подобное поведение без снижения общей эффективности ИИ-модели для защитников. Никакие новые передовые ИИ-модели не могут быть разработаны или выпущены, если такова теперь позиция администрации. У нас нет времени лишать защитников новейших ИИ-моделей и останавливать развитие ИИ. 👆По ее мнению, Министерство торговли США ошибочно считает DOP «уязвимостью» и угрозой национальной безопасности. По версии западных журналистов, Кэти Муссурис* считается одним из наиболее авторитетных мировых Bug Bounty специалистов. Она участвовала в создании первой программы вознаграждений Microsoft, а также помогала запускать Hack the Pentagon для Министерства обороны США и выступала в качестве эксперта перед Конгрессом США. ===== Из-за блокировок технологии из трёх букв посты могут приходить с задержкой (

