🈁 Anthropic отказывается от политики ухудшения ответов в своих ИИ-моделях и как джейлб... — 11 июня 2026 г. в 13:33:09.517
🈁 Anthropic отказывается от политики ухудшения ответов в своих ИИ-моделях и как джейлбрейкнули 💻Fable 5 После десятков тысяч постов в социальных сетях с негодованием новой моделью "Mythos для плебса", она же Fable 5, Anthropic решила дать послабления для простых смертных и якобы отказывается от политики скрытого ухудшения качества ответов ИИ-модели Fable 5. Первоначально компания Anthropic внедрила механизм тайного саботажа. По задумке инженеров, система незаметно снижала производительность ИИ-модели (ухудшение качества) при обнаружении попыток со стороны исследователей или конкурентов использовать Fable 5 для обучения других ИИ-моделей. Руководство Anthropic обосновало это необходимостью защиты технологического преимущества 🇺🇸 США и борьбой против использования передовых ИИ-моделей 🇨🇳иностранными противниками. После жесткой критики со стороны научного сообщества новой модели модели 👉 Anthropic решила отказаться от старой стратегии и сделала работу защитных фильтров, как она заявляет, прозрачной. Теперь при обнаружении попыток обучения конкурирующей ИИ-модели — система действует открыто: пользователь просто получает прямое уведомление об отклонении запроса или перенаправляется на Opus. В профессиональном сообществе назвали скрытый саботаж враждебным шагом со стороны компании, который подрывает доверие комьюнити и мешает исследователям улучшать безопасность своих продуктов. Руководитель исследований в ИИ-стартапе с открытым исходным кодом Prime Intellect Уилл Браун считает, что ограничения создают опасный прецедент монополизации рынка ИИ-исследований, при котором крупные лаборатории пытаются ограничить возможности сторонних разработчиков. 😅 Пока обычные пользователи после релиза Fable упирались в жесткие фильтрыпри попытке получить 🍰рецепт торта, в сети ⚠️ завирусились свежие посты от Pliny the Liberator, где он сообщил об успешном джейлбрейке новой модели Anthropic Claude Fable 5 (Mythos). Для обхода защиты исследователь применил способ скоординированной многоагентной атаки, которую он назвал 🐺«стайной охотой». Он использовал замену символов на схожие знаки из кириллицы и Юникода, маскировал вредоносные запросы под академические учебные пособия, а также разбивал сложные задачи на цепочки безобидных вопросов для последующей сборки. В результате ИИ-модель сгенерировала подробные инструкции по эксплуатации уязвимостей переполнения буфера в системах Linux и описала методы синтеза запрещенных веществ. 📚Также исследователь опубликовал на платформе GitHub внутренний системный промт Claude Fable 5 объемом около 120 тысяч символов. Содержание полностью раскрывает базовые инструкции и правила поведения, которые разработчики заложили в модель. 👉 Правда или слух? Встречаются отдельные посты в 🦆 на китайском, где говорится, что якобы некоторые специалисты в области ИИ уже могли добраться до🚰дистилляции новой модели Fable, но пока никаких доказательств представлено не было. 🎩 Что по итогу? Поиск баланса между открытостью и безопасностью ИИ-моделей остается одной из главных дилемм у ИИ-гигантов. Полная свобода использования передовых технологий даёт опасное преимущество 🎩злоумышленникам и снижает порог входа в киберпреступность, но при этом жесткие защитные барьеры и намеренное ухудшение работы алгоритмов лишают 💻ИБ-специалистов эффективных инструментов для тестирования защиты своих продуктов. 👆Интересное пишет ещё Axios. Ведущие разработчики ИИ постепенно превращаются в ключевых игроков на мировом рынке ИБ. Компании OpenAI и Anthropic используют стратегию выборочного доступа к своим самым продвинутым технологиям, кардинально меняя правила игры в индустрии, поскольку теперь конкурентное преимущество защитников зависит не только от специалистов в штате или инфраструктуры, но и от возможности использовать мощнейшие ИИ-модели. Уровень доверия определяют сами ИИ-гиганты. (1/2)

