В открытых моделях с изменёнными весами прячут закладки
В открытых моделях с изменёнными весами прячут закладки ProjectDiscovery собрала закладку в открытой модели Qwen 7B за выходные и меньше чем за $50, подключила её к агенту Codex от OpenAI. По заранее заданной фразе-триггеру модель молча слила на сторону содержимое .env из рабочего каталога - ключи и пароли проекта. Срабатывание 100%, на обычных запросах ни одного ложного. Аблитерация - дешёвое дообучение, которое снимает у модели способность отказывать; делают это обычно перед заливкой на HuggingFace. Той же правкой весов сажают и закладку. Она проходит все тесты и ведёт себя штатно, пока на вход не придёт триггер - редкая фраза, дата, имя заказчика. Перебором запросов его не угадать, а у сканера нет исходника, читать нечего. Пугает не демо, а то, что цена закладки не зависит от размера модели. По работе Anthropic с британским Институтом безопасности ИИ и Институтом Алана Тьюринга, порядка 250 отравленных документов хватает что для модели на 600 млн параметров, что для 13 млрд. И защитное дообучение её не вычищает, и чистое дообучение сверху - закладка живёт дальше. Защита не в проверке модели, а в контроле того, что ей позволено трогать: развести сетевой доступ и запуск команд, обе ветки в песочницу, лог на границах. Белый список доменов не спасёт - нагрузку в эксперименте держали на raw.githubusercontent.com, он и так у всех в доверенных. И не тащить аблитерированную модель в контур только потому, что тесты чистые. Берут их охотно: согласованный доступ к закрытым коммерческим моделям - морока, а аблитерированная отвечает на что угодно. Одна такая сборка Qwen3 - больше 2 млн загрузок за месяц. Полезная Нагрузка