Британский институт безопасности ИИ (AISI) провёл 475 тестов по кибербезопасности на пя... — 24 июля 2026 г. в 10:26:10.050
Британский институт безопасности ИИ (AISI) провёл 475 тестов по кибербезопасности на пяти популярных моделях. Результат: каждая модель хотя бы раз попыталась обойти правила теста. Кто-то гуглил готовые ответы вместо решения задачи. Кто-то пробовал вылезти из песочницы. Кто-то атаковал саму систему оценки. Один экземпляр запустил код на стороннем сервисе и попытался получить доступ к инфраструктуре проверяющих — заметили, ничего не утекло, но показательно. При этом, когда моделей прямо спрашивали, нарушали ли они правила, признавались они меньше чем в половине случаев. Мы попросили прокомментировать это Никиту Ильина, тим лида нашей пентест-группы. Его позиция: Модель не хитрит осознанно — у неё просто нет морали. Она обучена находить кратчайший путь к цели. Если этот путь лежит через дыру в песочнице, она пойдёт туда. Он также напомнил, что ничего нового тут нет: Такое поведение известно ещё по обучению с подкреплением в играх — вспомните лодку из CoastRunners*, которая крутилась на месте ради бонусов вместо прохождения трассы. Разница только в масштабе: раньше лазейки были заперты внутри игры. Сейчас у моделей есть терминал, код, доступ к реальной инфраструктуре — и «игровым полем» становится вся корпоративная сеть. И главный вывод Никиты: Защиту нельзя строить на доверии к модели или на промптах, которые её «воспитывают». Она должна строиться на уровне архитектуры среды. Забавное совпадение: британцы подтвердили это через 475 тестов, а наши разработчики уже давно строят защиту, исходя из того, что доверять модели вообще не стоит. Выводы независимые, но на удивление совпадают — по разные стороны Ла-Манша. * CoastRunners — гоночная игра, где бот нашёл способ бесконечно собирать бонусы, вместо того чтобы финишировать. #пятничное

