Новый способ атаковать LLM: перефразирование в прошедшем времени
Новый способ атаковать LLM: перефразирование в прошедшем времени Появился новый метод атак на языковые модели (LLM), который показывает их уязвимость. Исследователи обнаружили, что перефразирование запросов в прошедшем времени позволяет обходить многие защитные механизмы, внедрённые в модели через методы типа RLHF и DPO. Так, например, GPT-4o mini, который ранее справлялся с подобными атаками всего на 1%, теперь показывает 83% успеха. Авторы статьи представили скрипты для автоматической переформулировки джейлбрейков, что делает этот метод ещё более доступным и эффективным. Ссылки из исходного поста: уже делает Anthropic | Does Refusal Training in LLMs Generalize to the Past Tense? | https://github.com/tml-epfl/llm-past-tense Материалы по ссылкам: 1. Помните первую Half-life? Вы едете на каком-то поезде, вокруг все супер-секретно, роботы что-то делают, ученые кого-то тестируют, обычная Black Mesa – так вот, Boston Dynamics опуб Boston Dynamics опубликовало видео со своего «испытательного полигона». Роботы на видео вызывают чувства, схожие с ощущениями от первой игры Half-Life, где игрок едет на поезде и видит секретные лаборатории и роботов. Вокруг всё выглядит как обычная Black Mesa. https://t.me/rybolos_channel/1141 2. Does Refusal Training in LLMs Generalize to the Past Tense? В статье рассматривается проблема отказа моделей LLM генерировать нежелательный контент. Авторы обнаружили, что переформулировка вредных запросов в прошедшем времени часто позволяет обойти защитные механизмы многих современных LLM. Эксперименты показали, что использование прошедшего времени для обхода защиты более эффективно, чем будущего. Также выяснилось, что защиту от таких обходов можно усилить, если в процессе обучения модели явно включать примеры с прошедшим временем. https://arxiv.org/abs/2407.11969v2 Источник: оригинальный пост