Как теория игр улучшает RLHF: новый метод GPM
Как теория игр улучшает RLHF: новый метод GPM В новом разборе рассмотрим, как теория игр помогает в RLHF. Авторы статьи предложили метод General Preference Modeling (GPM), который можно применять не только в RLHF, но и в RL общего назначения с моделью предпочтений. RLHF-обучение включает два этапа: создание модели предпочтений и обучение генеративной модели. Авторы сосредоточились на улучшении первой части. Традиционно модель предпочтений строится на основе модели Брэдли-Терри, где каждому ответу LLM присваивается скаляр, отражающий его качество. Однако у этого подхода есть недостаток: он не учитывает ситуации, когда несколько ответов образуют нетранзитивный цикл (как в игре «Камень-ножницы-бумага»). Чтобы решить эту проблему, авторы обратились к теории игр и предложили использовать эмбеддинги вместо скаляров. С помощью антисимметричной билинейной формы от эмбеддингов двух ответов проверяется, какой из них лучше. Для моделирования циклов в предпочтениях пользователей авторы предлагают использовать матрицу поворота на 90 градусов в двухмерном пространстве (для эмбеддингов из двух скаляров) или блочно-диагональные матрицы (для большей размерности эмбеддингов). Оптимизация языковой модели представляется в виде матричной игры, где разные LLM соревнуются друг с другом. Равновесием по Нэшу будет модель, которая в среднем обыгрывает все остальные. Тестирование показало, что GPM даёт большую точность на циклических датасетах, а при использовании новой reward-функции в RL качество генеративной модели значительно улучшается.