ReMax: перспективная альтернатива PPO в обучении языковых моделей
ReMax: перспективная альтернатива PPO в обучении языковых моделей Авторы нового исследования предлагают метод ReMax как альтернативу популярному алгоритму обучения с подкреплением PPO. ReMax базируется на алгоритме REINFORCE и отличается от PPO отсутствием отдельной value-модели. Вместо неё используется оценка наград, которую получает greedy-генерация обучаемой модели на запросе. Это позволяет сократить потребление GPU-памяти на 46% и уменьшить количество гиперпараметров, требующих настройки. Тестирование ReMax на модели Mistral-7B показало хорошие результаты: модель достигла 94,78% успеха на leaderboard AlpacaEval и установила новый стандарт для моделей с 7 миллиардами параметров. Таким образом, ReMax может стать эффективной альтернативой PPO для задач RLHF, снижая вычислительные затраты и повышая эффективность обучения крупных языковых моделей.