Методы стабилизации PPO: отказ от Value-функции
Методы стабилизации PPO: отказ от Value-функции Рассмотрим два метода стабилизации PPO, которые позволяют отказаться от использования Value-функции. В традиционном PPO для вычисления advantage из суммарной награды префикса и ответа вычитается средняя награда (V), которую модель получила бы, стартовав с этого префикса. Однако обучение отдельной модели для прогнозирования V имеет ряд недостатков: она требует значительных вычислительных ресурсов и часто показывает не очень хорошие результаты. Авторы статьи DeepSeekMath предлагают метод Group Relative Policy Optimization (GRPO). Он включает две ключевые модификации: вместо обучения V-модели использовать метод Монте-Карло для оценки средней награды (генерировать несколько ответов и использовать среднюю награду за них как V) и добавлять KL-штраф за отклонение от SFT-модели прямо к лоссу, а не вычитать его из награды. Авторы VinePPO развивают идеи GRPO в контексте математических задач. Они предлагают разбивать ответ на смысловые блоки (по переносам строки, точкам или запятым вне формул) и оценивать V-функцию для каждого блока так же, как в GRPO — генерировать несколько продолжений из частично готового ответа. Хотя этот метод требует больше генераций во время обучения и работает медленнее обычного PPO, он показывает неплохие результаты.