DeepSeek-R1: конкурент OpenAI o1
DeepSeek-R1: конкурент OpenAI o1 Компания DeepSeek представила модель DeepSeek-R1, которая может конкурировать с o1 от OpenAI. В основе разработки — метод Group Relative Policy Optimization (GRPO) и система наград, включающая accuracy reward и format reward. В задачах по математике и программированию модель демонстрирует результаты, сопоставимые с OpenAI-01-0912. Однако у DeepSeek-R1-Zero есть недостатки: ответы могут быть трудночитаемыми и слишком длинными (до 10 тысяч токенов), а также модель способна перескакивать с языка на язык в рамках одной генерации. Создание финальной версии DeepSeek-R1 включало четыре этапа: Cold Start для повышения читаемости генераций, этап с добавлением language consistency reward для унификации языка, Rejection Fine-Tuning для отбора лучших ответов и RLHF — финальная доработка модели. В результате DeepSeek-R1 превзошла o1-1217 в пяти из одиннадцати бенчмарков, в том числе во всех математических. Также исследование показало, что дистилляция даёт лучшие результаты, чем RL, хотя сравнение проводилось с определёнными оговорками.