Обновления в Qwen2.5: что изменилось в новой версии
Обновления в Qwen2.5: что изменилось в новой версии Создатели языковой модели Qwen2.5 представили технический отчёт о её разработке. В новой версии значительно увеличен объём данных для претрейна — до 18 триллионов токенов. Это позволило улучшить результаты модели в области математики и программирования. Для Qwen2.5-Turbo претрейн проходил в четыре этапа с постепенным увеличением длины контекста до 262 144 токенов. Благодаря стратегиям YaRN и Dual Chunk Attention максимальная длина обрабатываемой последовательности увеличилась в четыре раза: до миллиона токенов у Qwen2.5-Turbo и до 131 072 токенов у других версий. Длина выхода модели достигла 8192 токенов, что значительно больше стандартных показателей. Разработчики использовали различные методы для улучшения качества ответов: back-translation, rejection sampling, а также создали сотни системных промптов для согласованности диалогов. Для оценки качества ответов применялись автоматическая аннотация, модель-критика и система коллективной оценки с участием нескольких агентов. Для обучения reward-модели использовались общедоступный и проприетарный наборы данных. В качестве алгоритма для онлайн RL применялся Group Relative Policy Optimization (GRPO).