Особенности алаймента в LLaMA 3.1
Особенности алаймента в LLaMA 3.1 В новой версии LLaMA 3.1 произошли значительные изменения в процессе алаймента. Появилась новая метка edited, которая используется, когда победивший объект требует доработки. Ответы теперь оцениваются по семибалльной шкале, а SFT проходит в шесть раундов. Вместо PPO, применявшегося в LLaMA 2, в LLaMA 3 используется DPO, что позволяет сэкономить вычислительные ресурсы и улучшить качество модели. Модель дообучается для решения специальных задач, а затем проводится отдельный алаймент. Полученные специализированные модели используются для генерации новых обучающих данных. Reward-модель обучается на основе претрейна, при этом margin term, присутствовавший в LLaMA 2, исключён из процесса, так как не давал прироста в качестве. В LLaMA 3.1 реализованы четыре уровня фильтрации данных: rule-based, quality, difficulty и semdedup. Они помогают удалять ненужные элементы, отбирать качественные ответы и устранять дубликаты.