Самообучающиеся языковые модели: новый подход к оценке качества ответов
Самообучающиеся языковые модели: новый подход к оценке качества ответов Учёные предложили концепцию самообучающихся языковых моделей (Self-Rewarding Language Models), которые не только генерируют ответы, но и самостоятельно оценивают их качество. Это позволяет преодолеть ограничения традиционных методов обучения, зависящих от объёма и качества человеческих данных. Обучение модели проходит в несколько этапов: сначала она генерирует ответы на основе имеющегося датасета, затем оценивает их по критериям релевантности, полезности, чёткости и уровня экспертизы, после чего создаёт новые инструкции для следующего этапа обучения. В экспериментах использовалась модель Llama 2-70B, обученная на датасете Open Assistant. После трёх итераций обучения модель продемонстрировала значительные улучшения: в тестах AlpacaEval 2.0 она превзошла такие модели, как Claude 2, Gemini Pro и GPT-4 0613.