LoRA против недостатков Full Fine-tuning: как улучшить обучение моделей
LoRA против недостатков Full Fine-tuning: как улучшить обучение моделей Supervised Full Fine-tuning (SFT) — распространённый метод обучения моделей, но у него есть существенные недостатки. Например, модели могут плохо извлекать новые знания из SFT-датасетов и чаще генерировать неверные ответы (галлюцинации), особенно в областях, требующих глубокой экспертизы. Так, на вопрос об основных работах Эйнштейна после создания Общей теории относительности модель могла выдать ложную информацию о квантовой теории атома трития. Одним из решений может стать метод LoRA (Low-Rank Adaptation). Он позволяет обучать модели, модифицируя лишь небольшую часть параметров, вместо того чтобы проводить полный тюнинг всех параметров. LoRA использует специальные низкоранговые матрицы, благодаря чему изменяются только определённые аспекты, например стиль ответа или инициирование фраз, а основная часть весов предобученной модели остаётся неизменной. Эксперименты показали, что LoRA снижает количество галлюцинаций и повышает точность ответов. Например, модель с LoRA, обученная на наборе данных из 1000 инструкций, может превосходить модели с SFT, обученные на значительно больших датасетах (52 000 или 326 000 инструкций). В экспериментах использовались различные датасеты, включая MedInstruct и Alpaca.