Как улучшить работу сжатых языковых моделей
Как улучшить работу сжатых языковых моделей Сжатие языковых моделей трансформеров (LLaMA, OPT, GPT) важно для повышения их эффективности. Один из популярных методов сжатия — квантизация, которая уменьшает количество бит для представления весов модели. Однако квантизация без дополнительного обучения (файнтюнинга) часто снижает качество работы модели. Авторы статьи предлагают новый метод файнтюнинга: на каждом шаге обновлять только часть весов с наибольшим градиентом, а остальные «замораживать». После этого — делать большие шаги между «выжившими» весами. Так можно обновить почти все веса и достичь оптимального баланса между сжатием и качеством. Этот подход позволяет добиться хороших результатов даже при экстремальном сжатии (до 1–1,5 бита на параметр). Например, для моделей LLaMA-2 при сжатии до 2 бит удаётся достичь оптимума по Парето.