Дистилляция LLM в два энкодера: почему ученик не догоняет учителя
Дистилляция LLM в два энкодера: почему ученик не догоняет учителя Практический эксперимент по дистилляции большой языковой модели (LLM) в два компактных энкодера по 287 миллионов параметров показал типичную проблему: ученик не достигает качества учителя. Вместо одного универсального решения автор разделил задачу на две части — извлечение сущностей через GLiNER (модель для распознавания именованных сущностей) и ответ с выбором варианта. Такой подход логичен: маленькие модели часто выигрывают от узкой специализации. Однако итоговая точность оказалась ниже, чем у исходной LLM, и вопрос о причинах возникает у многих, кто пробует дистилляцию. Главная причина расхождения — разрыв в ёмкости между учителем и учеником. LLM с сотнями миллиардов параметров хранит знания не только в весах, но и в способности рассуждать. При дистилляции ученик получает лишь финальные ответы, а не внутренний процесс. Если учитель сильно уверен в ответе, а ученик учится на «мягких» вероятностях, без правильной температуры и баланса обучающих сигналов он запоминает шум вместо закономерностей. Также важна задача множественного выбора: она упрощает выход, но теряет контекст, который давала генерация свободного текста. Чтобы приблизиться к учителю, стоит проверить три вещи: качество и разметку обучающих данных, температуру дистилляции и вес сигнала от учителя. Возможно, потребуется добавить вспомогательную задачу восстановления документа или использовать ансамбль из двух энкодеров. Главное — не ожидать, что два компактных энкодера воспроизведут все возможности LLM; цель должна быть в достижении приемлемого качества на узком классе документов. Главное: • Разрыв ёмкости между LLM и компактным энкодером — главный барьер дистилляции • Дистилляция передаёт ответы, но не внутренние рассуждения учителя • Температура, обучающие данные и вес сигнала влияют сильнее архитектуры • Два специализированных энкодера не заменяют универсальную LLM #Дистилляция #LLM #Энкодеры #NLP #ИИ