Как превратить обычную модель в MoE с помощью Branch-Train-MiX
Как превратить обычную модель в MoE с помощью Branch-Train-MiX Метод Branch-Train-MiX (BTX) позволяет преобразовать обычную dense-модель в MoE-модель (Mixture-of-Experts). MoE-архитектура использует несколько FNN-блоков (экспертов) в трансформенных слоях, каждый из которых специализируется на определённой задаче. Роутер определяет, какие эксперты лучше подходят для обработки токенов на каждом этапе. Идея BTX основана на методе BTM (Branch-Train-Merge): несколько одинаковых LLM обучаются на разных датасетах, а затем их предсказания агрегируются. Авторы предложили после обучения объединить модели в MoE, где каждый FNN-блок станет экспертом в соответствующем слое, и добавить роутер. В эксперименте использовались три копии Llama-2 7B, дообученные на доменах математики, программирования и общих знаний. К ним добавили оригинальную Llama-2 7B без дообучения. Файнтюнинг финальной MoE-модели проводился на данных, использованных для обучения экспертов. В результате модель показала хорошие результаты в математике и программировании, не сильно уступая специализированным моделям. Преимущество BTX-моделей — интерпретируемость: токены из определённого домена обрабатываются соответствующим экспертом.