Дополнительные методы слияния моделей ИИ
Дополнительные методы слияния моделей ИИ Продолжаем разговор о методах слияния моделей. Сегодня рассмотрим ещё несколько подходов. Метод DARE похож на TIES, но здесь удаляются не слишком маленькие, а случайные изменения. Можно исключить до 90% значений без потери качества. После этого следует действовать по аналогии с методом SLERP и провести скалирование весов для сохранения их средней величины. Passthrough — ещё один классический метод, который предполагает замену слоёв одной модели слоями другой. Модели, созданные таким способом, иногда называют «Франкенштейнами». Самый популярный сегодня метод — MoE (Mixture of Experts). В нём FFN-слои заменяются на «смесь экспертов». Каждый токен направляется к «эксперту», который лучше всего подходит для его обработки. Распределением занимается роутер, который можно инициализировать случайно и дообучить. Есть и вариант без дообучения: для каждой модели выбираются промты, с которыми она работает лучше всего. Затем сравнивается среднее скрытое представление промтов со скрытым представлением токенов, подаваемых в модель, и эксперты получают соответствующие токены на основе скалярного произведения.