Адаптация decoder-only моделей в encoder-decoder: новые возможности Gemma
Адаптация decoder-only моделей в encoder-decoder: новые возможности Gemma Исследователи нашли способ адаптировать предобученные модели с архитектурой decoder-only к архитектуре encoder-decoder. Это позволяет объединить преимущества обоих подходов и улучшить соотношение качества и эффективности. В статье Encoder-Decoder Gemma описывается метод, при котором из весов decoder-only модели создаются компоненты encoder-decoder. В энкодере self-attention и FFN инициализируются на основе соответствующих элементов исходной модели, при этом self-attention переключается с causal на двунаправленный. В декодере используются те же self-attention и FFN. Новая часть — cross-attention: если энкодер и декодер получены из одного чекпойнта, cross-attention инициализируется из SA, в противном случае — рандомно с дополнительным обучением. Авторы сравнивают два варианта претрейн-обджектива: PrefixLM и UL2. PrefixLM облегчает имплементацию дистилляции, а UL2 решает denoising-задачи. Эксперименты на Gemma 2 (2B и 9B параметров) показали, что адаптированные модели достигают сопоставимого и зачастую лучшего качества по сравнению с моделями, обученными с нуля. Ссылки из исходного поста: Душный NLP Материалы по ссылкам: 1. Encoder-Decoder Gemma: Improving the Quality-Efficiency Trade-Off via Adaptation Что в статье: В статье рассматривается адаптация предварительно обученных моделей LLMs с архитектурой decoder-only к архитектуре encoder-decoder. Цель исследования — использовать преимущества обоих подходов для достижения более выгодного соотношения качества и эффективности. Эксперименты проводились на моделях Gemma 2 (2B и 9B) и наборе новых предварительно обученных моделей размером с mT5 (до 1.6B). Результаты показали, что модели encoder-decoder достигают сопоставимой (а зачастую и лучшей) производительности при предварительном обучении и существенно лучшей производительности при тонкой настройке по сравнению с моделями decoder-only. Также адаптация Источник материала: ссылка 2. UL2: Unifying Language Learning Paradigms Что в статье: В статье представлена унифицированная система для предварительного обучения моделей, которые эффективны на разных наборах данных и в различных условиях. Предложена концепция Mixture-of-Denoisers (MoD), объединяющая различные парадигмы предварительного обучения. Проведены эксперименты, в результате которых модель с 20 миллиардами параметров достигла передовых результатов в 50 задачах обработки естественного языка. Модель также показала хорошие результаты в обучении в контексте, превзойдя GPT-3 с 175 миллиардами параметров в нулевой постановке задачи SuperGLUE. Применена настройка инструкций FLAN к модели UL2 20B, что позволило достичь Источник материала: ссылка 3. Душный NLP Что в статье: Канал «Душный NLP» содержит разборы свежих статей от NLP-специалистов Яндекса. Предоставляет подробную и полезную информацию. Источник материала: ссылка Источник: оригинальный пост