Mamba против трансформеров: борьба за эффективность обработки текста
Mamba против трансформеров: борьба за эффективность обработки текста Трансформеры, такие как BERT и GPT, хорошо справляются с задачами обработки естественного языка (NLP), но сталкиваются с проблемами при работе с длинными текстами. Причина — рост вычислительных затрат и сложности поддержания высокой скорости обучения и инференса. Существуют различные способы оптимизации, например, линейные аттеншн-механизмы и структурированные маски токенов, но у них есть ограничения. Альтернативой могут стать Mamba и Mamba 2, которые используют другой подход к обработке длинных текстов, не требуя одновременной обработки всех токенов. Авторы статьи сравнили Mamba, Mamba 2 и классический трансформер и выяснили, что в некоторых случаях результаты Mamba сопоставимы с трансформерами, но и у неё есть трудности с большими контекстами. Для решения проблемы предложили гибридную модель, сочетающую Mamba 2, селф-атеншн и MLP-слои. Эксперименты показали, что при 8 % селф-аттеншн слоёв и примерно 50 % MLP-слоёв удалось ускорить инференс на 20 %. 8B-модель Mamba-2-Hybrid сравнялась по качеству с трансформерами, а теоретически замена слоёв аттеншена SSM-слоями может ускорить обработку в 7 раз.