Альтернативы квадратичному вниманию: обзор исследований
Альтернативы квадратичному вниманию: обзор исследований В последние годы активно обсуждаются альтернативы классическому механизму внимания в трансформерах из-за проблем с масштабированием и обработкой длинных контекстов. Рассмотрим несколько интересных работ на эту тему. Команда MiniMax в своём посте объясняет, почему их модель M2 вернулась к полному вниманию, несмотря на эксперименты с гибридными архитектурами. На сложных задачах с длинным контекстом гибридная модель не показала хороших результатов. Авторы считают, что для развития альтернативных подходов нужно больше данных и экспериментов. В исследовании The Sparse Frontier анализируются компромиссы разрежённого внимания в трансформерах. Выяснилось, что на умеренных контекстах спарсификация почти не помогает, а на очень длинных может ухудшать качество. В среднем удаётся достичь примерно пятикратного сжатия без значительной потери качества, но результаты сильно варьируются. Модель Kimi Linear от Moonshot AI демонстрирует, что линейное внимание может быть эффективным. В архитектуре Kimi Delta Attention используется соотношение 3:1 линейных слоёв к полному вниманию. Модель показывает хорошие результаты на бенчмарках и превосходит полное внимание по эффективности, особенно при работе с длинными промптами. Таким образом, хотя альтернативы полному вниманию выглядят перспективно, пока существуют ограничения, которые мешают их широкому применению. Ссылки из исходного поста: Why Did MiniMax M2 End Up as a Full Attention Model? | The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs | Evaluating Long Context (Reasoning) Ability | Kimi Linear: an expressive, efficient attention architecture | Yandex Research Reading Group | Душный NLP Материалы по ссылкам: 1. Why Did M2 End Up as a Full Attention Model? Что в статье: В статье рассматривается вопрос выбора полной модели внимания для системы MiniMax-M2. Автор объясняет, что в промышленных системах эффективное внимание всё ещё требует доработки, прежде чем сможет однозначно превзойти полное внимание. Одним из основных факторов является ограниченность вычислительных ресурсов, что делает актуальным поиск архитектуры, которая лучше использует эти ресурсы. Описываются проблемы, связанные с оценкой моделей, особенно при переходе к более сложным задачам и гибридным моделям внимания. Упоминается, что оптимизация и выявление проблем часто проявляются только при масштабировании системы. Источник материала: ссылка 2. The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs Что в статье: В статье проводится сравнение методов разрежённого внимания в Transformer LLM без необходимости дополнительного обучения при различных масштабах моделей, длинах последовательностей и уровнях разрежённости. Исследование показывает, что для очень длинных последовательностей предпочтительнее использовать более крупные и высокоразрежённые модели по сравнению с меньшими и плотными. Уровень разрежённости, при котором сохраняется точность, выше при декодировании, чем при предварительном заполнении, и коррелирует с размером модели. Авторы вводят и подтверждают новые законы масштабирования, специфичные для разрежённого внимания. Источник материала: ссылка 3. Kimi Linear: An Expressive, Efficient Attention Architecture Что в статье: Представлена архитектура Kimi Linear — гибридная линейная архитектура внимания, которая впервые демонстрирует более высокие результаты по сравнению с полным вниманием в различных сценариях, включая короткий и длинный контекст, а также Источник: оригинальный пост