🧠 MiniMax-M3: разреженное внимание для длинных контекстов — 19 июня 2026 г. в 04:00:04.325
🧠 MiniMax-M3: разреженное внимание для длинных контекстов Команда исследователей представила MiniMax Sparse Attention (MSA), новый механизм разреженного блочного внимания, который оптимизирует вычислительные процессы при работе с длинными контекстами. В отличие от стандартного механизма внимания, MSA использует легковесную индексную ветку для выбора подмножества ключевых и значений блоков и основную ветку для вычисления точного разреженного внимания только по выбранным блокам. Эта инновация позволила сократить количество вычислений до 28.4 раз на токен при длине контекста в 1 миллион токенов. Технология MSA решает проблему квадратичной сложности стандартного внимания и обеспечивает ое ускорение на GPU NVIDIA H800: 14.2 раз на этапе prefill и 7.6 раз при декодировании. Предоставленный код и веса предобученной модели MiniMax-M3 (с 109B параметрами) уже доступны для сообщества, что позволяет эффективно применять эту технологию для задач с огромными контекстами.

