MiniMax-M3: как модель работает с 1M контекста — 14 июля 2026 г. в 10:01:14.438
MiniMax-M3: как модель работает с 1M контекста 👋 MiniMax-M3 — открытая мультимодальная MoE-модель семейства MiniMax, рассчитанная на кодинг, агентные сценарии и инференс с длинным контекстом. Главная особенность модели — MiniMax Sparse Attention: разреженное внимание, которое помогает обрабатывать последовательности до 1 048 576 токенов без линейного роста вычислительной стоимости внимания. Что важно: ▪️ Контекст до 1M токенов MiniMax-M3 можно рассматривать для задач, где модели нужно удерживать большие объёмы информации: репозитории, длинные документы, технические спецификации, логи, видео и многошаговые цепочки действий. ▪️ MiniMax Sparse Attention MSA состоит из двух веток. Index Branch сначала оценивает блоки ключей-значений и выбирает релевантные части длинного контекста. Main Branch затем считает точное внимание только по выбранным блокам, а локальный блок ближайшего окружения токена сохраняется всегда. ▪️ Ниже стоимость внимания При контексте 1 миллион токенов MSA сокращает вычислительные затраты на внимание на один токен в 28,4 раза по сравнению с GQA. Это критично для длинного контекста, где обычное внимание быстро становится дорогим по вычислениям и памяти. 📲 Подробнее — в слайдах. ➡️ MiniMax-M3 доступна через каталог моделей Immers Foundation Models: вы платите не за токены, а за время аренды GPU-сервера. Для запуска доступна конфигурация 4 × NVIDIA H200 от 1 717,59 ₽/ч.

