MiniMax выложила в открытый доступ Music3, модель, которая пишет песню целиком: до пяти...
MiniMax выложила в открытый доступ Music3, модель, которая пишет песню целиком: до пяти минут со связной структурой, куплетами, припевом и одним и тем же голосом от начала до конца. На вход идут слова песни с тегами разделов вроде Verse и Chorus и описание музыки обычным текстом: жанр, темп, тональность, тембр вокала, инструменты и то, как аранжировка меняется по ходу. На выходе стерео WAV 32 кГц, примеры звучания собраны на отдельной странице. Работают два этажа. Глобальная языковая модель на 8 млрд параметров, выросшая из Qwen3-8B, держит структуру и развитие песни на длинной дистанции, локальная на 0,6 млрд достраивает акустические детали внутри каждого кадра. Дальше звук собирается прямо из скрытых состояний обеих моделей, минуя дискретные токены: Flow Matching на 2,4 млрд и декодер Flow-VAE, за счёт этого сохраняется больше нюансов в артикуляции и тембре инструментов. Запуск через SGLang-Omni, ComfyUI и diffusers, где пайплайн пока ставится из ветки незамерженного пул-реквеста. Полная точность влезает в 24 ГБ видеопамяти, с выгрузкой слоёв в оперативку хватает и 8 ГБ, но нужна CUDA. Лицензия своя: коммерция разрешена компаниям с выручкой до 20 млн долларов, при этом имя модели требуют показывать в интерфейсе продукта. @neuro_channel