NVIDIA Nemotron 3 Ultra: что внутри флагманской MoE-модели — 25 июня 2026 г. в 10:01:01.251
NVIDIA Nemotron 3 Ultra: что внутри флагманской MoE-модели 👋 NVIDIA Nemotron 3 Ultra — крупнейшая модель в линейке Nemotron 3, ориентированная на агентные системы, рассуждения, кодинг, диалог и работу с длинным контекстом. 📌 Главный интерес — в том, как NVIDIA пытается совместить ёмкость крупной модели с более эффективным инференсом. Что важно: ▪️ Гибридная архитектура Nemotron-H + LatentMoE В модели используются 108 слоёв трёх типов: Mamba-2, Latent MoE и Attention. Значительная часть классических attention-слоёв заменена на Mamba-2, а экспертные вычисления вынесены в LatentMoE. Это снижает стоимость внимания и размер KV-cache, что особенно важно для длинноконтекстных задач и агентных цепочек. ▪️ LatentMoE вместо классической MoE-маршрутизации Nemotron 3 Ultra содержит 550B параметров, из которых 55B активируются на токен. При этом токены перед маршрутизацией и вычислениями в экспертах проецируются в латентное пространство меньшей размерности. Такой подход делает маршрутизацию экономичнее по сравнению с классическими MoE-моделями. ▪️ Multi-Token Prediction для ускорения генерации В архитектуру встроена Multi-Token Prediction — механизм, при котором модель может предсказывать несколько будущих токенов одновременно. Это помогает повышать пропускную способность инференса, особенно при генерации длинных ответов. 📲 Подробнее — в слайдах. ➡️ Запустить Nemotron 3 Ultra можно через каталог моделей immers.cloud.

