DeepSeek-V4-Pro: что еще важно знать — 22 мая 2026 г. в 10:09:41.284
DeepSeek-V4-Pro: что еще важно знать 👋 В каталоге immers.cloud доступна DeepSeek-V4-Pro — крупная открытая MoE-модель с 1,6 трлн параметров, 49 млрд активных параметров на токен и контекстным окном до 1 048 576 токенов. ⚙️ Ключевая особенность модели — гибридная архитектура внимания, которая снижает вычислительную стоимость работы со сверхдлинным контекстом. Что важно: ▪️ Гибридное внимание: в CSA-слоях модель сжимает KV-кэш и выбирает релевантные блоки истории через DSA-индексатор, а в HCA-слоях использует сильную компрессию 1:128, чтобы выполнять глобальное внимание по длинной истории. ▪️ Локальная точность: параллельно работает Sliding Window — механизм локального скользящего окна. Он без сжатия обрабатывает ближайшие токены и помогает модели сохранять точную связь с текущим фрагментом контекста. ▪️ Обучающий стек: модель предварительно обучена на более чем 32 трлн токенов с оптимизатором Muon, а также использует mHC — Manifold-Constrained Hyper-Connections. ▪️ Режимы работы: доступны Non-think, Think High и Think Max — от быстрых ответов до более глубокого логического анализа для сложных задач. 📲 Подробнее в слайдах. 🚀 Запускайте DeepSeek-V4-Pro через каталог моделей immers.cloudда, исследов для задач со сверхдлинным контекстом: документов, коательских материалов и агентных workflow. ➡️ DeepSeek-V4-Pro ➡️ DeepSeek-V4-Flash

