💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее — 6 июля 2026 г. в 13:04:22.885
💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который мы собирали больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra. Что внутри: 🔘Собственная гибридная архитектура MLA + GatedDeltaNet с придуманной нами уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается; 🔘Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя; 🔘GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Модернизация этого слоя позволила нам стабильно обучать модели с большим количеством параметров. 🔘Линейный слой требует в 4 раза меньше KV-кеша на токен, в ту же память позволяет поместить в 2,14 раза больше контекста, throughput под нагрузкой растет на +20%; 🔘Две MTP-головы и ускорение генерации до 2,2 раза; 🔘FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра; 🔘Новый этап online RL после SFT и DPO. Результаты: 🔘GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье); 🔘GigaChat-3.5-Ultra-Instant сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше; 🔘По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%. Весь стек — данные (своя LLM-фильтрация Common Crawl, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан нами end-to-end. 🤖 Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr. 📲 Подписывайтесь на наш канал в MAX

