Kimi K3: как устроена модель на 2,8 трлн параметров — 27 июля 2026 г. в 18:35:52.149
Kimi K3: как устроена модель на 2,8 трлн параметров K3 содержит 2,78 трлн параметров, но на каждом токене активирует 104,2 млрд. В модели 93 слоя, 896 маршрутизируемых экспертов — одновременно работают только 16 — и контекстное окно на 1 048 576 токенов. Веса занимают около 1,56 ТБ. Гибридное внимание. Архитектура повторяет схему KDA → KDA → KDA → Gated MLA. KDA хранит рекуррентное состояние фиксированного размера вместо растущего KV-кеша, а каждый четвёртый слой MLA возвращает глобальное взаимодействие между токенами. Moonshot также ограничила коэффициент затухания KDA: небольшое изменение формулы позволило убрать отдельный медленный путь из ядра для графического процессора. Глубина и эксперты. Attention Residuals позволяет слоям обращаться к представлениям предыдущих блоков, а не только к суммарному остаточному потоку. LatentMoE сжимает маршрутизируемую ветвь с 7 168 до 3 584 измерений. Квантильная балансировка и MoonEP перераспределяют нагрузку и временно копируют перегруженных экспертов, чтобы процессы получали одинаковое число токенов. Обучение агентов. Длинные траектории могут включать сотни вызовов инструментов. Система не ждёт завершения всех попыток: незаконченная траектория вместе с состоянием внешней среды сохраняется и продолжается после обновления политики. Девять специализированных политик — общих, агентных и программистских, в трёх режимах рассуждения — затем объединили в одну модель. Контекст в миллион токенов потребовал отдельного кеша. K3 одновременно обслуживает фиксированные состояния KDA и растущий KV-кеш MLA. Префикс можно использовать повторно только при согласованном состоянии обоих механизмов. При спекулятивном декодировании модель хранит компактные проекции входа и повторно вычисляет принятые токены непосредственно на кристалле. Поиск уязвимостей. Moonshot заявляет о 16 ранее неизвестных ошибках в шести проектах и примерно 70% подтверждений среди отобранных для проверки находок. Но методика отбора, полный список целей и слепая контрольная оценка не опубликованы. В независимом исследовании AISI/CAISI K3 набрала 32% на ExploitBench, но не выполнила ни одного из 41 задания на произвольное выполнение кода. Главное ограничение отчёта — воспроизводимость. Ну как бы для запуска вам понадобиться как минимум 1Тб видеопамяти или хоть какой-то памяти, чтобы запустить в 4bit или 2bit, не помню. Ждём очень сильно разряженных версий моделей, с надеждой что качество ответов не упадёт ниже 90% от FP8 Полный мой технический разбор: Как устроена Kimi K3 @poxek_ai / Чат канала

