RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
IT и технологии · 27 сентября 2026 г.
Большую MoE-модель можно облегчить и без дообучения: взять и выбросить треть экспертов....
Большую MoE-модель можно облегчить и без дообучения: взять и выбросить треть экспертов. Altar-1 так ужал GLM-5.3 — 753B до 504B параметров, по 168 экспертов на слой вместо 256. Отклонение от оригинала KL 0,506 nats, почти как у квантизации той же нарезки. Фишка не в самом отсечении, а в том, кого оставляют. Эксперта оценивают по его максимальной доле в работе одного домена, а не по общей частоте. Так специалисты по редким языкам и коду выживают, а «популярные» лишние уходят. Отбор по частоте на том же кате даёт вдвое большую ошибку. Веса в INT4, 328 ГБ на 4×H200.