Li Auto (да, автопроизводитель) показал, как посттрейном дотянуть малую модель до уровн... — 18 июля 2026 г. в 05:14:48.302
Li Auto (да, автопроизводитель) показал, как посттрейном дотянуть малую модель до уровня гигантов. Mach-Mind - MoE на 35B, 3B активных, поверх Qwen3.5. Идея: не учить одну модель RL сразу на смеси наград (математика, код, агенты) - начинаются качели, подтянул одно, просело другое. Вместо этого обучили десяток RL-экспертов по доменам порознь, у каждого свои данные и награды. Потом слили обратно мультиучительской дистилляцией (MOPD, от Xiaomi): каждый пример уходит к своему замороженному эксперту, и тот через reverse-KL подтягивает ученика к себе. Агентные навыки качали в песочницах - модель читает файлы, правит код, гоняет тесты. Работает "и да, и нет": на агентных бенчах обошли даже отдельных экспертов, а на SWE-bench просели (73.8 → 71.1) - узкая специализация смазывается при дистилляции. Зато 92.7 на AIME и топ на IFBench - уровень куда более крупных моделей. Нам близко: у нас тоже совет доменных экспертов и та же граница - способ их сведения не главный рычаг, важна точность самих экспертов.

