🧠 Li Auto создала 35B-модель, догоняющую гигантов — 17 июля 2026 г. в 20:04:57.953
🧠 Li Auto создала 35B-модель, догоняющую гигантов AI-подразделение китайского производителя электромобилей Lixiang опубликовало исследование по насыщению компактной модели доменными знаниями через посттренинг. Что сделали: - Взяли Qwen3.5-35B-A3B (35 млрд общих / 3 млрд активных параметров, MoE) - Обучили более десятка независимых RL-экспертов — каждый в своём домене (математика, код, безопасность, поиск, работа с инструментами) - Собрали их обратно через мультиучительскую дистилляцию MOPD (Xiaomi) - Добавили механизм HMPO для контроля длины CoT Ключевая находка: прямое RL на смеси наград вызывает качели. Решение — разделить этапы и домены, затем слить через дистилляцию. Результаты (Mach-Mind-4-Flash): - AIME'26: 92,7 — отставание от триллионной Kimi-K2.5 менее 1 п.п. - IFBench: 82,8 — первое место с отрывом от Qwen3.5-122B - BFCL-v4: 75,8 — второе после MiMo-V2-Flash, лучше Qwen3.5-122B и Kimi-K2.5 Агентные навыки: осваивались в исполняемых песочницах — 190+ предметных областей, 3500+ интерфейсов инструментов, траектории до 300 шагов при контексте 256K токенов. Нюанс: на SWE-bench Verified результат просел с 73,80 (эксперт) до 71,10 (собранная модель) — узкая специализация по коду при дистилляции смазывается. Механика HMPO: медиана длины CoT правильных ответов → награду получают только верные и короткие решения. Сокращение длины генерации на 19–46% при потере точности не более 0,7%. Планы по публикации модели неизвестны — возможно, её увидят в следующих поколениях электромобилей Lixiang. 🧠 Нейросети и Технологии. Подписаться

