🔥 Cursor открыла исходники Mixture-of-Kittens - MoE-мегакернела, который ускорил обуче... — 5 августа 2026 г. в 08:58:23.336
🔥 Cursor открыла исходники Mixture-of-Kittens - MoE-мегакернела, который ускорил обучение моделей на 41% без замены железа В больших Mixture-of-Experts моделях GPU тратят огромные ресурсы не только на вычисления, но и на пересылку токенов между экспертами на разных чипах. После оптимизации математики через MXFP8 именно передача данных стала главным узким местом. На некоторых нагрузках она занимала больше половины времени одного шага обучения. Mixture-of-Kittens объединяет весь цикл в один CUDA-кернел: - отправку токенов нужным экспертам; - вычисления; - сбор результатов; - синхронизацию между GPU. Передача токенов происходит параллельно с вычислениями. Ещё одно важное изменение - модель перешла от push к pull: каждый чип сам забирает нужные ему токены. Это дало до 29% больше полезной пропускной способности NVLink и сократило задержки ожидания примерно в 5,8 раза. Результаты Cursor на GB300 NVL72: - до 2,37x быстрее на MXFP8 forward; - до 1,78x быстрее на MXFP8 backward; - на 512 GPU throughput вырос с 760,9 до 1 070,2 токена/с на GPU; - общий прирост производительности в production составил около 41%. Ускорение получили не за счёт новых видеокарт, а благодаря более умному расписанию движения данных. На масштабе сотен GPU хороший кернел может оказаться выгоднее ещё одной стойки оборудования. Проект опубликован под лицензией Apache 2.0. https://x.com/Machinelearrn/status/2084926849763701040

