🚀 AMD ZenDNN 6.0: инференс в формате FP16 и ускорение «смеси экспертов» прямо на проце... — 23 июля 2026 г. в 10:56:11.162
🚀 AMD ZenDNN 6.0: инференс в формате FP16 и ускорение «смеси экспертов» прямо на процессорах AMD EPYC AMD выпустила ZenDNN 6.0 — обновленный инференс-стек для процессоров (CPU), который расширяет роль серверных процессоров в задачах ИИ-инференса. Главная задача— довести инференс больших языковых моделей (LLM) на процессорах до уровня, пригодного для промышленной эксплуатации (production/продакшен) там, где важны стоимость и доступность вычислений. ⚙️ Ключевые особенности ZenDNN 6.0 🧠 Функциональная поддержка формата FP16 — программный задел под будущие процессоры (CPU) AMD EPYC 6-го поколения, а не прирост скорости на нынешних ⚡️ Ускорение моделей «смесь экспертов» (MoE): объединенный оператор в формате BF16, квантованный MoE (DA8W8, INT4 WOQ), Group MatMul для параллелизма экспертов 🔍 Новые вычислительные ядра внимания (attention kernels) для больших языковых моделей (LLM) 📉 Расширенная квантизация (quantization): интеграция с LLM-Compressor, пресеты TorchAO, поддержка DA8W8 для архитектур MoE 🔗 Совместимость с vLLM в диапазоне 0.20.0–0.23.0 — ускорение без единой правки кода 🧠 Почему это важно 💰 Процессоры — полноценная часть инференса ИИ Не весь инференс обязан идти через графические процессоры (GPU) — часть задач эффективно решается на EPYC. 🏗 Снижается стоимость инфраструктуры Использование существующих серверов позволяет экономить без потери гибкости. 📊 Точность остается высокой По собственным замерам AMD, квантизация DA8W8 удерживает точность в пределах ~1% от базовой BF16 на Llama-3.1-8B, Phi-4-mini, Qwen2.5-VL-7B и Mixtral-8x7B (исключение — GPT-OSS-20B: −1,62% на тесте GSM8K). ⚡️ Гибридная модель инференса усиливается Графические процессоры (GPU) и процессоры (CPU) начинают работать как единый стек, а не как конкурирующие решения. 📦 Важна не только мощность, но и доступность ресурсов Для промышленной эксплуатации (production/продакшен) и периферийных вычислений (edge) доступность была и остается одним из важнейших параметров. 📌 Главный вывод Инференс ИИ все чаще становится гибридным: графические процессоры — для максимальной производительности, процессоры — для масштабируемости и стоимости.

