Qwen3.8-flash-next: рабочий сценарий на двух Ascend по 96 ГБ
Qwen3.8-flash-next: рабочий сценарий на двух Ascend по 96 ГБ Запуск Qwen3.8-flash-next на двух ускорителях Ascend с 96 ГБ памяти — рабочий сценарий, который стал возможен после доработки vLLM, открытого движка для инференса больших языковых моделей (LLM). Модель распределяется между двумя устройствами, что снимает ограничение на объём памяти одной карты и сохраняет приемлемую скорость генерации. Для команд без доступа к крупным вычислительным кластерам это практичный способ запустить современную LLM на альтернативном железе. В бенчмарках связка из двух Ascend показывает стабильную производительность: время до первого токена и скорость генерации близки к показателям одиночного ускорителя с большим объёмом памяти. Накладные расходы на синхронизацию между устройствами минимальны. Основная инженерная работа сконцентрирована в vLLM — добавлена поддержка распределения памяти и взаимодействия между нейропроцессорами Ascend. Это переводит задачу из разряда экспериментов в продакшен-готовое решение. Дальнейшие шаги — квантование для снижения требований к памяти, оптимизация длинного контекста и профилирование узких мест. Та же схема масштабируется на три и четыре карты, что открывает путь к запуску более крупных моделей. Пока это нишевое, но важное направление: оно снижает входной порог для работы с современными LLM на аппаратных платформах, отличных от привычных GPU. Главное: • Две карты Ascend по 96 ГБ позволяют запустить Qwen3.8-flash-next в vLLM • Разделение модели между устройствами даёт минимальный оверхед • Поддержка vLLM делает сценарий пригодным для продакшена • Следующие шаги — квантование, длинный контекст и масштабирование #ИИ #LLM #Ascend #vLLM #OpenSource