Qwen 3.6 на двух RTX 5070 Ti: как получить 300 токенов в секунду локально — 5 августа 2026 г. в 07:58:14.528
Qwen 3.6 на двух RTX 5070 Ti: как получить 300 токенов в секунду локально ⠀ Нужен быстрый инференс для голосового агента, но серверное железо не по карману? Я проверил запуск новых моделей Qwen 3.6 (27B и MoE 35B) в квантовании NVFP4 на связке из двух потребительских видеокарт. ⠀ Спойлер: обе модели летают, но есть нюанс с памятью. «Лёгкая» 27B оказалась тяжелее MoE-версии, а скорость генерации превысила ожидания даже при строгом JSON-выводе. ⠀ Что удалось замерить: - SGLang выиграл в скорости: до 309 ток/с у модели 35B-A3B против 135 у vLLM. Время до первого токена (TTFT) упало до 0.17 сек. - vLLM лучше для параллелизма: при 10 одновременных запросах пропускная способность достигла 875 ток/с, что критично для нагрузок. - Кэш префикса решает: SGLang дал ускорение в 8.6 раз при повторных запросах, срабатывая уже с 667 токенов совпадения. - NVFP4 — это микс: веса квантованы в 4 бита, активации остались в bfloat16. Железо без нативной поддержки FP4 использует ядра Marlin, поэтому флаг --quantization может вести себя неочевидно. ⠀ В статье я разобрал каждую команду запуска для vLLM 0.26 и SGLang 0.5.16, показал, почему 27B ест больше VRAM, чем 35B, и описал грабли, на которых потерял время. ⠀ P. S. А вы применяете эти модели в своей работе, или предпочитаете облако? ⠀ Полный разбор: Qwen 3.6 27B и 35B-A3B в NVFP4: запуск на двух RTX 5070 Ti через vLLM и SGLang ⠀

