Типичный программист | IT, программирование, разработка, ИИ
IT и технологии · 5 июня 2026 г.
KVarN убирает главное ограничение vLLM одним флагом — 5 июня 2026 г. в 14:42:37.718
KVarN убирает главное ограничение vLLM одним флагом Если вы гоните LLM в проде, память под KV-cache уходит быстрее, чем вы успеваете сказать «контекстное окно». Huawei выложила KVarN: нативный бэкенд квантизации для vLLM, который включается одним флагом — без калибровки и без переписывания модели. По их данным, проект даёт в 3-5 раз больше контекста при throughput выше FP16 и точности на уровне FP16. Для агентов и long-context задач это означает больше параллельных запросов на том же железе без потери качества, а это как раз то, за что обычно приходится покупать новые GPU. Репо с кодом и бенчмарками.

