Исследование TurboQuant: плюсы и минусы метода квантизации
Исследование TurboQuant: плюсы и минусы метода квантизации В блоге vLLM провели детальное тестирование метода квантизации KV-кэша TurboQuant. Исследователи проверили его работу на моделях с разным количеством параметров и нескольких бенчмарках. Варианты k8v4 и 4bit-nc показали хорошие результаты: они почти не теряют в качестве, при этом сокращая занимаемое место на 15–35 % по сравнению с FP8. Однако при переходе к трёхбитной квантизации точность заметно падает, особенно в задачах с длинным контекстом. С производительностью ситуация менее оптимистичная: хотя размер KV-кэша уменьшается, пропускная способность падает на 10–70 % из-за постоянной деквантизации. Это делает метод подходящим для локального инференса, но не для серверов. Подробнее можно узнать в блоге vLLM. Материалы по ссылкам: 1. A First Comprehensive Study of TurboQuant: Accuracy and Performance В статье представлено комплексное исследование метода TurboQuant для квантования KV-cache. Исследование проводилось на четырёх моделях (от 30B до 200B+ параметров) и пяти бенчмарках, включая задачи с длинным контекстом и задачи, требующие рассуждений. Результаты показали, что FP8 остаётся лучшим вариантом по умолчанию для квантования KV-cache, обеспечивая двукратное увеличение ёмкости KV-cache с незначительной потерей точности. Варианты TurboQuant k8v4 и 4bit-nc показали себя безопасными для задач с длинным контекстом, в то время как k3v4-nc и 3bit-nc продемонстрировали заметное снижение точности, особенно при очень длинных контекстах. https://vllm.ai/blog/2026-05-11-turboquant Источник: оригинальный пост