Оптимизация KV-кэша: как ускорить инференс LLM
Оптимизация KV-кэша: как ускорить инференс LLM Существует несколько способов ускорить инференс больших языковых моделей (LLM): изменить архитектуру, использовать speculative decoding или добавить вычислительные ресурсы. Однако один из наиболее практичных методов — оптимизация KV-кэша. Её можно разделить на два типа: pre-train и post-train. Pre-train требует изменений до обучения модели и включает архитектурные решения вроде GQA/MQA/MLA, смешивание глобального и локального атеншена и другие модификации. Post-train-методы применяются к уже готовой модели и включают sparse-стратегии, pruning, удаление повторов токенов и другие техники, которые уменьшают объём KV или сокращают число обращений к нему во время инференса. KV-бюджеты удобно делить на dense и sparse, отдельно для prefill и decode. Например, в варианте dense prefill + dense decode каждый новый Q взаимодействует со всеми K и V до него. Если использовать sparse только на prefill, а decode оставить плотным, то Q перестаёт смотреть на весь промпт, но общий выигрыш заметен в основном в сценариях «длинный промпт — короткий ответ». Один из эффективных post-train-методов оптимизации KV-кэша — ShadowKV (подробнее). Он позволяет получать минимальные просадки на бенчмарках без дообучения и увеличивает пропускную способность до трёх раз. Ссылки из исходного поста: Душный NLP Материалы по ссылкам: 1. ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference Что в статье: ShadowKV — система для высокопроизводительного вывода больших языковых моделей с длинным контекстом. Она позволяет сократить объём используемой памяти за счёт хранения низкорангового кэша ключей и выгрузки кэша значений. Для минимизации задержки при декодировании ShadowKV использует точную стратегию выбора KV, которая на лету реконструирует минимально необходимые разреженные пары KV. Система продемонстрировала возможность поддержки увеличения размеров пакетов до 6 раз и повышение пропускной способности до 3,04 раз на GPU A100 без потери точности. Источник материала: ссылка 2. Душный NLP Что в статье: Канал «Душный NLP» содержит разборы свежих статей от NLP-специалистов Яндекса. Предоставляет подробную и полезную информацию. Количество подписчиков: 6 411. Источник материала: ссылка Источник: оригинальный пост