На демо LLM-инференс может работать быстро, а под реальной нагрузкой — получить растущи... — 21 августа 2026 г. в 12:29:08.997
На демо LLM-инференс может работать быстро, а под реальной нагрузкой — получить растущий p99, очередь запросов и внезапный OOM. Причем проблемы проявляются не сразу: когда p99 уже начинает расти, средняя задержка еще может быть нормальной. В статье разбираем четыре механизма такой деградации: 🌟 фрагментация KV-cache 🌟 нехватка памяти на длинном контексте 🌟 блокировка очереди при батчинге 🌟 разрыв между p50 и p99. 👀 Главное — этот процесс можно заметить заранее. Средней задержки для этого мало. Нужны gpu_cache_usage, p99 задержки между токенами, глубина очереди, счетчик вытеснений и preemption. Отдельно показываем, как подобрать параметры батчинга под свой трафик и почему оптимизации вроде PagedAttention не отменяют наблюдения за памятью и хвостовыми задержками. В статье есть примеры расчетов для разных контекстов и скрипты для проверки KV-кэш, OOM, батчинга и хвостовой латентности на собственной инфраструктуре. 👉 Читайте на Хабре

