[📌 Часть 2/2] — 12 июля 2026 г. в 05:07:37.889
[📌 Часть 2/2] Живые конфиги vLLM: как настроить PagedAttention и избежать OOM на GPU-кластерах (продолжение) - docker run --gpus all --network host vllm/vllm-openai serve meta-llama/Llama-3-8B-Instruct --model meta-llama/Llama-3-8B-Instruct --tensor-parallel-size 1 --max-model-len 16384 --gpu-memory-utilization 0.92 --max-num-seqs 256 --max-num-batched-tokens 8192 --enable-prefix-caching - --kv-cache-dtype AUTO критично при смешанных запросах. Если используете AWQ-модели, явно задавайте --quantization awq, иначе движок попытается конвертировать в FP16 на лету и съест лишние 20% VRAM. Для FP8 моделей ставьте --kv-cache-dtype fp8 + --quantization fp8. - В Kubernetes health-check должен опрашивать /health с интервалом 5с и timeout 3с. vLLM возвращает {"msg": "OK"} только если пул GPU свободен от deadlock-состояний. Добавляйте livenessProbe в pod spec, чтобы избегать stuck replicas: path: /health, initialDelaySeconds: 60. - Мониторинг через Prometheus: собирайте vllm:gpu_cache_usage_perc и vllm:num_requests_running. Если cache_usage_perc стабильно > 0.85 при P95 росте, увеличивайте --max-num-batched-tokens на 10–15%, но не более. Альтернатива — переключение на --enable-chunked-prefill, которое дробит длинные промпты на чанки и сглаживает пики задержек. - Для балансировки используйте consistent hashing по session_id или user_id. Это задействует prefix caching на полную: повторные обращения к тому же контексту ускоряются в 3–5 раз за счет reuse KV-блоков. Роутинг без sticky sessions убивает cache hit ratio и заставляет движок пересчитывать префилл заново. - Логирование инференса подключайте через --disable-log-requests false + stdout -> fluentd -> ClickHouse. Не шлите raw промпты в стандартный логгер. Настройте sampling 10% для отладки и агрегацию метрик по модели/температуре/top_p. Это спасет дискоту при DDoS или abusive prompt injection. - Вертикальный скейлинг GPU бессмысленен без --enable-prefix-caching и правильного --block-size. По умолчанию 16 токенов подходит для чатов, но для code/completion задач ставьте 32. Это снижает overhead управления памятью и уменьшает количество syscalls в PagedAttention core. #vLLM #GPUOps #LLMInfrastructure #DevOpsAI #PagedAttention

