Zero-Downtime замена моделей в vLLM: шаред-волюмы, KV-кеш и маршрутизация трафика без п... — 22 июля 2026 г. в 03:30:03.295
Zero-Downtime замена моделей в vLLM: шаред-волюмы, KV-кеш и маршрутизация трафика без простоев В продакшене нельзя просто рестартовать контейнер с vLLM, чтобы переключить веса LLM. Запросы в полете отвалятся, GPU memory pool перестроится заново, а холодный старт съест SLA. Решается архитектурным паттерном blue-green деплоя на уровне inference-ноды + жестким управлением памятью через shared volumes и динамическую маршрутизацию. Ниже — рабочий шаблон для кластеров с A100/H100 или корпоративных RTX-станций, который удерживает p95 latency в рамках SLA даже при смене архитектуры модели (например, переход с 7B на 13B). Суть в изоляции состояний: два экземпляра vLLM работают параллельно, но с раздельными KV-cache пулами. Мы отключаем CPU swap (--swap-space 0), так как при активном continuous batching он только добавляет задержки на I/O. Параметры --max-model-len и --max-num-batched-tokens жестко привязываем к бизнес-кейсу, чтобы не допускать OOM-крашей. Трафик переключается через reverse-proxy по healthcheck-эндпоинту /health, который в современных версиях vLLM возвращает JSON с queue size, GPU utilization и статусом scheduler’а. #AI #LLM #DevOps #OpenSource

