[📌 Часть 1/2] — 13 июля 2026 г. в 05:44:44.542
[📌 Часть 1/2] Мониторинг дрифта и автоматический rollback для LLM-сервисов: от метрик до канареечных релизов В продакшене нейросетевые сервисы ведут себя иначе, чем классические REST API. Детерминированность отсутствует, а деградация качества происходит плавно: модель начинает галлюцинировать, падает точность RAG-ответов или растёт стоимость токена. Стандартный HealthCheck и HTTP 200 здесь бесполезны. Чтобы не терять деньги и репутацию, нужно выстраивать observability-слой, который отслеживает семантический дрифт, latency-хвосты и автоматически переключает трафик на стабильную версию. Ниже — рабочая схема для DevOps и ML-инженеров, которая стыкуется с существующим стеком без кастомных фреймворков. Архитектура базируется на трёх компонентах: sidecar-экспортер метрик, Prometheus с recording rules для аномалий и Argo Rollouts для канареечных деплоев. Sidecar перехватывает ответы через proxy или получает логи из stdout/stderr, вычисляет прокси-метрики качества и отдаёт их в /metrics. Семантический дрифт измеряется не по тексту, а по векторному расстоянию: ответы новой модели эмбеддируются (например, через лёгкий all-MiniLM-L6-v2) и сравниваются с референсным датасетом в Qdrant. Если cosine similarity падает ниже порога, метка semantic_drift_detected становится true. Параллельно отслеживаются инфраструктурные SLA: время генерации первого токена (TTFT), tokens per second, хиты в KV-cache и утечки памяти VRAM. Для vLLM это нативно доступно, для Ollama — через API /api/show или парсинг логов. Метрики шлюзятся в Prometheus, где recording rules агрегируют окна за 5/15 минут и вычисляют percentile-дрили. При срабатывании alertmanager отправляет webhook в Kubernetes controller, который откатывает rollout. Вся цепочка работает без блокировки деплоя, но гарантирует автоматическую защиту при деградации.

