[📌 Часть 2/2] — 12 июля 2026 г. в 21:35:55.127
[📌 Часть 2/2] Semantic Drift-мониторинг инференса: от логирования прокси до автоотката через векторные пороги (продолжение) - Sidecar capture (Envoy JSON filter): envoy --config-path /etc/envoy/inference_sidecar.yaml --concurrency 4 с on_response_headers: [true] и remove_path: true для минимизации overhead на proxy-уровне. - Qdrant index config: curl -X PUT http://localhost:6333/collections/llm_baseline/vectors/config -d '{"vector_size": 384, "distance": "Cosine", "hnsw_config": {"m": 16, "ef_construct": 100}}' - Drift calculation CLI (Python worker): docker run --rm -v ./data:/app/data sentence-transformers/all-MiniLM-L6-v2 python drift_calculator.py --batch-size 64 --threshold 0.84 --output prometheus_metrics.txt - Prometheus rule для автоалертинга: groups: - name: inference_drift rules: - alert: SemanticDriftHigh expr: avg_over_time(llm_cosine_similarity[10m]) < 0.84 for: 5m labels: severity: critical annotations: summary: "Model output diverged from baseline" - Flagger canary analysis: analysis: interval: 30s metricTemplates: - name: drift-score provider: query-template: url: http://drift-exporter:8080/metrics query: avg(llm_cosine_similarity) thresholdRange: max: 0.84 - GPU memory optimization для инференс-нод: nvidia-smi pmon -d -o POWER_DRAW -s 1 > /var/log/gpu_pwr.csv && watch -n 5 'vram=$(nvidia-smi --query-gpu=memory.used --format=csv,noheader,nounits); echo $vram' для корреляции drift-всплесков с memory fragmentation и vLLM KV-cache eviction. #MLOps #InferenceMonitoring #DevOps #VectorDB #LLMOps

