vLLM, Ollama или TGI: архитектура и конфиги для продакшн-инференса на GPU — 5 июля 2026 г. в 14:59:35.197
vLLM, Ollama или TGI: архитектура и конфиги для продакшн-инференса на GPU Переход от локального ollama run к промышленному разворачиванию LLM — это всегда выбор между удобством разработки и контролем над ресурсами. В DevOps-практике мы сталкиваемся с тремя основными игроками: vLLM (лидер по пропускной способности), Ollama (король developer experience) и TGI (оптимизированный движок от Hugging Face). Выбор зависит не от хайпа, а от метрик: токенов в секунду (tokens/sec), времени первого токена (TTFT), потребления VRAM и сложности оркестрации. vLLM внедряет PagedAttention для управления памятью видеокарты как виртуальную память в ОС. Это резко снижает фрагментацию и позволяет обслуживать больше одновременных запросов при том же объеме VRAM. Технология Continuous Batching динамически добавляет новые запросы на каждом шаге декодирования, не дожидаясь завершения текущих. Это критично для микросервисов с высокой конкурентностью. Однако vLLM требует тонкой настройки гиперпараметров (gpu_memory_utilization, max_num_seqs) и чувствителен к версиям CUDA и PyTorch. Ollama абстрагирует сложность, управляя моделями через OCI-реестры и предоставляя простой REST API. Идеально для прототипов, CI/CD пайплайнов тестирования или легковесных сервисов с низкими требованиями к QPS (Queries Per Second). Но в условиях пиковых нагрузок Ollama уступает vLLM в throughput из-за менее агрессивного батчинга и ограничений в настройке планировщика GPU. Зато он стабильнее держит квантованные модели GGUF «из коробки» без танцев с бубном над зависимостями. TGI (Text Generation Inference) оптимизирован для интеграции с экосистемой Hugging Face, поддерживает продвинутые методы квантования (AWQ, GPTQ, Bitsandbytes) и предоставляет встроенные метрики для Prometheus. Хорош, если ваша модель специфична или требует тонкой подгонки весов через LoRA адаптеры на лету. TGI тяжелее в деплое (требует Docker с GPU-драйверами и настройками cgroups), но дает прозрачность процесса инференса. Для корпоративных задач, где важна предсказуемость и мониторинг, архитектура обычно строится так: балансировщик трафика -> пул подов с vLLM/TGI -> слой кэширования промптов (Redis) -> база данных для логов аудита. Если же задача — дать разработчикам доступ к модели для экспериментов внутри корпоративной сети, Ollama на Proxmox-ноде закроет потребности быстрее всего. #AI #LLM #OpenSource #Infra

