RAG | Нейросети | ИИ | AI | Агенты | GPT-6 Sol | Claude Opus 5.5 | Mistral Large 4 | Gemini 4 Argon | Grok 4.7 | DeepSeek V4
IT и технологии · 13 августа 2026 г.
vLLM тащит venv с torch и CUDA-библиотеками на 9 ГБ до первого токена. Команда LocalAI ...
vLLM тащит venv с torch и CUDA-библиотеками на 9 ГБ до первого токена. Команда LocalAI переписала движок на C++20: vllm.cpp — один бинарь 66 МБ, без Python и PyTorch. Paged KV-кэш и continuous batching на месте, бэкенды CUDA и Metal. Apache 2.0, пока альфа. На Qwen3.6-27B уже не медленнее vLLM, а места занимает в 140 раз меньше.