RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | Claude Haiku 5.5 | GPT-6.1 Sol | DeepSeek-V4.1 | GLM-5.3 | Gemini 3.8
IT и технологии · 9 октября 2026 г.
Пока llama.cpp и vLLM тянут «всё на всём», в r/LocalLLaMA копится класс узких рантаймов...
Пока llama.cpp и vLLM тянут «всё на всём», в r/LocalLLaMA копится класс узких рантаймов под одну модель и одно железо. Аргумент простой: универсальность съедает скорость. DwarfStar (автор — antirez, создатель Redis) сам зовёт себя «намеренно узким, не универсальным GGUF-раннером» и гонит DeepSeek V4 Flash и Qwen3.8 Flash-Next на Mac и Strix Halo. Splash заточен под Apple silicon: в замерах авторов Qwen3.8-27B — 74 ток/с, до ×5,3 против llama.cpp на тех же весах. gufo живёт только на AMD Strix Halo — 60 ток/с на Qwen3.8 Flash-Next. На своей связке «модель+GPU» узкий движок выжимает больше. Цифры — заявления авторов в README.