RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | DeepSeek | Qwen 27B | GLM-5.3 | Kimi K3 | GPT-6 Astra
IT и технологии · 25 сентября 2026 г.
Две старенькие RTX 3060 12 ГБ тянут Qwen3.8-27B в OpenCode. Из коробки на 128K выходит ...
Две старенькие RTX 3060 12 ГБ тянут Qwen3.8-27B в OpenCode. Из коробки на 128K выходит ~9 ток/с, агент еле дышит. Три флага llama.cpp меняют картину: tensor split, Q8 KV-кэш и встроенный MTP. Итог ×3.17 на 120K, в живой сессии 39.6 ток/с. Глубину MTP подбирали по реальной работе: синтетика советовала n=1, а OpenCode быстрее с n=3. Код и промпты остаются у тебя.