GLM-5.3-Flash теперь можно запустить у себя: Unsloth выложили динамические GGUF-кванты ... — 27 августа 2026 г. в 16:55:51.236
GLM-5.3-Flash теперь можно запустить у себя: Unsloth выложили динамические GGUF-кванты и гайд под llama.cpp и свой десктоп. Полная модель в BF16 весит 642 ГБ, 1-битный квант ужат до 93 ГБ и сохраняет 71% точности, 3-битный на 120 ГБ держит 82%, 4-битный на 200 ГБ уже 93%. То есть 1 бит влезает в 100 ГБ памяти (RAM плюс VRAM), 3 бита в 128 ГБ, ровно как у Mac Studio или DGX Spark. Самый короткий путь: curl -fsSL https://unsloth.ai/install.sh | sh, потом unsloth run --model unsloth/GLM-5.3-Flash-GGUF:UD-IQ3_XXS, дальше Unsloth сам разложит слои по GPU и оперативке и подберёт параметры. Через llama.cpp пока нужна их ветка glm5next/upstream из форка unslothai (в апстрим ещё не влили), потом hf download unsloth/GLM-5.3-Flash-GGUF --include "*UD-IQ3_XXS*" и llama-cli с --temp 1.0 --top-p 0.95. Уровень рассуждений задаётся через --chat-template-kwargs '{"reasoning_effort":"max"}', есть low, high и max, по умолчанию max. Контекст до 1 млн токенов. MoE, 18 млрд активных из 320, так что после загрузки в память крутится она шустро. Веса и таблицу квантов забирать на HF и в доках. @neuro_channel

