Локальная GLM-5.3-Flash стала быстрее в 1,6–3,3 раза: Unsloth дописали свой pull reques... — 5 сентября 2026 г. в 04:19:13.843
Локальная GLM-5.3-Flash стала быстрее в 1,6–3,3 раза: Unsloth дописали свой pull request в llama.cpp, ускорили декодирование и добавили поддержку MTP, предсказания нескольких токенов за шаг. Ничего докачивать не нужно, кванты те же, что и неделю назад: в Unsloth Desktop достаточно обновиться, в llama.cpp собрать их ветку по гайду. Прирост растёт с длиной контекста, графики на картинке. На коротких промптах ускорение до 1,6 раза, на 64 тысячах токенов ещё без MTP скорость выросла больше чем вдвое. С MTP лучший вариант два черновых токена, при трёх и пяти скорость снова падает. Требования не изменились: 1-битный квант в 100 ГБ памяти, 3-битный в 128 ГБ, как у Mac Studio или DGX Spark. @neuro_channel

