llama.cpp выпустила версию 0.4.0. Теперь раз в несколько недель проект собирает накопле... — 5 сентября 2026 г. в 12:31:43.915
llama.cpp выпустила версию 0.4.0. Теперь раз в несколько недель проект собирает накопленное из ежедневных билдов в один релиз с обзором изменений. Что важного для тех, кто гоняет модели локально: 🔘 Новые архитектуры: Qwen3.8-Flash-Next (пока без оптимизаций), Nemotron-3-Puzzle 75B с 9 млрд активных, DSpark для Nemotron 3.5, nanbeige4.2-3B. 🔘 Разреженное flash attention для DeepSeek-V4, GLM и Qwen3.8-Flash-Next на CUDA и Metal. 🔘 Ленивое чтение тензоров --lazy-mode: большие таблицы эмбеддингов не грузятся в RAM целиком, а читаются через mmap по мере надобности (автоматически для тензоров больше 4 ГБ). Плюс убрали пик потребления памяти при загрузке модели. 🔘 У квантизатора появился потолок рабочей памяти --max-buffer-size, по умолчанию 8 ГБ. Раньше один большой тензор мог съесть всю оперативку. 🔘 Сервер: лимит контекста на слот --kv-unified-per-slot, чтобы параллельные запросы не делили одно окно как попало; видео на вход через --video-*; медиа можно передавать data:-ссылками; preserve_reasoning включён по умолчанию. 🔘 В ggml 0.23.0 появился Apple RDMA как транспорт для RPC между машинами. @neuro_channel

