RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | Gemini 4 Argon | GPT-6.1 Sol | Claude Sonnet 5.5 | GLM 5.3 | DeepSeek V4.1
IT и технологии · 23 сентября 2026 г.
GGUF-кванты llama.cpp теперь читает и transformers. Достаточно from_pretrained(gguf_fil...
GGUF-кванты llama.cpp теперь читает и transformers. Достаточно from_pretrained(gguf_file=...) — дальше обычный PyTorch-API. Тот же файл, что гоняет Ollama. Скорость подтянули ядрами ggml, на M2 Max вплотную к llama.cpp. Пока узко: packed-путь только Apple Silicon, Qwen3.5/3.8, кванты Q4_K_M–Q6_K. Остальное де-квантуется. Один GGUF живёт в обоих стеках.