🧠 Локальные LLM сжимаются до 4 ГБ — 15 июля 2026 г. в 10:06:15.722
🧠 Локальные LLM сжимаются до 4 ГБ PrismML сжала модель класса 27B через 1-bit quantization: с ~54 ГБ до 3.8–3.9 ГБ. При таком сжатии модель сохраняет около 90% качества оригинала. Это открывает дорогу для запуска не только на серверах, но и на ноутбуках, в браузере и на смартфонах. Доступна и более качественная версия — Ternary Bonsai 27B: ~5.9 ГБ и до 95% качества baseline. Поддерживаемые возможности: - Мультимодальность - Reasoning - Кодинг - Tool calling - Агентные сценарии Техническая деталь: для Bonsai уже сделали WebGPU demo с кастомными kernel'ами — модель запускается прямо в браузере. Часть WebGPU-кода помогали писать Fable 5 и GPT 5.6 Sol. HF Collection: https://huggingface.co/collections/prism-ml/bonsai-27b WebGPU Demo: https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels 🧠 Нейросети и Технологии. Подписаться

