RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | Grok 4.7 | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
IT и технологии · 6 октября 2026 г.
180B-модель на ноутбуке: POCKET-Darwin-180B ужимает Qwen3.8-Flash-Next до 111 ГБ и выда...
180B-модель на ноутбуке: POCKET-Darwin-180B ужимает Qwen3.8-Flash-Next до 111 ГБ и выдаёт 4 ток/с на RTX 5060 (8 ГБ VRAM, 32 ГБ RAM). Из 512 экспертов MoE активны 10 — llama.cpp подтягивает их с NVMe по требованию, вся модель в RAM не лезет. Сверху точечная замена 300 тензоров после дообучения. Качество то же: MMLU-Pro 87,65%, как у BF16. Минусы — 4 ток/с лишь для коротких ответов и 111 ГБ на NVMe.