⚙️ AirLLM — 29 августа 2026 г. в 10:01:26.967
⚙️ AirLLM 👁️ Библиотека для запуска крупных LLM на видеокартах с небольшим объёмом VRAM без квантования, дистилляции и обрезки весов. AirLLM загружает модель в память послойно, а для MoE-моделей передаёт в VRAM только нужных экспертов. Благодаря этому объём требуемой памяти зависит от размера отдельного слоя, а не всей модели. Поддерживаются Llama, Qwen, DeepSeek, Mistral и Gemma, а блочное сжатие может ускорить инференс до 3 раз. ❗ Подойдёт разработчикам и энтузиастам, которые хотят запускать большие модели локально на Linux или Apple Silicon без мощной видеокарты. Проверить в деле tags: #утилиты #ии 🧭 @recura_tech

