Запуск больших языковых моделей на слабом железе — 11 июня 2026 г. в 08:04:09.634
Запуск больших языковых моделей на слабом железе AirLLM — это библиотека для оптимизации памяти при инференсе, позволяющая запускать 70-миллиардные модели на одном GPU с 4 ГБ видеопамяти и даже 405-миллиардную Llama 3.1 на 8 ГБ без квантования, дистилляции или прунинга. Проект поддерживает популярные архитектуры вроде Llama, Qwen, Mistral, Baichuan и ChatGLM, а также предоставляет опциональное 4/8-битное квантование для ещё большей экономии ресурсов. Встроенная функция сжатия на базе блочной квантизации ускоряет инференс до 3 раз с минимальной потерей точности, а с версии 2.10 добавлена поддержка CPU-инференса и нешардированных моделей. Библиотека распространяется с открытым исходным кодом, включает готовые примеры для Colab и позволяет запускать мощные LLM на потребительском оборудовании без сложной настройки. #ИИ @pcTeapot

