Запустить 70B модель на одной видеокарте: 5 методов квантования
Запустить 70B модель на одной видеокарте: 5 методов квантования Модель 70B в FP16 требует ~140 ГБ. В 4-битном формате — всего 35 ГБ, что уже влезает на одну GPU. Но простое округление ломается из-за 0.1% выбросов, которые могут быть в 20 раз больше остальных значений. Каждый из пяти методов решает эту проблему по-своему: • RTN — округляет «в лоб», без калибровки. Дешево, но слабо при низкой разрядности. • GPTQ — квантует слой за слоем и корректирует ошибки на каждом шаге. • AWQ — находит 1% важных каналов и масштабирует их, сохраняя INT4. • LLM.int8() — оставляет выбросы в FP16, а остальное — в INT8. • QAT — встраивает округление в обучение, модель адаптируется заранее. Разница только в моменте обработки выбросов. Подробное исследование — в статье на arxiv.