Методы квантования LLM, которые я бы изучил, если бы мне нужно было запустить модель 70... — 23 июля 2026 г. в 09:31:01.113
Методы квантования LLM, которые я бы изучил, если бы мне нужно было запустить модель 70B на одной GPU: 70B в FP16 — ~140 ГБ весов; в 4 битах — 35 ГБ, уже одна GPU. Проблема — ~0,1% скрытых размерностей со значениями до 20× выше остальных. Пять решений по этапам: 1. RTN: округляет без калибровки — дёшево, но слабо при низкой разрядности. 2. GPTQ: послойно, по столбцам квантует и компенсирует ошибку в оставшихся весах. 3. AWQ: до округления масштабирует ~1% важных каналов; итог — INT4. 4. LLM.int8(): выбросы — FP16, 99,9% параметров — INT8; затем результаты объединяются. 5. QAT: округление в каждом forward pass, адаптация при дообучении. Итог — точность ниже; разница — в этапе. Схема — итог, статья — детали. Полезные ссылки: — Ссылка: https://arxiv.org/abs/2411.02530 Источник: @vibecoding_tg — https://t.me/vibecoding_tg/3554 #RealVibe #AI #AI_Новости