Вот это парадокс 🤯 — 26 августа 2026 г. в 10:28:01.960
Вот это парадокс 🤯 Команда Multiverse Computing сделала невозможное: они взяли языковую модель, сжали её до 4 бит точности — и она стала работать ЛУЧШЕ оригинальной 16-битной версии. Как так? Когда обычно сжимают модель — выкидывают слои, нейроны, головы. Качество падает. Ожидаемо. Раньше был единственный выход — переобучать в режиме квантизации. Но это дорого, нестабильно и занимает вечность. Что сделали они (метод QAH): Вместо того чтобы спасать то, что осталось после сжимания, они пошли другим путём. Взяли оригинальную большую модель как учителя. Урезанную архитектуру в 4 битах — как ученика. И обучают ученика напрямую у учителя. Несоответствие архитектур? Не проблема — решается через KL-дивергенцию на логитах. Цифры на цепочке GPT-OSS 120B → сжатие до 60B → восстановление → QAH: • Длинный контекст (AA-LCR): 35.3 → 42.7 • Математика (AIME 2025): 70.7 → 76.3 • Кодирование (Aider): 38.2 → 40.9 QAH обходит 16-битный чекпоинт на 7 из 9 бенчмарков. Против оригинального 120B учителя — выигрывает LiveCodeBench, уступает всего 1.6 балла на GPQA. А вот где совсем красиво: QAT (старый метод) выходит на пиковую точность на шаге ~700. QAH — те же показатели, но за ~100 шагов. В семь раз быстрее. И главное: QAT к шагу 1200 начинает деградировать — теряет 19 баллов. QAH держит стабильность. Что это значит на практике: Берёте большую дорогую модель. Выкидываете половину весов. Сжимаете оставшееся в 4 бита. Получаете систему, которая быстрее, легче и точнее оригинала. Экономия памяти — примерно 4x. Вычислений на токен — примерно 2x меньше. Контекст до 32k токенов. Привычная логика говорит: сжатие — это компромисс, жертва качеством ради скорости. QAH ломает эту логику. Сжатие здесь не финал, а ещё один этап обучения. Модель не просто теряет точность — она переучивается работать в новом формате эффективнее. Квантизация из налога на качество превращается в инструмент оптимизации. Это не магия — это другой угол на задачу. А что вы думаете об этом? Пишите в комментариях!

