Свет в конце туннеля кризиса памяти? — 3 апреля 2026 г. в 11:59:04.979
Свет в конце туннеля кризиса памяти? Google Research представила алгоритм TurboQuant, который сжимает рабочую память LLM до 3–4 бит, сокращая её потребление минимум в 6 раз и ускоряя работу до 8 раз — без потери точности. Тесты на моделях Gemma и Mistral подтвердили шестикратное снижение использования памяти даже в сложных задачах с длинным контекстом. В чём суть проблемы? Если бы LLM не использовала специального буфера, то при генерации каждого нового токена ей приходилось бы заново пересчитывать весь предыдущий контекст через механизм внимания. Чтобы не тратить время впустую, промежуточные векторы Key/Value сохраняются в KV-кэше. Однако его размер растёт линейно с длиной диалога и быстро упирается в ограничения доступной памяти. Из-за этого возникает потребность в увеличении объёма памяти, что, в свою очередь, ведёт к росту спроса и повышению стоимости оперативной памяти. Как алгоритм решает проблему? Он комбинирует два приёма: PolarQuant — преобразует декартовы координаты в полярные, что устраняет накладные расходы, ранее «съедавшие» до 2 битов на каждое число. QJL — добавляет всего 1 бит для математического подавления ошибок округления, сохраняя точность внимания. Результаты тестов • На моделях Gemma и Mistral: • Память под KV-кэш сократилась в 6 раз без падения качества. • На ускорителях H100 4‑битный TurboQuant ускорил вычисление логитов внимания до 8 раз по сравнению с 32‑битными ключами. • В бенчмарках типа «иголка в стоге сена» модель находила нужную информацию так же точно, как и без сжатия. Почему это важно прямо сейчас? Мы наблюдаем настоящий кризис памяти. Даже при росте вычислительных мощностей узким местом становятся пропускная способность и объём памяти. Каждый новый токен в длинном контексте требует хранения всё новых векторов ключей и значений. TurboQuant показывает, что можно снизить потребление памяти, не жертвуя интеллектом модели. Надеемся, что в ближайшее время алгоритм будет улучшен и доработан и предложенный подход поможет если не полностью решить кризис, то хотя бы существенно его смягчить. Проблема дефицита памяти и роста ее стоимости касается не только ИИ, но и других сфер IT, в том числе с этой проблемой столкнулись и наши заказчики, которые занимаются суперкомпьютерными вычислениями. Если вы занимаетесь HPC вычислениями или только планируете к ним приступить, то «Адванс Инжиниринг» готов спроектировать, развернуть и сопроводить кластер с полным циклом работ и дальнейшей передачей в эксплуатацию. Ускорение расчётов, снижение затрат на испытания, централизованная безопасность и контроль лицензий — всё это мы уже реализовываем для наших заказчиков. Источник: TurboQuant: Redefining AI Efficiency with Extreme Compression Другие наши ресурсы: ТГ|ВК|Дзен Сайт Адванс Инжиниринг

