Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unif...
Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design Kunlun: Establishing Scaling Laws for Massive‐Scale Recommendation Systems [1/2] Сегодня приступаем к разбору статьи, в которой Meta* обращает внимание на вопросы масштабирования моделей и эффективного использования GPU для задач рекомендательных систем. Начнём с предпосылок и овервью. Авторы замечают, что в отличие от LLM, где все фичи представляют собой последовательности токенов, в RecSys сочетаются как контекстные фичи (соцдем пользователя, метаданные документа и прочее), так и фичи-последовательности (поведение пользователя). Отказ от использования контекстных фичей зачастую приводит к снижению ключевых для бизнеса метрик. Поэтому приходится искать архитектуры, учитывающие оба типа фичей и позволяющее им эффективно взаимодействовать. При попытке масштабировать подобные модели возникают два главных боттлнека: 1) неэффективные блоки в моделях, которые утилизируют только 3-15% вычислительных возможностей GPU (Model FLOPs Utilization, MFU) в сравнении с 40-60% для LLM; 2) неэффективное распределение ресурсов при масштабировании (равномерное повышение ресурсов по всем частям модели неоптимально, вместо этого надо точечно повышать сложность отдельных модулей). В качестве решения авторы предлагают совместный (co-design) подход к повышению эффективности, сочетающий низкоуровневые оптимизации (по отдельным блокам) и высокоуровневое управление ресурсами (какие именно части системы усиливать). Свой подход они применяют к архитектуре модели, работающей с контекстными фичами и последовательностями. В основе архитектуры Kunlun лежат три основные работы (хотя авторы указывают в числе референсов больше статей): - Wukong — предлагает способ взаимодействия высокого порядка между контекстными фичами, но не работает с последовательностями; - HSTU — хорошо работает с последовательностями, но почти не умеет с контекстом; - Interformer — предыдущая попытка объединить контекстные фичи и последовательности, которая оказалась не очень эффективной на GPU. Дальше — подробнее об архитектуре и масштабировании. @RecSysChannel Разбор подготовил ❣ Артём Ваншулин ___ Компания Meta признана экстремистской; её деятельность в России запрещена. Summary материалов: - Wukong: В статье рассматривается архитектура Wukong для рекомендательных систем, которая позволяет улавливать сложные взаимодействия признаков высокого порядка. Используется серия последовательно расположенных факторизационных машин (Factorization Machines, FMB). Модель демонстрирует плавное масштабирование качества в зависимости от размера датасета, объёма вычислений (GFLOP) и ограничений по параметрам. На шести общедоступных датасетах модель по метрике AUC почти везде превосходит другие решения. - HSTU: В статье предлагается переформулировать задачу рекомендации в генеративной постановке. Для этого данные представляются в виде последовательности событий, вещественные фичи выкидываются, и формируется единая последовательность из взаимодействий с айтемами и событий изменения статической информации. Архитектура для генерации кандидатов похожа на SASRec или Pinnerformer. Для ранжирования используется чередование токенов айтемов и действий. Авторы не учат единую модель сразу на генерацию кандидатов и ранжирование, а обучают две отдельные - Interformer: В статье предлагается модуль InterFormer для обучения взаимодействию между разнородными данными в системах прогнозирования CTR. InterFormer обеспечивает двунаправленный поток информации для взаимовыгодноного обучения между различными режимами данных. Для избежания агрессивной агрегации информации в InterFormer сохраняется полная информация в каждом режиме данных и используется отдельная структура для эффективного выбора и суммирования Источник: оригинальный пост