DeepSeek-V3: ключевые технологии и результаты тестирования
DeepSeek-V3: ключевые технологии и результаты тестирования Продолжаем изучать технический отчёт о DeepSeek-V3. В этой части рассмотрим методы предсказания токенов, квантизации и распределения работы модели. Метод Multi-Token Prediction (MTP) позволяет предсказывать несколько токенов одновременно: эмбеддинг после трансформерных слоёв отправляется в дополнительный блок, где формируется новое представление для предсказания токенов. Pipeline parallelism распределяет слои модели по разным устройствам, но создаёт «пузыри» — периоды простоя устройств. DeepSeek-V3 решает эту проблему с помощью метода DualPipe, разделяя forward и backward на четыре части и регулируя ресурсы GPU для минимизации задержек. FP8-квантизация не всегда эффективна для больших моделей, поэтому разработчики применили блочную квантизацию: для весов использовались блоки 128x128, а для активаций — 1x128. В результате DeepSeek-V3 демонстрирует высокие результаты в бенчмарках: на MMLU модель набирает 88,5 процентных пункта, а в математических задачах становится абсолютным лидером.