Обновления в архитектуре LLaMA 3.1
Обновления в архитектуре LLaMA 3.1 Llama 3 использует стандартную архитектуру трансформера, но с рядом улучшений. Например, технология Grouped Query Attention (GQA) теперь применяется во всех моделях LLaMA 3.1, а не только в версиях с 34B+. Это позволило ускорить вывод и сократить объём данных для кеширования. Контекстное окно увеличено до 128 тысяч токенов благодаря росту гиперпараметра базовой частоты RoPE до 500 тысяч, что улучшает работу с большими текстами. Разработчики также внедрили четырёхмерный параллелизм (4D Parallelism), который включает тензорный, пайплайновый, контекстный и параллелизм данных. Это помогло эффективнее использовать ресурсы при обучении на тысячах GPU. Кроме того, в архитектуре активно используется FP8-квантизация, которая ускоряет вычисления без значительных потерь в точности, позволяя экономить до 50% времени.