LLM на нескольких GPU: почему памяти мало даже у H100 и H200
LLM на нескольких GPU: почему памяти мало даже у H100 и H200 Для LLM одной ёмкости VRAM недостаточно: при работе важны ещё KV-кеш, сеть между GPU и разделение prefill и decode. В материале AezaTyan показано, что у модели 70B в BF16 только веса занимают около 140 ГБ, поэтому NVIDIA H100 с 80 ГБ HBM3 сюда не вмещается, а у H200 с 141 ГБ HBM3e после весов почти не остаётся места под кеш. У B200 с 180 ГБ HBM3e запас больше, но и он зависит от контекста. Автор отдельно разбирает нагрузку на KV-кеш: для Llama 3.1 70B один токен требует около 320 КБ, а диалог на 128 тысяч токенов — уже около 43 ГБ. При этом prefill заполняет кеш разом, а decode выдаёт ответ по одному токену, поэтому задержки и требования к железу надо смотреть раздельно; MLCommons тоже измеряет TTFT и TPOT отдельно. Практический вывод простой: при проектировании инференса смотрят не только на GPU, но и на объём памяти, пропускную способность и топологию. Tensor parallelism особенно чувствителен к сети, а Dynamo умеет выгружать KV-кеш в RAM и на локальный диск. Это полезно при планировании кластера и выборе между одной мощной картой и распределённой схемой. Источник: Habr Computer Hardware RU — https://habr.com/ru/articles/1089766/