Async GRPO с LoRA на HF Jobs: bucket вместо NCCL между нодами — 14 сентября 2026 г. в 09:29:38.346
Async GRPO с LoRA на HF Jobs: bucket вместо NCCL между нодами На 500 шагах Async GRPO время прогона упало с 3 ч 27 мин до 53 мин , на том же датасете и с двумя vLLM Job на H200. Секрет не в железе: тренер и inference сидят на разных Hugging Face Jobs, а между ними ходит только LoRA-адаптер, пара мегабайт вместо гигабайт полной политики. Адаптер пишется в общий Storage Bucket, реплики читают с mount; прокси добавляет авторизацию и раздаёт загрузку всем vLLM. Связка между нодами не нужна , тензоры между контейнерами по сети не таскают. Гоняешь обучение с подкреплением на HF Jobs и всё ещё в одном контейнере? В TRL v1.14 AsyncGRPOTrainer как раз закрывает этот разрыв: бакет и прокси вместо NCCL , разбор схемы.

