BloggHugging Face
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
Hugging Face har uppdaterat sitt AsyncGRPOTrainer-verktyg (i version 1.14) så att det kan träna adaptrar — små tillägg till AI-modeller — istället för att träna hela modellen. De nya adaptrar är bara några megabyte stora och kan synkroniseras genom en lagringsbucket istället för mellan maskiner. En träningsjobb och två inference-servrar (vLLM) kan nu köra på helt separata maskiner. En liten proxyserver dirigerar varje begäran till rätt server och uppdaterar alla servrar när det finns nya adaptrar. I praktiken blev träningen fem gånger snabbare: från 3 timmar 27 minuter ned till 53 minuter för 500 steg.
10 sep. huggingface.co