Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL

Artikelbild eller återanvändbart omslag för Hugging Face

Hugging Face har uppdaterat sitt AsyncGRPOTrainer-verktyg (i version 1.14) så att det kan träna adaptrar — små tillägg till AI-modeller — istället för att träna hela modellen.

De nya adaptrar är bara några megabyte stora och kan synkroniseras genom en lagringsbucket istället för mellan maskiner. En träningsjobb och två inference-servrar (vLLM) kan nu köra på helt separata maskiner. En liten proxyserver dirigerar varje begäran till rätt server och uppdaterar alla servrar när det finns nya adaptrar. I praktiken blev träningen fem gånger snabbare: från 3 timmar 27 minuter ned till 53 minuter för 500 steg.

AsyncGRPOTrainer can now train a LoRA adapter and sync only that adapter to vLLM (TRL v1.14).
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.

Mer att läsa