Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
Artikelbild eller återanvändbart omslag för Hugging Face
Hugging Face har uppdaterat sitt AsyncGRPOTrainer-verktyg (i version 1.14) så att det kan träna adaptrar — små tillägg till AI-modeller — istället för att träna hela modellen.
De nya adaptrar är bara några megabyte stora och kan synkroniseras genom en lagringsbucket istället för mellan maskiner. En träningsjobb och två inference-servrar (vLLM) kan nu köra på helt separata maskiner. En liten proxyserver dirigerar varje begäran till rätt server och uppdaterar alla servrar när det finns nya adaptrar. I praktiken blev träningen fem gånger snabbare: från 3 timmar 27 minuter ned till 53 minuter för 500 steg.
AsyncGRPOTrainer can now train a LoRA adapter and sync only that adapter to vLLM (TRL v1.14).
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan