Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
Bild från huggingface.co
Hugging Face visar hur man kan träna upp en liten AI-modell (350 miljoner parametrar) att ge bättre strukturerade utdata, som giltig JSON.
Genom att använda en träningsmetod som kallas GRPO och bara omkring 500 träningsexempel och 100 steg kunde modellen förbättras från 22,6 procent till 29,7 procent på IFStruct-testet. Det viktigaste var att få modellen att producera giltig JSON-kod — andelen korrekta JSON-svar steg från 18 procent till nästan 32 procent. Metoden är billig och passar på gratis GPU-resurser, och visar att även små modeller kan bli tillräckligt pålitliga för verklig användning om man tränar dem rätt.
A short GRPO run with about 500 samples and 100 steps can lift a small 350M parameter model from 22.6% to 29.7% on IFStruct.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.
Mer från Hugging Face
IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Hugging Face för 5 tim sedan
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 8 sep.
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 44 min sedan
v2.1.267
Claude Code för 53 min sedan