Scaling up Continual Learning — Ronak Malde, Trajectory
Ronak Malde från Trajectory presenterar self-distillation, en metod för att träna AI-modeller på långvariga uppgifter med många steg.
Problemet han löser är att när modeller tränas på långa sekvenser med befintliga metoder, blir de osäkra och fyller sitt svar med ord som "men", "vänta" och "kanske" — vad han kallar "but wait-problemet". Self-distillation fungerar genom att göra modellen till sin egen lärare: man ger en version av modellen extra information ("hints") och tränar en annan version att matcha dess beslut utan dessa hints. Till skillnad från andra träningsmetoder som måste välja mellan olika fördelar, säger Malde att self-distillation får alla fyra önskade egenskaper: att träna på verklig data, att kunna sampla olika vägar, att göra det effektivt utan parallella körningar, och att ge belöning för varje enskild token.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 3 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 8 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 8 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 9 tim sedan