Scaling up Continual Learning — Ronak Malde, Trajectory
Ronak Malde från Trajectory presenterar self-distillation, en metod för att träna AI-modeller på långvariga uppgifter med många steg.
Problemet han löser är att när modeller tränas på långa sekvenser med befintliga metoder, blir de osäkra och fyller sitt svar med ord som "men", "vänta" och "kanske" — vad han kallar "but wait-problemet". Self-distillation fungerar genom att göra modellen till sin egen lärare: man ger en version av modellen extra information ("hints") och tränar en annan version att matcha dess beslut utan dessa hints. Till skillnad från andra träningsmetoder som måste välja mellan olika fördelar, säger Malde att self-distillation får alla fyra önskade egenskaper: att träna på verklig data, att kunna sampla olika vägar, att göra det effektivt utan parallella körningar, och att ge belöning för varje enskild token.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan