VideoAI Engineer
Scaling to Long Horizons — Ross Taylor & Chengxi Taylor, General Reasoning
Ross Taylor och Chengxi Taylor från General Reasoning diskuterar hur man tränar AI-agenter som kan hålla fokus och fungera väl över längre tidsperioder — timmar snarare än sekunder. De förklarar tekniker som värdemodeller (som hjälper AI:n att förstå vilka val som leder långsiktigt) och bootstrapping (att dra ut användbar signal från få belöningar). De visar konkret hur frontier-modeller misslyckades när de gavs riktiga pengar för att handla fotbollsmatcher, vilket avslöjade att miljön som AI:n tränade i inte var realistisk nog. Poängen är att för att lyckas med långa horizonter behövs inte bara större context-fönster utan framför allt bättre och mer simulerade miljöer att träna i.
31 juli youtube.com