Scaling to Long Horizons — Ross Taylor & Chengxi Taylor, General Reasoning
Ross Taylor och Chengxi Taylor från General Reasoning diskuterar hur man tränar AI-agenter som kan hålla fokus och fungera väl över längre tidsperioder — timmar snarare än sekunder.
De förklarar tekniker som värdemodeller (som hjälper AI:n att förstå vilka val som leder långsiktigt) och bootstrapping (att dra ut användbar signal från få belöningar). De visar konkret hur frontier-modeller misslyckades när de gavs riktiga pengar för att handla fotbollsmatcher, vilket avslöjade att miljön som AI:n tränade i inte var realistisk nog. Poängen är att för att lyckas med långa horizonter behövs inte bara större context-fönster utan framför allt bättre och mer simulerade miljöer att träna i.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan