Tokens Should Have Jobs — Katelyn Lesse & Angela Jiang, Anthropic
Forskare från Anthropic visar att det inte räcker att bara ge AI-agenter större tokenbuggetar (tokens är byggstenen i AI-svar).
Med en fast budget på 600 000 tokens presterade en agent som bara utförde uppgifter värre än en som använde tokens på smartare sätt: genom att fråga en rådgivare, genom att låta en bedömare granska resultaten iterativt, eller genom att agenten själv studerade tidigare försök. För finansiell analys räcker det ofta inte med ett svar som är 80 procent korrekt — en felaktig siffra gör hela resultatet oanvändbar. En enkel exekvering klarade bara 42 procent av testerna första försöket, vilket motsvarar ungefär 1,8 miljoner tokens totalt. Smartare strategier kunde nå samma kvalitet med färre tokens.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan
Can ‘super intelligence’ and a non-binding safety pact solve AI’s image problem?
TechCrunch AI för 14 tim sedan