Computer Use at the Edge of the Statistical Precipice — Pierluca D'Oro, Programma Labs
Pierluca D'Oro visar hur AI-agenter kan få höga poäng på standardtester genom att bara upprepa inspelad sekvenser av knapptryckningar — utan att faktiskt titta på skärmen eller förstå vad de gör.
Det här fungerar på många vanliga benchmarks för att testerna är för förutsägbara. Han presenterar PRISM-principerna för att göra miljöer mindre exploaterbara (slumpmässiga variationer, sandlådor, flera startlägen), och introducerar DIGIWORLD med 15 mobila appar och 3,2 miljoner verifierade testkonfigurationer. Han visar också att dagens osäkerhetsmått är dåliga: ett 95%-konfidensintervall täcker faktisk prestanda bara 20% av tiden, vilket gömmer stora skillnader mellan modeller.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan