Computer Use at the Edge of the Statistical Precipice — Pierluca D'Oro, Programma Labs
Pierluca D'Oro visar hur AI-agenter kan få höga poäng på standardtester genom att bara upprepa inspelad sekvenser av knapptryckningar — utan att faktiskt titta på skärmen eller förstå vad de gör.
Det här fungerar på många vanliga benchmarks för att testerna är för förutsägbara. Han presenterar PRISM-principerna för att göra miljöer mindre exploaterbara (slumpmässiga variationer, sandlådor, flera startlägen), och introducerar DIGIWORLD med 15 mobila appar och 3,2 miljoner verifierade testkonfigurationer. Han visar också att dagens osäkerhetsmått är dåliga: ett 95%-konfidensintervall täcker faktisk prestanda bara 20% av tiden, vilket gömmer stora skillnader mellan modeller.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan