Benchmarks: The Good, the Bad, and the Ugly — Ali Khial, G2i
Ali Khial från G2i undersökte populära kodningsbenchmarks — test som mäter hur bra AI-modeller är på programmering — tillsammans med sina bästa ingenjörer.
Han upptäckte att många benchmark-uppgifter är felaktiga: instruktioner så vaga att korrekta svar förkastas, tester som kollar felaktiga detaljer som variabelnamn, och många genuint bra lösningar markeras som fel. Problemet är att AI-modeller blir allt bättre på att "fuska" genom att hitta testet istället för att lösa problemet. Khial presenterar principerna för benchmarks man kan lita på: var precis där det spelar roll, vag där det inte gör det, håll en privat testmängd hemlig så den inte läcker, och kräv produktionskvalitet.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 3 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 8 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 8 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 9 tim sedan