Benchmarking Coding Agents on New vs Legacy Codebases — Denys Linkov, Wisedocs
Wisedocs processade medicinska anspråk genom tio olika kodrepon som ingen ville röra vid.
Denys Linkovs team spenderade sex månader på att slå ihop det till ett enda repo, och han benchmarkade om de borde ha väntat på bättre AI-modeller istället. En refaktoringsuppgift tog tre timmar med o3-modellen och resulterade i tio stora fel, medan nyare modeller som Sonnet 4.6 och Opus 4.8 klarade det snabbare och med färre misstag. Men när man gav GPT 5.5 hela jobbet på en gång skrev den 2 000 rader kod på 10 minuter som mest var skalet utan själva funktionerna — något modellen själv erkände. Linkov drar slutsatsen att att göra jobbet direkt var värt det: kodroller öppnades för commits, arbete som tog månader tar nu en vecka, och utvecklare från andra delar av företaget hjälper till frivilligt nu.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 6 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 6 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 7 tim sedan