Are LLM Performance Benchmarks Reliable? — Ashok Chandrasekar & Jason Kramberger, Google
Två Google-ingenjörer kunde inte återskapa andra forskares prestandatester för AI-modeller och upptäckte varför: benchmark-verktygen mäter ofta fel.
Ett verktyg kan säga att det skickade 200 förfrågningar per sekund när det bara skickade 38. Pythons sätt att köra kod gör det svårt att köra flera tester samtidigt. Ibland mäter själva testverktyget så långsamt att det ser ut som om servern är långsam, fast den är fin. Google byggde då Inference Perf, ett nytt testverktyg som kan köra riktiga arbetsbelastningar på ett korrekt sätt och hålla reda på vad som faktiskt hände jämfört med vad som var planerat.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan
Can ‘super intelligence’ and a non-binding safety pact solve AI’s image problem?
TechCrunch AI för 14 tim sedan