Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Are LLM Performance Benchmarks Reliable? — Ashok Chandrasekar & Jason Kramberger, Google

Två Google-ingenjörer kunde inte återskapa andra forskares prestandatester för AI-modeller och upptäckte varför: benchmark-verktygen mäter ofta fel.

Ett verktyg kan säga att det skickade 200 förfrågningar per sekund när det bara skickade 38. Pythons sätt att köra kod gör det svårt att köra flera tester samtidigt. Ibland mäter själva testverktyget så långsamt att det ser ut som om servern är långsam, fast den är fin. Google byggde då Inference Perf, ett nytt testverktyg som kan köra riktiga arbetsbelastningar på ett korrekt sätt och hålla reda på vad som faktiskt hände jämfört med vad som var planerat.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa