Measuring benchmark optimization in speech recognition
Bild från huggingface.co
Hugging Face presenterar en studie om hur taligenköppningsmodeller (ASR-modeller som skriver ut vad människor säger) ofta optimeras för att klara specifika testset snarare än att transkribera tal noggrant.
Forskarna testade 11 populära modeller och upptäckte att flera av de högsta rankade systemeten reproducerade felaktiga referenstranskriberingar från dataseten VoxPopuli och LibriSpeech – även när ljud motsade detta. Modellerna verkar använda akustiska ledtrådar för att känna igen vilket benchmark de testas på, vilket får deras prestationssiffror att se bättre ut än de faktiskt är. Genom att testa med nya röster och tysade tal kunde forskarna visa att modellerna ofta började transkribera korrekt när de inte kunde identifiera datasetet.
Our latest research introduces three tests to help quantify it. We evaluated 11 widely used open-source ASR models and found that several of the highest-scoring systems reproduced benchmark transcripts from the VoxPopuli English and LibriSpeech (clean, other) datasets – even when the audio contradicted them, relevant w
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.
Mer från Hugging Face
IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Hugging Face för 6 tim sedan
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 8 sep.
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
v2.1.267
Claude Code för 2 tim sedan