Measuring benchmark optimization in speech recognition
Artikelbild eller återanvändbart omslag för Hugging Face
Hugging Face presenterar en studie om hur taligenköppningsmodeller (ASR-modeller som skriver ut vad människor säger) ofta optimeras för att klara specifika testset snarare än att transkribera tal noggrant.
Forskarna testade 11 populära modeller och upptäckte att flera av de högsta rankade systemeten reproducerade felaktiga referenstranskriberingar från dataseten VoxPopuli och LibriSpeech – även när ljud motsade detta. Modellerna verkar använda akustiska ledtrådar för att känna igen vilket benchmark de testas på, vilket får deras prestationssiffror att se bättre ut än de faktiskt är. Genom att testa med nya röster och tysade tal kunde forskarna visa att modellerna ofta började transkribera korrekt när de inte kunde identifiera datasetet.
Our latest research introduces three tests to help quantify it. We evaluated 11 widely used open-source ASR models and found that several of the highest-scoring systems reproduced benchmark transcripts from the VoxPopuli English and LibriSpeech (clean, other) datasets – even when the audio contradicted them, relevant w
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 10 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan