ASR Benchmark Multilingual
ASR benchmark

GigaSpeechBench: 680 часов real-world ASR вместо чистых high-resource тестов

680 h

GigaSpeechBench интересен не как ещё один большой ASR-бенчмарк, а как попытка проверить распознавание там, где современные speech LLM обычно выглядят хуже, чем на аккуратных high-resource тестах: low-resource языки, диалекты, акценты, терминология, детская и пожилая речь. Авторы собрали 680 часов человечески размеченной речи и явно разложили benchmark на модули, чтобы можно было видеть не только средний WER, но и конкретный тип провала модели.

Метод. Вместо одного общего test set авторы делают пять блоков: 12 low-resource языков Ближнего Востока и Юго-Восточной Азии плюс сложные японский/корейский, 6 китайских диалектов, 6 английских акцентов, 12 доменных словарей для китайского и английского, а также речь детей и пожилых людей. Для 11 языков дополнительно даны человеческие переводы на китайский и английский, поэтому набор можно использовать и для automatic speech translation. Важная инженерная деталь: речь в GigaSpeechBench в основном spontaneous, а не read speech, поэтому benchmark бьёт по устойчивости к реальным темпам, запинкам и доменным словам.

Результаты. На low-resource части лучшие модели всё равно показывают большой разброс. Например, Qwen3.5-Omni-Plus получает WER 9.92 на корейском, 9.63 на вьетнамском и 10.76 на тайском, но 44.22 на алжирском арабском и 51.34 на марокканском арабском. Whisper Large v3 на этих же арабских вариантах уходит в 68.41 и 91.89 WER. Это не просто “одна модель лучше другой”: таблицы показывают, что качество резко зависит от языка, варианта и домена, а агрегированный leaderboard легко скрывает такие разрывы.

Ограничения. Бенчмарк полезен как диагностический инструмент, но он не решает проблему репрезентативности целиком: 680 часов распределены по многим срезам, поэтому отдельные языки и домены остаются ограниченными по объёму. Кроме того, результаты в статье в первую очередь показывают zero/few-shot поведение конкретных speech LLM и ASR-систем; перенос выводов на production ASR требует проверки на своих микрофонах, шумах, словарях и политиках нормализации.

Фишка из статьи. Самое полезное в GigaSpeechBench — модульная структура: авторы заранее закладывают причины деградации, а не только сообщают один общий WER. Это позволяет отделять “модель не знает язык” от “модель знает язык, но ломается на диалекте, возрасте или терминологии”.

МодульПокрытиеОбъём на единицуЧто проверяет
Low-resource / сложные языки14 языков/вариантов20 часовЯзыковая устойчивость вне high-resource ASR
Китайские диалекты6 вариантов10 часовДиалектную фонетику и лексику
Английские акценты6 акцентов10 часовRobustness к accent shift
Терминология12 доменов20 часовСлова, которые часто теряются в обычном WER
Возрастдети и пожилые10 часовНесовпадение с adult speech

Как это читать: benchmark ценен тем, что превращает “модель ошибается” в диагностируемый профиль ошибок. Для инженера ASR это ближе к acceptance-тесту по рискам, чем к академическому single-number leaderboard.

Оригинальная статья на arXiv