GigaSpeechBench: 680 часов real-world ASR вместо чистых high-resource тестов
GigaSpeechBench интересен не как ещё один большой ASR-бенчмарк, а как попытка проверить распознавание там, где современные speech LLM обычно выглядят хуже, чем на аккуратных high-resource тестах: low-resource языки, диалекты, акценты, терминология, детская и пожилая речь. Авторы собрали 680 часов человечески размеченной речи и явно разложили benchmark на модули, чтобы можно было видеть не только средний WER, но и конкретный тип провала модели.
Метод. Вместо одного общего test set авторы делают пять блоков: 12 low-resource языков Ближнего Востока и Юго-Восточной Азии плюс сложные японский/корейский, 6 китайских диалектов, 6 английских акцентов, 12 доменных словарей для китайского и английского, а также речь детей и пожилых людей. Для 11 языков дополнительно даны человеческие переводы на китайский и английский, поэтому набор можно использовать и для automatic speech translation. Важная инженерная деталь: речь в GigaSpeechBench в основном spontaneous, а не read speech, поэтому benchmark бьёт по устойчивости к реальным темпам, запинкам и доменным словам.
Результаты. На low-resource части лучшие модели всё равно показывают большой разброс. Например, Qwen3.5-Omni-Plus получает WER 9.92 на корейском, 9.63 на вьетнамском и 10.76 на тайском, но 44.22 на алжирском арабском и 51.34 на марокканском арабском. Whisper Large v3 на этих же арабских вариантах уходит в 68.41 и 91.89 WER. Это не просто “одна модель лучше другой”: таблицы показывают, что качество резко зависит от языка, варианта и домена, а агрегированный leaderboard легко скрывает такие разрывы.
Ограничения. Бенчмарк полезен как диагностический инструмент, но он не решает проблему репрезентативности целиком: 680 часов распределены по многим срезам, поэтому отдельные языки и домены остаются ограниченными по объёму. Кроме того, результаты в статье в первую очередь показывают zero/few-shot поведение конкретных speech LLM и ASR-систем; перенос выводов на production ASR требует проверки на своих микрофонах, шумах, словарях и политиках нормализации.
Фишка из статьи. Самое полезное в GigaSpeechBench — модульная структура: авторы заранее закладывают причины деградации, а не только сообщают один общий WER. Это позволяет отделять “модель не знает язык” от “модель знает язык, но ломается на диалекте, возрасте или терминологии”.
| Модуль | Покрытие | Объём на единицу | Что проверяет |
|---|---|---|---|
| Low-resource / сложные языки | 14 языков/вариантов | 20 часов | Языковая устойчивость вне high-resource ASR |
| Китайские диалекты | 6 вариантов | 10 часов | Диалектную фонетику и лексику |
| Английские акценты | 6 акцентов | 10 часов | Robustness к accent shift |
| Терминология | 12 доменов | 20 часов | Слова, которые часто теряются в обычном WER |
| Возраст | дети и пожилые | 10 часов | Несовпадение с adult speech |
Как это читать: benchmark ценен тем, что превращает “модель ошибается” в диагностируемый профиль ошибок. Для инженера ASR это ближе к acceptance-тесту по рискам, чем к академическому single-number leaderboard.