Распознавание речи Многоязычие Low-resource
arXiv eess.AS

SraVaani 1.0: распознавание речи для 65 индийских языков и диалектов

arXiv:2608.08235

SraVaani 1.0 - масштабная работа по распознаванию речи для языков Индии, где интересен не очередной WER на хинди, а покрытие 65 языков и диалектов, включая 44 без официальных конкурирующих систем. Авторы строят модель с нуля на FastConformer и добавляют аудио-визуальное выравнивание из корпуса VAANI. Главный вклад - практическое расширение языкового покрытия в длинный хвост, где обычные коммерческие системы часто просто не заявляют поддержку.

Метод. Обучение идет в три этапа. Сначала FastConformer предобучается self-supervised на 28 418 часах неразмеченной речи VAANI. Затем кодировщик выравнивается с изображениями на 16 580 часах аудио-изображение пар через SigLIP-подобную контрастивную цель. На финальном этапе FastConformer-Hybrid TDT-CTC дообучается на объединенном многоязычном корпусе из 24 источников, 30 565 часов и BPE-словаре на 5000 единиц.

Результаты. На 17 языках, где есть хотя бы один baseline, средний WER SraVaani равен 28.4% против 30.2% у Indic Conformer, 33.9% у Sarvam Saaras v3 и 39.4% у Gemini 3 Flash. На отдельных языках выигрыш особенно заметен: Maithili 27.5% против 44-50%, Nepali 21.5% против 35.9-41.4. Для 32 языков из уникального набора средний WER составляет 50.2%, медиана 50.65%; Garo получает 9.5%, Mizo 25.3%, но Nyishi 93.9% и Sumi 78.5%.

Ограничения. Часть уникальных языков имеет очень маленькие тестовые split: авторы сами исключают все короче 0.1 часа, но 23 из 32 оставшихся все равно меньше 30 минут. Результаты на VAANI не полностью отвечают на вопрос о переносе на независимые домены. Длинный хвост остается сложным: для тибето-бирманских и племенных языков WER часто слишком высок для надежного продукта.

Фишка из статьи. Самый честный момент статьи - таблица уникальных языков: модель закрывает языки без официальных baseline, но качество там крайне неоднородно.

СравнениеЧислоЧто означает
17 языков с baselineMean WER 28.4%SraVaani лучше трех сравниваемых систем в среднем
Уникальные языки44 языка/диалектаНет официальной поддержки у выбранных baseline
32 показанных splitMean WER 50.2%Покрытие есть, но качество часто еще исследовательское
Garo / Mizo9.5% / 25.3%Сильный перенос для части малоресурсных языков
Nyishi / Sumi93.9% / 78.5%Граница применимости модели видна прямо в таблице

Как это читать: важно читать эту работу как инфраструктурный шаг: главное достижение не рекордный WER в среднем, а расширение набора языков с явным показом, где перенос уже работает, а где нет.

Оригинальная статья на arXiv