SraVaani 1.0: распознавание речи для 65 индийских языков и диалектов
SraVaani 1.0 - масштабная работа по распознаванию речи для языков Индии, где интересен не очередной WER на хинди, а покрытие 65 языков и диалектов, включая 44 без официальных конкурирующих систем. Авторы строят модель с нуля на FastConformer и добавляют аудио-визуальное выравнивание из корпуса VAANI. Главный вклад - практическое расширение языкового покрытия в длинный хвост, где обычные коммерческие системы часто просто не заявляют поддержку.
Метод. Обучение идет в три этапа. Сначала FastConformer предобучается self-supervised на 28 418 часах неразмеченной речи VAANI. Затем кодировщик выравнивается с изображениями на 16 580 часах аудио-изображение пар через SigLIP-подобную контрастивную цель. На финальном этапе FastConformer-Hybrid TDT-CTC дообучается на объединенном многоязычном корпусе из 24 источников, 30 565 часов и BPE-словаре на 5000 единиц.
Результаты. На 17 языках, где есть хотя бы один baseline, средний WER SraVaani равен 28.4% против 30.2% у Indic Conformer, 33.9% у Sarvam Saaras v3 и 39.4% у Gemini 3 Flash. На отдельных языках выигрыш особенно заметен: Maithili 27.5% против 44-50%, Nepali 21.5% против 35.9-41.4. Для 32 языков из уникального набора средний WER составляет 50.2%, медиана 50.65%; Garo получает 9.5%, Mizo 25.3%, но Nyishi 93.9% и Sumi 78.5%.
Ограничения. Часть уникальных языков имеет очень маленькие тестовые split: авторы сами исключают все короче 0.1 часа, но 23 из 32 оставшихся все равно меньше 30 минут. Результаты на VAANI не полностью отвечают на вопрос о переносе на независимые домены. Длинный хвост остается сложным: для тибето-бирманских и племенных языков WER часто слишком высок для надежного продукта.
Фишка из статьи. Самый честный момент статьи - таблица уникальных языков: модель закрывает языки без официальных baseline, но качество там крайне неоднородно.
| Сравнение | Число | Что означает |
|---|---|---|
| 17 языков с baseline | Mean WER 28.4% | SraVaani лучше трех сравниваемых систем в среднем |
| Уникальные языки | 44 языка/диалекта | Нет официальной поддержки у выбранных baseline |
| 32 показанных split | Mean WER 50.2% | Покрытие есть, но качество часто еще исследовательское |
| Garo / Mizo | 9.5% / 25.3% | Сильный перенос для части малоресурсных языков |
| Nyishi / Sumi | 93.9% / 78.5% | Граница применимости модели видна прямо в таблице |
Как это читать: важно читать эту работу как инфраструктурный шаг: главное достижение не рекордный WER в среднем, а расширение набора языков с явным показом, где перенос уже работает, а где нет.