Распознавание речи Непальский язык Вычислительная эффективность
arXiv cs.CL

Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition

arXiv:2608.12327

Работа ценна не новой архитектурой, а редким контролируемым сравнением шести многоязычных моделей распознавания непальской речи. При одинаковой подготовке данных почти одинаковую точность дают Whisper-Large-v3-Turbo и IndicWav2Vec, хотя вторая модель в девять раз меньше; зато при переносе на другой корпус преимущество получает широкое многоязычное предварительное обучение.

Метод. Авторы дообучают XLSR-53, IndicWav2Vec, MMS-1B, Whisper-Medium, Whisper-Large-v3-Turbo и Conformer-Hi примерно на 165 часах OpenSLR SLR54. Разбиения, очистка текста и звука и схема оценки общие, а скорости обучения подобраны внутри каждого семейства. Проверка проводится на исходном тесте OpenSLR и на независимых FLEURS и Common Voice; внешняя языковая модель при декодировании не используется.

Результаты. На OpenSLR лучший WER у Whisper-Turbo составляет 14,76%, у IndicWav2Vec - 14,89%, у Whisper-Medium - 15,57%. При этом IndicWav2Vec достигает RTF около 0,0026, а средний RTF Whisper-Turbo равен примерно 0,076, то есть декодирование с CTC здесь почти в 29 раз быстрее при сопоставимой точности. На FLEURS абсолютный лидер по WER - Whisper-Medium с 39,06%, но MMS-1B показывает наименьшее ухудшение относительно OpenSLR: +12,55 процентного пункта. Common Voice остаётся тяжёлым для всех моделей: лучший WER равен 48,35%.

Ограничения. Все три набора содержат преимущественно читаемую речь; разговорная речь, переключение между непальским, английским и хинди и диалекты не исследованы. Conformer обучался в NeMo, остальные модели - в общей схеме Hugging Face, поэтому протокол не полностью идентичен. У крупных моделей ограничены число эпох и размер пакета из-за одной NVIDIA L4, а отказ от внешней языковой модели делает сравнение чистым, но не показывает возможный максимум прикладной системы.

Фишка из статьи. Главная инженерная развилка видна только при совместном чтении точности, скорости и переноса: одна модель выигрывает по задержке, другая - по устойчивости к смене корпуса.

МодельПараметрыWER OpenSLRWER FLEURSRTF OpenSLR
IndicWav2Vec94,4 млн14,89%40,68%0,0025
Whisper-Turbo809 млн14,76%39,56%0,0979
MMS-1B965 млн27,28%39,83%0,0214

Как это читать: IndicWav2Vec почти не уступает Whisper-Turbo на исходном корпусе и намного быстрее, а MMS-1B проигрывает там 12,4 пункта WER, но почти догоняет лидеров после смены условий. Масштаб предварительного обучения здесь покупает не пик точности, а устойчивость.

Оригинальная статья на arXiv