Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition
Работа ценна не новой архитектурой, а редким контролируемым сравнением шести многоязычных моделей распознавания непальской речи. При одинаковой подготовке данных почти одинаковую точность дают Whisper-Large-v3-Turbo и IndicWav2Vec, хотя вторая модель в девять раз меньше; зато при переносе на другой корпус преимущество получает широкое многоязычное предварительное обучение.
Метод. Авторы дообучают XLSR-53, IndicWav2Vec, MMS-1B, Whisper-Medium, Whisper-Large-v3-Turbo и Conformer-Hi примерно на 165 часах OpenSLR SLR54. Разбиения, очистка текста и звука и схема оценки общие, а скорости обучения подобраны внутри каждого семейства. Проверка проводится на исходном тесте OpenSLR и на независимых FLEURS и Common Voice; внешняя языковая модель при декодировании не используется.
Результаты. На OpenSLR лучший WER у Whisper-Turbo составляет 14,76%, у IndicWav2Vec - 14,89%, у Whisper-Medium - 15,57%. При этом IndicWav2Vec достигает RTF около 0,0026, а средний RTF Whisper-Turbo равен примерно 0,076, то есть декодирование с CTC здесь почти в 29 раз быстрее при сопоставимой точности. На FLEURS абсолютный лидер по WER - Whisper-Medium с 39,06%, но MMS-1B показывает наименьшее ухудшение относительно OpenSLR: +12,55 процентного пункта. Common Voice остаётся тяжёлым для всех моделей: лучший WER равен 48,35%.
Ограничения. Все три набора содержат преимущественно читаемую речь; разговорная речь, переключение между непальским, английским и хинди и диалекты не исследованы. Conformer обучался в NeMo, остальные модели - в общей схеме Hugging Face, поэтому протокол не полностью идентичен. У крупных моделей ограничены число эпох и размер пакета из-за одной NVIDIA L4, а отказ от внешней языковой модели делает сравнение чистым, но не показывает возможный максимум прикладной системы.
Фишка из статьи. Главная инженерная развилка видна только при совместном чтении точности, скорости и переноса: одна модель выигрывает по задержке, другая - по устойчивости к смене корпуса.
| Модель | Параметры | WER OpenSLR | WER FLEURS | RTF OpenSLR |
|---|---|---|---|---|
| IndicWav2Vec | 94,4 млн | 14,89% | 40,68% | 0,0025 |
| Whisper-Turbo | 809 млн | 14,76% | 39,56% | 0,0979 |
| MMS-1B | 965 млн | 27,28% | 39,83% | 0,0214 |
Как это читать: IndicWav2Vec почти не уступает Whisper-Turbo на исходном корпусе и намного быстрее, а MMS-1B проигрывает там 12,4 пункта WER, но почти догоняет лидеров после смены условий. Масштаб предварительного обучения здесь покупает не пик точности, а устойчивость.