Warlpiri Whisper Transfer
Малоресурсное ASR

Какие языки лучше переносятся на Warlpiri

WER 32.6%

Статья берет очень конкретную задачу: распознавание Warlpiri, австралийского аборигенного языка, где размеченной речи примерно полтора часа. Вместо обычного выбора «родственных» или географически близких языков авторы ранжируют языки-источники по акустическому и лингвистическому сходству. Главный результат практичный: Assamese и Hindi, не будучи очевидно близкими по семье или региону, оказываются лучшими источниками переноса для Whisper.

Метод. Авторы сначала выбирают кандидатов из 107 языков через language identification и затем сравнивают их с Warlpiri по нескольким видам сходства: эмбеддинги ECAPA-TDNN, wav2vec 2.0 и слой-за-слоем XLSR-53, плюс типология, синтаксис, грамматика и фонемный инвентарь. Для распознавания используется Whisper small на 244M параметров с полным дообучением 10 эпох, learning rate 1e-5 и выбором checkpoint по WER на validation. Итоговые модели оцениваются на held-out test по WER и CER.

Результаты. Монолингвальная модель на одном Warlpiri почти не работает: WER 86.9%, CER 41.3%. Оригинальный многоязычный Whisper уже снижает WER до 41.0%, но выбранные по сходству языки дают лучший результат: Assamese достигает WER 32.6% и CER 12.3%, Hindi - 37.6% и 14.3%, Telugu - 39.9% и 15.6%, Tamil - 40.7% и 15.2%. Слабо похожие языки хуже: Javanese дает WER 48.0%, Japanese - 49.7%.

Ограничения. Это исследование на одном целевом языке и очень маленьком корпусе, поэтому абсолютные числа могут быть чувствительны к разбиению и качеству транскрипций. Для Assamese и Japanese не хватает части лингвистических признаков, а качество Whisper зависит от токенизации и предобучающего покрытия. Кроме того, «акустическое сходство» здесь является proxy через эмбеддинги, а не причинным объяснением переноса.

Фишка из статьи. Важна не только таблица WER, а корреляция между типами сходства и итоговым качеством. Она показывает, что для zero-shot и для дообучения полезны разные признаки.

СходствоZero-shot ρ(WER)Zero-shot ρ(CER)Дообучение ρ(WER)Дообучение ρ(CER)
Акустическое-0.45-0.12-0.67-0.62
Синтаксическое0.110.33-0.110.11
Фонемный инвентарь-0.54-0.35-0.310.24
Типология-0.49-0.54-0.54-0.49

Как это читать: отрицательная корреляция означает, что большее сходство связано с меньшей ошибкой. Для дообучения сильнее всего работает акустическое сходство, а без адаптации заметнее фонемный инвентарь и типология. Это хорошая подсказка для малоресурсных проектов: выбирать язык-источник по генеалогии недостаточно.

Оригинальная статья на arXiv