Какие языки лучше переносятся на Warlpiri
Статья берет очень конкретную задачу: распознавание Warlpiri, австралийского аборигенного языка, где размеченной речи примерно полтора часа. Вместо обычного выбора «родственных» или географически близких языков авторы ранжируют языки-источники по акустическому и лингвистическому сходству. Главный результат практичный: Assamese и Hindi, не будучи очевидно близкими по семье или региону, оказываются лучшими источниками переноса для Whisper.
Метод. Авторы сначала выбирают кандидатов из 107 языков через language identification и затем сравнивают их с Warlpiri по нескольким видам сходства: эмбеддинги ECAPA-TDNN, wav2vec 2.0 и слой-за-слоем XLSR-53, плюс типология, синтаксис, грамматика и фонемный инвентарь. Для распознавания используется Whisper small на 244M параметров с полным дообучением 10 эпох, learning rate 1e-5 и выбором checkpoint по WER на validation. Итоговые модели оцениваются на held-out test по WER и CER.
Результаты. Монолингвальная модель на одном Warlpiri почти не работает: WER 86.9%, CER 41.3%. Оригинальный многоязычный Whisper уже снижает WER до 41.0%, но выбранные по сходству языки дают лучший результат: Assamese достигает WER 32.6% и CER 12.3%, Hindi - 37.6% и 14.3%, Telugu - 39.9% и 15.6%, Tamil - 40.7% и 15.2%. Слабо похожие языки хуже: Javanese дает WER 48.0%, Japanese - 49.7%.
Ограничения. Это исследование на одном целевом языке и очень маленьком корпусе, поэтому абсолютные числа могут быть чувствительны к разбиению и качеству транскрипций. Для Assamese и Japanese не хватает части лингвистических признаков, а качество Whisper зависит от токенизации и предобучающего покрытия. Кроме того, «акустическое сходство» здесь является proxy через эмбеддинги, а не причинным объяснением переноса.
Фишка из статьи. Важна не только таблица WER, а корреляция между типами сходства и итоговым качеством. Она показывает, что для zero-shot и для дообучения полезны разные признаки.
| Сходство | Zero-shot ρ(WER) | Zero-shot ρ(CER) | Дообучение ρ(WER) | Дообучение ρ(CER) |
|---|---|---|---|---|
| Акустическое | -0.45 | -0.12 | -0.67 | -0.62 |
| Синтаксическое | 0.11 | 0.33 | -0.11 | 0.11 |
| Фонемный инвентарь | -0.54 | -0.35 | -0.31 | 0.24 |
| Типология | -0.49 | -0.54 | -0.54 | -0.49 |
Как это читать: отрицательная корреляция означает, что большее сходство связано с меньшей ошибкой. Для дообучения сильнее всего работает акустическое сходство, а без адаптации заметнее фонемный инвентарь и типология. Это хорошая подсказка для малоресурсных проектов: выбирать язык-источник по генеалогии недостаточно.