Выравнивание Low-resource Mandarin
Выравнивание речи

Чэнду-мандарин: выравнивание речи из 17 часов данных

22.3 ms

Эта статья показывает, что для региональной разновидности языка полезнее маленькая специализированная модель выравнивания, чем крупная модель стандартного языка. Авторы строят text-dependent и text-independent aligners для Chengdu Mandarin из 17 часов речи и собственного G2P-словаря. Главный ход - сначала обучить GMM-HMM Chengdu-MFA, а затем использовать его pseudo-labels для frame-classification модели, которая может работать без транскрипта на входе.

Метод. Chengdu-MFA - классический MFA-подход с pronunciation dictionary и акустической моделью для text-dependent alignment. Chengdu-FC - frame classifier поверх дообученных Wav2Vec2/Charsiu/XLS-R моделей, где псевдометки берутся от Chengdu-MFA. Для оценки авторы сравнивают границы слов и фонем с экспертной разметкой, а в text-independent режиме используют precision, recall, F1 и R-value при разных допусках времени.

Результаты. Chengdu-MFA дает среднюю ошибку границы 22.1 мс на уровне слов и 22.3 мс на уровне фонем против 30.1/32.7 мс у Mandarin-MFA. Chengdu-FC-xlsr снижает ошибку до 32.5 мс на словах и 30.2 мс на фонемах против 80.0/77.9 мс у Charsiu-Mandarin-FC. В text-independent режиме Chengdu-FC-large при допуске 100 мс достигает F1 0.785 и R-value 0.657, тогда как Charsiu-Mandarin-FC дает 0.743 и 0.488.

Ограничения. Датасет небольшой, а в оценке есть говорящие, другие записи которых могли попадать в обучение; авторы сами отмечают необходимость проверки на unseen speakers и новых доменах. Подход требует G2P-словаря и хотя бы utterance-level транскриптов для начального MFA. Для сильно отличающихся диалектов такой bootstrap может потребовать больше ручной фонетической работы.

Фишка из статьи. Самый полезный вывод - не нейросеть заменяет MFA, а MFA становится генератором псевдометок. На 17 часах данных классическая специализированная модель уже резко уменьшает длинный хвост ошибок.

МодельWord meanWord medianPhone meanPhone median
Mandarin-MFA30.1 ms11.9 ms32.7 ms14.1 ms
Chengdu-MFA22.1 ms13.5 ms22.3 ms12.9 ms
Charsiu-Mandarin-FC80.0 ms47.5 ms77.9 ms41.0 ms
Chengdu-FC-xlsr32.5 ms15.4 ms30.2 ms13.8 ms

Как это читать: Chengdu-FC-xlsr еще уступает Chengdu-MFA в text-dependent режиме, но он работает без входного текста. Поэтому две модели закрывают разные сценарии: точная разметка с транскриптом и грубее, но автономная сегментация без него.

Оригинальная статья на arXiv