Чэнду-мандарин: выравнивание речи из 17 часов данных
Эта статья показывает, что для региональной разновидности языка полезнее маленькая специализированная модель выравнивания, чем крупная модель стандартного языка. Авторы строят text-dependent и text-independent aligners для Chengdu Mandarin из 17 часов речи и собственного G2P-словаря. Главный ход - сначала обучить GMM-HMM Chengdu-MFA, а затем использовать его pseudo-labels для frame-classification модели, которая может работать без транскрипта на входе.
Метод. Chengdu-MFA - классический MFA-подход с pronunciation dictionary и акустической моделью для text-dependent alignment. Chengdu-FC - frame classifier поверх дообученных Wav2Vec2/Charsiu/XLS-R моделей, где псевдометки берутся от Chengdu-MFA. Для оценки авторы сравнивают границы слов и фонем с экспертной разметкой, а в text-independent режиме используют precision, recall, F1 и R-value при разных допусках времени.
Результаты. Chengdu-MFA дает среднюю ошибку границы 22.1 мс на уровне слов и 22.3 мс на уровне фонем против 30.1/32.7 мс у Mandarin-MFA. Chengdu-FC-xlsr снижает ошибку до 32.5 мс на словах и 30.2 мс на фонемах против 80.0/77.9 мс у Charsiu-Mandarin-FC. В text-independent режиме Chengdu-FC-large при допуске 100 мс достигает F1 0.785 и R-value 0.657, тогда как Charsiu-Mandarin-FC дает 0.743 и 0.488.
Ограничения. Датасет небольшой, а в оценке есть говорящие, другие записи которых могли попадать в обучение; авторы сами отмечают необходимость проверки на unseen speakers и новых доменах. Подход требует G2P-словаря и хотя бы utterance-level транскриптов для начального MFA. Для сильно отличающихся диалектов такой bootstrap может потребовать больше ручной фонетической работы.
Фишка из статьи. Самый полезный вывод - не нейросеть заменяет MFA, а MFA становится генератором псевдометок. На 17 часах данных классическая специализированная модель уже резко уменьшает длинный хвост ошибок.
| Модель | Word mean | Word median | Phone mean | Phone median |
|---|---|---|---|---|
| Mandarin-MFA | 30.1 ms | 11.9 ms | 32.7 ms | 14.1 ms |
| Chengdu-MFA | 22.1 ms | 13.5 ms | 22.3 ms | 12.9 ms |
| Charsiu-Mandarin-FC | 80.0 ms | 47.5 ms | 77.9 ms | 41.0 ms |
| Chengdu-FC-xlsr | 32.5 ms | 15.4 ms | 30.2 ms | 13.8 ms |
Как это читать: Chengdu-FC-xlsr еще уступает Chengdu-MFA в text-dependent режиме, но он работает без входного текста. Поэтому две модели закрывают разные сценарии: точная разметка с транскриптом и грубее, но автономная сегментация без него.