Forced alignment Code-mixing MFA
Выравнивание речи

Hindi-English code-mixing: выравнивание речи с ошибкой 4.15 мс

4.15 ms

Статья разбирает узкую, но практически важную задачу: forced alignment для Hindi-English code-mixed речи, где орфография, варианты произношения и середина высказывания ломают стандартные словари. Авторы используют Montreal Forced Aligner и показывают, что качество определяется не только acoustic model, но и тем, как в словаре представлены bilingual pronunciation variants. Главный результат - модель, обученная на sentence-level code-mixed данных, дает примерно на порядок меньшую ошибку границ, чем монолингвальные альтернативы.

Метод. Работа разделена на два эксперимента. Первый проверяет, как mapping в lexicon справляется с вариативностью [ph]~[f] и [z]-подобными сегментами в Hindi-English речи. Второй сравнивает три acoustic model для границ mid-utterance English words: обученную на code-mixed предложениях, на монолингвальных Hindi chunks и на English-only words.

Результаты. Для [ph]~[f] прямой no-mapping вариант дает F-score 0.72, а простое de-aspiration ph->p поднимает F-score до 0.97; majority baseline в этой подвыборке достигает 1.0, потому что реальные дикторы почти стабилизировались на /f/. Для более сложной вариации [z] максимальный bootstrapping дает F-score 0.74 против 0.16 без mapping. В главном опыте code-mixed acoustic model дает mean absolute error 4.15 мс, тогда как monolingual Hindi - 38.18 мс, English-only - 37.58 мс.

Ограничения. Корпус и языковая пара узкие: Hindi-English, один социолингвистический контекст и ручная проверка небольшого числа boundary cases. Используется MFA v1.0 на Kaldi/GMM; авторы сами отмечают, что MFA v3.x и более богатые English/Hindi акустические модели могут изменить картину. Поэтому вывод хорошо переносится как принцип, но не как готовый словарь для всех code-mixed языков.

Фишка из статьи. Самое полезное место - таблица tolerance: она показывает, что code-mixed training data выигрывает именно на точных границах, а не только в среднем.

Acoustic model<10 мс<20 мс<30 мс<40 мс<50 мс
Code-mixed sentences87.06%98.26%99.47%99.66%99.78%
Mono Hindi chunks48.10%68.71%77.81%81.34%83.76%
Mono English words41.89%68.29%79.05%82.58%84.82%

Как это читать: для фонетического анализа важен не только mean error. Если 87% фонем попадают в окно 10 мс, можно изучать тонкие boundary effects; при 42-48% такая разметка уже гораздо менее надежна.

Оригинальная статья на arXiv