Оценка произношения без текста через DTW по WavLM
Статья предлагает практичный способ оценивать произношение L2-речи без распознавания фонем и без размеченных данных для новой задачи. Идея: сравнить речь учащегося с несколькими нативными шаблонами через DTW по self-supervised признакам WavLM, а затем отдельно извлечь сигналы для фонетики, ритма и интонации. Работа интересна тем, что не сводит произношение к phone accuracy и явно проверяет надсегментные признаки.
Метод. Для фонетической оценки используется нормированная DTW-дистанция между WavLM-Large представлениями учащегося и нативной записи. Для ритма авторы смотрят не на стоимость выравнивания, а на сам путь DTW: насколько он деформирует локальное время, где есть ускорения и замедления. Для интонации применяются остаточные просодические признаки, pitch и intensity после удаления части информации, уже объясняемой SSL-признаками. Оценка проводится на английской речи японских учащихся ERJ и японской речи иностранных учащихся JRF, все задания имеют человеческие оценки по 5-балльной шкале.
Результаты. На английских предложениях фонетическая оценка DTWSSL дает Pearson r=57.6 и статистически превосходит межэкспертное согласие r=53.6. Ритм предложения почти достигает человека: r=44.9 против 49.3. Интонация заметно сложнее: лучший метод дает r=32.9 против человеческого ориентира 45.3. На японском holistic sentence score ансамбль DTWSSL и остаточных просодических признаков получает r=66.0 против межэкспертного r=60.4. Для японской интонации результат ближе к человеку, но все еще ниже: r=41.2 против 47.4.
Ограничения. Эксперименты сделаны на чтении, а не на спонтанной речи. Проверены только английский и японский, причем качество зависит от доступности нативных шаблонов. Интонация остается слабым местом: ни pitch-признаки, ни остаточные SSL-признаки полностью не совпадают с тем, что слышат эксперты. Для коротких слов DTW хуже, потому что контекст слишком мал.
Фишка из статьи. Небольшое число нативных шаблонов почти не ломает оценку: для лучших методов обычно хватает не более пяти шаблонов, чтобы восстановить не меньше 95% согласия с полной базой шаблонов. Исключение: японская задача difficult sounds, где нужно восемь.
| Задача | Лучший метод, r | Человеческий ориентир, r | Комментарий |
|---|---|---|---|
| English phones, sentence | 57.6 | 53.6 | выше межэкспертного согласия |
| English rhythm, sentence | 44.9 | 49.3 | близко к человеку |
| English intonation, sentence | 32.9 | 45.3 | существенный разрыв |
| Japanese overall, sentence | 66.0 | 60.4 | выше межэкспертного согласия |
| Japanese difficult sounds, word | 31.9 | 47.8 | короткие слова сложны для DTW |
Как это читать: WavLM+DTW хорошо ловит общую и фонетическую похожесть, ритм частично извлекается из геометрии пути выравнивания, а интонация требует более специализированного представления.