Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation
Оценивать принудительное выравнивание на сотнях языков трудно: ручные временные границы дороги, а сравнение с Montreal Forced Aligner ненадёжно там, где он сам не обучается. PCMI и WACS используют самообученные речевые представления как безэталонный корпусный индикатор и хорошо отслеживают крупные ошибки, но не заменяют локальную фонетическую проверку.
Метод. PCMI измеряет взаимную информацию между приписанными фонемами и кластерами речевых представлений, WACS — акустическую согласованность повторов слова после динамического временного выравнивания. Метрики проверяются на случайных сдвигах, поглощении гласных и тишины, затем на 85 языках FLEURS, 45 DoReCo и малоресурсных Archi и Rutul. В качестве представлений сравниваются MMS и XLSR.
Результаты. На 180 корпусных вариантах DoReCo корреляция PCMI с ручной ошибкой границ AAS равна −0,777, WACS — от −0,626 до −0,669, все p<0,001. MFA не смог обработать около 12 тысяч из 65 тысяч фраз, примерно 19%, тогда как CTC-выравниватели дали лишь 11 сбоев на уровне слов. В FLEURS обученные CTC-модели получают PCMI около 0,24 и WACS 0,17–0,19 против равномерной основы 0,09 и 0,02.
Ограничения. Обе меры работают на уровне корпуса и не указывают ошибочную фразу или границу. Они слабее чувствуют поглощение тишины, систематические фонетические слияния и коартикуляцию. Нужны транскрипции и надёжное преобразование графем в фонемы; влияние разных G2P-систем не изучено, а языки без таких средств остаются за пределами проверки.
Фишка из статьи. Исправление тишины в Archi почти вдвое уменьшает ручную ошибку границ, но лишь немного меняет PCMI и WACS. В Rutul, где лишней тишины меньше, различие ещё слабее.
| Язык и вариант | AAS, мс ↓ | PCMI ↑ | WACS ↑ |
|---|---|---|---|
| Archi, CTC | 88,5 | 0,306 | 0,203 |
| Archi, после удаления тишины | 46,3 | 0,319 | 0,215 |
| Rutul, CTC | 68,0 | 0,292 | 0,172 |
| Rutul, после удаления тишины | 61,9 | 0,292 | 0,175 |
Как это читать: PCMI и WACS подходят для отбора явно неудачных систем и сравнения языков без золотых меток, но не для окончательной приёмки временных границ. Большой сдвиг тишины может почти исчезнуть внутри динамического сопоставления слов.