Фонемы Самообученные представления Выравнивание
Фонетическое выравнивание

SPAM: фонемная сегментация без дообучения речевой модели

R-value 72.0

Работа показывает, что для фонемной сегментации и распознавания не всегда нужно заново обучать большую речевую модель. Авторы берут самообученные речевые представления, проецируют их на фонологические признаки вроде звонкости и назальности и получают SPAM - карту фонологических активаций во времени. Главная идея практичная: если фонетическая структура уже сидит в WavLM-представлениях, достаточно легких правил для границ и ближайшего фонемного прототипа.

Метод. Фонологические векторы оцениваются по небольшой размеченной выборке как разность средних представлений для положительного и отрицательного класса признака. Затем каждый кадр WavLM-large проецируется на эти векторы, получая набор каналов PanPhon плюс каналы тишины, closure и release. Распознавание делается без обучаемого классификатора: сегмент получает фонему, чей канонический PanPhon-вектор лучше всего совпадает с активациями в центре сегмента. Сегментация ищет пики изменений: соседние и многошкальные разности SPAM, обратные контрасты и дополнительная разность mel-спектрограммы объединяются в один сигнал границ.

Результаты. Для сегментации используется R-value: выше лучше, совпадение границы считается в окне 20 мс. Средний out-of-domain R-value у SPAM равен 72.0, выше, чем у CTC 61.9, FCE 69.2 и BCE 68.5, обученных на TIMIT. Особенно сильны многоязычные и нетипичные условия: VoxAngeles 75.1, GTIMIT-Thai 75.8, SSNCE 60.3. Для фонемного распознавания SPAM имеет всего 47K обучаемых параметров и PFER 23.0 на акцентированном английском и 28.9 на многоязычных данных; это хуже крупных topline-систем, но лучше FCE на многоязычной части. По анализу авторов, качество почти не падает до 18 обучающих utterances, то есть меньше минуты фонетической разметки.

Ограничения. Распознавание фонем остается слабее больших специализированных моделей вроде PhoneticXeus, которые обучались на гораздо больших фонетически размеченных наборах. Точность сильно зависит от того, какой слой и какая самообученная модель используются; лучшим оказался финальный слой WavLM, хотя он предобучен на английском. Тоны и более узкие фонетические различия не закрыты полностью, а частота кадров самообученной модели грубовата для тонких границ. Абляция с истинными границами показывает, что основной узкий участок сейчас - сегментатор.

Фишка из статьи. Самая показательная абляция - не сравнение с большими моделями, а добавление разных сигналов границы. Простая разность соседних SPAM-кадров уже сильна на TIMIT, но плохо переносится на VoxAngeles; многошкальные и спектральные признаки как раз поднимают перенос.

Сигнал сегментацииR-value TIMITR-value VoxAngeles
Разность соседних кадров79.266.1
+ многошкальные разности77.672.7
+ обратные контрасты78.773.3
+ mel-спектрограмма80.075.1

Как это читать: лучший результат получается не из одного универсального признака. Для многоязычного переноса особенно важны дополнительные масштабы и независимая спектральная подсказка, потому что чисто локальное изменение фонологических активаций слишком привязано к обучающему домену.

Оригинальная статья на arXiv