SPAM: фонемная сегментация без дообучения речевой модели
Работа показывает, что для фонемной сегментации и распознавания не всегда нужно заново обучать большую речевую модель. Авторы берут самообученные речевые представления, проецируют их на фонологические признаки вроде звонкости и назальности и получают SPAM - карту фонологических активаций во времени. Главная идея практичная: если фонетическая структура уже сидит в WavLM-представлениях, достаточно легких правил для границ и ближайшего фонемного прототипа.
Метод. Фонологические векторы оцениваются по небольшой размеченной выборке как разность средних представлений для положительного и отрицательного класса признака. Затем каждый кадр WavLM-large проецируется на эти векторы, получая набор каналов PanPhon плюс каналы тишины, closure и release. Распознавание делается без обучаемого классификатора: сегмент получает фонему, чей канонический PanPhon-вектор лучше всего совпадает с активациями в центре сегмента. Сегментация ищет пики изменений: соседние и многошкальные разности SPAM, обратные контрасты и дополнительная разность mel-спектрограммы объединяются в один сигнал границ.
Результаты. Для сегментации используется R-value: выше лучше, совпадение границы считается в окне 20 мс. Средний out-of-domain R-value у SPAM равен 72.0, выше, чем у CTC 61.9, FCE 69.2 и BCE 68.5, обученных на TIMIT. Особенно сильны многоязычные и нетипичные условия: VoxAngeles 75.1, GTIMIT-Thai 75.8, SSNCE 60.3. Для фонемного распознавания SPAM имеет всего 47K обучаемых параметров и PFER 23.0 на акцентированном английском и 28.9 на многоязычных данных; это хуже крупных topline-систем, но лучше FCE на многоязычной части. По анализу авторов, качество почти не падает до 18 обучающих utterances, то есть меньше минуты фонетической разметки.
Ограничения. Распознавание фонем остается слабее больших специализированных моделей вроде PhoneticXeus, которые обучались на гораздо больших фонетически размеченных наборах. Точность сильно зависит от того, какой слой и какая самообученная модель используются; лучшим оказался финальный слой WavLM, хотя он предобучен на английском. Тоны и более узкие фонетические различия не закрыты полностью, а частота кадров самообученной модели грубовата для тонких границ. Абляция с истинными границами показывает, что основной узкий участок сейчас - сегментатор.
Фишка из статьи. Самая показательная абляция - не сравнение с большими моделями, а добавление разных сигналов границы. Простая разность соседних SPAM-кадров уже сильна на TIMIT, но плохо переносится на VoxAngeles; многошкальные и спектральные признаки как раз поднимают перенос.
| Сигнал сегментации | R-value TIMIT | R-value VoxAngeles |
|---|---|---|
| Разность соседних кадров | 79.2 | 66.1 |
| + многошкальные разности | 77.6 | 72.7 |
| + обратные контрасты | 78.7 | 73.3 |
| + mel-спектрограмма | 80.0 | 75.1 |
Как это читать: лучший результат получается не из одного универсального признака. Для многоязычного переноса особенно важны дополнительные масштабы и независимая спектральная подсказка, потому что чисто локальное изменение фонологических активаций слишком привязано к обучающему домену.