Фонологически информированная токенизация для распознавания немецкой речи: междоменное исследование
Статья проверяет, может ли лингвистически осмысленная токенизация заменить стандартные символы и BPE в немецком распознавании речи. Главный вывод не сводится к победителю: под доменным сдвигом важнее совместно выбирать семейство токенов и размер словаря.
Метод. На одном wav2vec 2.0 с CTC сравниваются многоязычные символы, немецкий BPE, слоги Pyphen, межслоговые слияния и фонемные единицы. Проведено 40 дообучений на 300M- и 1B-бэкендах; тесты разделяют чтение, диалектную спонтанную речь RVG 1 и стандартную спонтанную речь Verbmobil.
Результаты. Внутри домена при 1B лучший WER — 11,65% у символьного словаря, multisyl-512 получает 11,88%, syllable-512 — 12,27%. На диалектной RVG 1 multisyl-512 лидирует с 35,75%, а на Verbmobil syllable-512 — с 21,27%. Лучший German-BPE заметно хуже: 42,80 и 24,17% соответственно.
Ограничения. Исследование охватывает только немецкий и CTC; фонетические выводы частично зависят от канонической орфографической разметки. Сильные Whisper и Parakeet обучены на несопоставимо большем объёме аудио, а атомарный фонемный анализ ошибок оставлен на будущее.
Фишка из статьи. Преимущество слогов меняет знак при росте словаря. При 512 единицах слоги лучше BPE на RVG 1 на 8,5 п.п., а при 2048 уже хуже на 1,5 п.п.: жёсткая фонологическая структура полезна при малом бюджете, но мешает, когда BPE способен сам выучить слогоподобные блоки.
| Размер словаря | RVG 1: BPE / слоги WER, % | Разность слоги−BPE, п.п. | Verbmobil: BPE / слоги WER, % |
|---|---|---|---|
| 512 | 47,12 / 38,63 | −8,5 | 25,47 / 21,27 |
| 1024 | 45,07 / 42,37 | −2,7 | 26,95 / 21,83 |
| 2048 | 42,80 / 44,31 | +1,5 | 24,17 / 25,60 |
Как это читать: знак разности показывает, кто лучше. Взаимодействие размера и семейства составляет 10,0 п.п. на RVG 1 и 5,6 п.п. на Verbmobil, поэтому «фонологическая токенизация лучше» без указания словаря — слишком грубый вывод.