распознавание речи токенизация фонология
arXiv cs.CL

Фонологически информированная токенизация для распознавания немецкой речи: междоменное исследование

arXiv:2610.11646

Статья проверяет, может ли лингвистически осмысленная токенизация заменить стандартные символы и BPE в немецком распознавании речи. Главный вывод не сводится к победителю: под доменным сдвигом важнее совместно выбирать семейство токенов и размер словаря.

Метод. На одном wav2vec 2.0 с CTC сравниваются многоязычные символы, немецкий BPE, слоги Pyphen, межслоговые слияния и фонемные единицы. Проведено 40 дообучений на 300M- и 1B-бэкендах; тесты разделяют чтение, диалектную спонтанную речь RVG 1 и стандартную спонтанную речь Verbmobil.

Результаты. Внутри домена при 1B лучший WER — 11,65% у символьного словаря, multisyl-512 получает 11,88%, syllable-512 — 12,27%. На диалектной RVG 1 multisyl-512 лидирует с 35,75%, а на Verbmobil syllable-512 — с 21,27%. Лучший German-BPE заметно хуже: 42,80 и 24,17% соответственно.

Ограничения. Исследование охватывает только немецкий и CTC; фонетические выводы частично зависят от канонической орфографической разметки. Сильные Whisper и Parakeet обучены на несопоставимо большем объёме аудио, а атомарный фонемный анализ ошибок оставлен на будущее.

Фишка из статьи. Преимущество слогов меняет знак при росте словаря. При 512 единицах слоги лучше BPE на RVG 1 на 8,5 п.п., а при 2048 уже хуже на 1,5 п.п.: жёсткая фонологическая структура полезна при малом бюджете, но мешает, когда BPE способен сам выучить слогоподобные блоки.

Размер словаряRVG 1: BPE / слоги WER, %Разность слоги−BPE, п.п.Verbmobil: BPE / слоги WER, %
51247,12 / 38,63−8,525,47 / 21,27
102445,07 / 42,37−2,726,95 / 21,83
204842,80 / 44,31+1,524,17 / 25,60

Как это читать: знак разности показывает, кто лучше. Взаимодействие размера и семейства составляет 10,0 п.п. на RVG 1 и 5,6 п.п. на Verbmobil, поэтому «фонологическая токенизация лучше» без указания словаря — слишком грубый вывод.

Оригинальная статья на arXiv