Токенизация речи SSL Инвариантность
Речевая токенизация

PINT: речевая токенизация без утечки диктора

Spk 93.1%->1.2%

Статья атакует слабое место дискретных речевых токенизаторов: токены HuBERT/WavLM часто несут не только содержание, но и диктора, просодию и канал записи. Для речевых языковых моделей это вредно: последовательность становится шумной и плохо сжимается. PINT предлагает простой принцип: если разные дикторы произносят одни и те же слова, общим фактором должно остаться именно содержание.

Метод. PINT начинает с HuBERT-base и обучает его на параллельных произнесениях одинаковых текстов. В Stage A используются soft-DTW потери между представлениями параллельных фраз, фонемная классификация и шумовые аугментации; в Stage B добавляется CTC-голова на 200 дискретных кодов. Непараллельные корпуса расширяют покрытие, а псевдопараллельные пары создаются аугментациями одного и того же utterance. В итоге токены должны быть согласованными для одинакового текста, но сохранять кадровую привязку, полезную для кодеков и речевых моделей.

Результаты. На LibriSpeech PINT улучшает content capture: в дискретном режиме WER 12.13% против 21.37% у HuBERT и 18.42% у WavLM, CER 4.65% против 7.55% и 6.40%. ABX error тоже ниже: 0.040/0.042 против 0.055/0.066 у HuBERT. При этом probe на диктора падает с 93.1% у HuBERT до 1.2% у PINT, а probe на эмоцию с 55.4% до 32.1%. Для одинаковой 85M autoregressive модели perplexity на токенах PINT равен 1.95 против 2.78 у HuBERT и 2.67 у WavLM; нужный уровень WavLM достигается примерно за 1,400 шагов, то есть в 23 раза быстрее.

Ограничения. Метод сознательно вымывает диктора и часть просодии, поэтому эти токены не подходят как единственное представление для задач, где тембр и стиль нужны на выходе. Обучение опирается на наличие параллельных или псевдопараллельных данных и выравнивание через MFA. Основные проверки английские; перенос на языки с другой фонетикой и меньшим количеством параллельных фраз требует отдельной проверки.

Фишка из статьи. Хорошая метрика здесь не только WER, а сжимаемость. Если токены действительно стали ближе к содержанию, они должны повторяться как текстовые единицы, а не дрожать от диктора и канала.

КодированиеHuBERTWavLMPINTТекстовый BPE
Raw, bit/s400400400116
RLE, bit/s246273152-
BPE после dedup, 8k, bit/s1071085648

Как это читать: PINT почти доходит до текстовой сжимаемости, оставаясь речевым токенизатором с временной привязкой. Это сильный аргумент, что модель убрала акустический мусор из дискретной последовательности, а не просто переупаковала HuBERT.

Оригинальная статья на arXiv