Speech tokens Accent GRPO
Accent normalization

TokAN: accent normalization через self-supervised speech tokens и GRPO

WER 9.23%

TokAN решает accent normalization: преобразовать L2-accented English в более native-like L1 speech, сохранив speaker identity. Статья интересна тем, что уходит от frame-to-frame mapping и synthetic supervisory speech к дискретным SSL speech tokens, а затем донастраивает token converter через GRPO с reward по WER и accent-classifier confidence. Дополнительная инженерная часть - duration-aware flow-matching predictor для сценариев, где длительность важна, например dubbing.

Метод. Сначала L1-L2 jointly trained VQ tokenizer превращает речь в дискретные tokens, которые должны нести фонетическое содержание, но ослаблять nuisance variation. Autoregressive encoder-decoder переводит L2-accented token sequence в L1-accented tokens; Mel-spectrogram восстанавливается flow-matching synthesizer, conditioned on source speaker embedding. После supervised fine-tuning авторы запускают GRPO на real multi-accented speech из GLOBE без paired targets: reward объединяет native-only ASR WER и вероятность native accent по внешнему classifier.

Результаты. На семи English accents TokAN-1 получает WER 9.23%, лучше CosyAccent-1 с 12.40%, FramAN с 17.55% и VEVO с 28.94%. L1-Prob у TokAN-1 достигает 99.09%, а subjective accentedness score ACT снижается до 22.23, что означает более сильное уменьшение акцента. При этом speaker similarity остается компромиссом: SECS у TokAN-1 0.3655 ниже, чем у resynthesis 0.5862 и VEVO 0.5775, что показывает цену агрессивного accent normalization.

Ограничения. Работа ограничена английскими акцентами и native-only ASR/accent classifier как objective proxies; для других языков придется менять tokenizer, classifier и reward setup. Сохранение speaker identity не идеально: сами авторы отмечают, что synthesizer становится bottleneck и RL, оптимизированный на accent reduction, слегка ухудшает similarity. Subjective evaluation полезна, но не снимает вопрос о восприятии идентичности говорящего в production voice conversion.

Фишка из статьи. Duration-control блок полезен для dubbing: прямое растягивание token durations сохраняет длину, но портит просодическую структуру. TokAN-2 учится распределять длительности через conditioned duration predictor и почти попадает в source length без финального scaling.

СистемаSource length enforcedAbs duration diffRel duration diff∆PPG
TokAN-1 defaultнет0.79 s19.18%0.2533
TokAN-1 direct scalingда--0.2705
TokAN-2 predictorнет0.07 s1.64%0.2608
TokAN-2 predictor + source lengthда--0.2622

Как это читать: TokAN-1 лучше по ∆PPG в свободном режиме, но сильно меняет длительность utterance. TokAN-2 почти сохраняет total duration уже до финального scaling, а ∆PPG меняется минимально, поэтому это более практичный режим для lip-sync и dubbing.

Оригинальная статья на arXiv