TokAN: accent normalization через self-supervised speech tokens и GRPO
TokAN решает accent normalization: преобразовать L2-accented English в более native-like L1 speech, сохранив speaker identity. Статья интересна тем, что уходит от frame-to-frame mapping и synthetic supervisory speech к дискретным SSL speech tokens, а затем донастраивает token converter через GRPO с reward по WER и accent-classifier confidence. Дополнительная инженерная часть - duration-aware flow-matching predictor для сценариев, где длительность важна, например dubbing.
Метод. Сначала L1-L2 jointly trained VQ tokenizer превращает речь в дискретные tokens, которые должны нести фонетическое содержание, но ослаблять nuisance variation. Autoregressive encoder-decoder переводит L2-accented token sequence в L1-accented tokens; Mel-spectrogram восстанавливается flow-matching synthesizer, conditioned on source speaker embedding. После supervised fine-tuning авторы запускают GRPO на real multi-accented speech из GLOBE без paired targets: reward объединяет native-only ASR WER и вероятность native accent по внешнему classifier.
Результаты. На семи English accents TokAN-1 получает WER 9.23%, лучше CosyAccent-1 с 12.40%, FramAN с 17.55% и VEVO с 28.94%. L1-Prob у TokAN-1 достигает 99.09%, а subjective accentedness score ACT снижается до 22.23, что означает более сильное уменьшение акцента. При этом speaker similarity остается компромиссом: SECS у TokAN-1 0.3655 ниже, чем у resynthesis 0.5862 и VEVO 0.5775, что показывает цену агрессивного accent normalization.
Ограничения. Работа ограничена английскими акцентами и native-only ASR/accent classifier как objective proxies; для других языков придется менять tokenizer, classifier и reward setup. Сохранение speaker identity не идеально: сами авторы отмечают, что synthesizer становится bottleneck и RL, оптимизированный на accent reduction, слегка ухудшает similarity. Subjective evaluation полезна, но не снимает вопрос о восприятии идентичности говорящего в production voice conversion.
Фишка из статьи. Duration-control блок полезен для dubbing: прямое растягивание token durations сохраняет длину, но портит просодическую структуру. TokAN-2 учится распределять длительности через conditioned duration predictor и почти попадает в source length без финального scaling.
| Система | Source length enforced | Abs duration diff | Rel duration diff | ∆PPG |
|---|---|---|---|---|
| TokAN-1 default | нет | 0.79 s | 19.18% | 0.2533 |
| TokAN-1 direct scaling | да | - | - | 0.2705 |
| TokAN-2 predictor | нет | 0.07 s | 1.64% | 0.2608 |
| TokAN-2 predictor + source length | да | - | - | 0.2622 |
Как это читать: TokAN-1 лучше по ∆PPG в свободном режиме, но сильно меняет длительность utterance. TokAN-2 почти сохраняет total duration уже до финального scaling, а ∆PPG меняется минимально, поэтому это более практичный режим для lip-sync и dubbing.