TTS Accent Singlish
Синтез речи

Singlish TTS: fine-tuning возвращает акцент, а не только тембр

55.5 h

Эта работа полезна тем, что аккуратно отделяет похожесть диктора от похожести акцента в zero-shot синтезе речи. Авторы проверяют Singlish: базовые Chatterbox и CosyVoice 3 могут сохранить тембр по короткой подсказке, но часто сглаживают локальный акцент. Главный результат - fine-tuning на 50 носителях Singlish заметно повышает accent similarity и переносится на 42 невиденных диктора.

Метод. Данные берутся из IMDA NSC Part 3, большого корпуса разговорного Singapore English; после фильтрации по ошибке распознавания остается 85.7% высказываний. Для эксперимента выбраны 50 in-domain и 42 out-of-domain диктора, всего 55.50 часа, в среднем 1.11 часа на диктора. Оценка использует UT-MOS, WER от Singlish Whisper, SPK-SIM по ECAPA и ACC-SIM по классификатору CommonAccent.

Результаты. Off-the-shelf Chatterbox получает WER 11.48% на in-domain, даже ниже реальной речи 17.31%, но это объясняется более чистой и менее акцентной речью. После fine-tuning WER становится 15.39%, зато ACC-SIM match растет с 0.5114 до 0.6376; на невиденных дикторах - с 0.4697 до 0.5617. CosyVoice стартует с более высокой похожести акцента, но fine-tuning тоже улучшает WER: 19.20% до 14.68% на in-domain.

Ограничения. UT-MOS здесь нельзя читать как абсолютную естественность: настоящая разговорная Singlish-речь получает низкую оценку, потому что автоматическая метрика любит чистую синтетическую речь. Кроме того, F-CosyVoice-idx с лучшей match similarity работает только для виденных дикторов, а вся оценка завязана на автоматические модели похожести акцента и диктора.

Фишка из статьи. Интересна не победа fine-tuning сама по себе, а направление изменения метрик: модель становится менее "чистой", но ближе к реальному акценту. Это редкий случай, где рост WER может означать не деградацию, а возвращение к настоящей разговорной манере.

СистемаSubsetUT-MOSWERSPK-SIM matchACC-SIM match
Ground Truthin-domain2.5017.31%1.00001.0000
Chatterboxin-domain3.3411.48%0.60360.5114
F-Chatterboxin-domain2.7515.39%0.69490.6376
Chatterboxout-of-domain3.3313.73%0.53640.4697
F-Chatterboxout-of-domain2.7616.59%0.60550.5617

Как это читать: базовая модель оптимизируется в сторону чистой универсальной английской речи, а fine-tuning сдвигает ее к Singlish. Поэтому ACC-SIM растет, UT-MOS падает ближе к реальной записи, а WER возвращается в диапазон живой речи.

Оригинальная статья на arXiv