Singlish TTS: fine-tuning возвращает акцент, а не только тембр
Эта работа полезна тем, что аккуратно отделяет похожесть диктора от похожести акцента в zero-shot синтезе речи. Авторы проверяют Singlish: базовые Chatterbox и CosyVoice 3 могут сохранить тембр по короткой подсказке, но часто сглаживают локальный акцент. Главный результат - fine-tuning на 50 носителях Singlish заметно повышает accent similarity и переносится на 42 невиденных диктора.
Метод. Данные берутся из IMDA NSC Part 3, большого корпуса разговорного Singapore English; после фильтрации по ошибке распознавания остается 85.7% высказываний. Для эксперимента выбраны 50 in-domain и 42 out-of-domain диктора, всего 55.50 часа, в среднем 1.11 часа на диктора. Оценка использует UT-MOS, WER от Singlish Whisper, SPK-SIM по ECAPA и ACC-SIM по классификатору CommonAccent.
Результаты. Off-the-shelf Chatterbox получает WER 11.48% на in-domain, даже ниже реальной речи 17.31%, но это объясняется более чистой и менее акцентной речью. После fine-tuning WER становится 15.39%, зато ACC-SIM match растет с 0.5114 до 0.6376; на невиденных дикторах - с 0.4697 до 0.5617. CosyVoice стартует с более высокой похожести акцента, но fine-tuning тоже улучшает WER: 19.20% до 14.68% на in-domain.
Ограничения. UT-MOS здесь нельзя читать как абсолютную естественность: настоящая разговорная Singlish-речь получает низкую оценку, потому что автоматическая метрика любит чистую синтетическую речь. Кроме того, F-CosyVoice-idx с лучшей match similarity работает только для виденных дикторов, а вся оценка завязана на автоматические модели похожести акцента и диктора.
Фишка из статьи. Интересна не победа fine-tuning сама по себе, а направление изменения метрик: модель становится менее "чистой", но ближе к реальному акценту. Это редкий случай, где рост WER может означать не деградацию, а возвращение к настоящей разговорной манере.
| Система | Subset | UT-MOS | WER | SPK-SIM match | ACC-SIM match |
|---|---|---|---|---|---|
| Ground Truth | in-domain | 2.50 | 17.31% | 1.0000 | 1.0000 |
| Chatterbox | in-domain | 3.34 | 11.48% | 0.6036 | 0.5114 |
| F-Chatterbox | in-domain | 2.75 | 15.39% | 0.6949 | 0.6376 |
| Chatterbox | out-of-domain | 3.33 | 13.73% | 0.5364 | 0.4697 |
| F-Chatterbox | out-of-domain | 2.76 | 16.59% | 0.6055 | 0.5617 |
Как это читать: базовая модель оптимизируется в сторону чистой универсальной английской речи, а fine-tuning сдвигает ее к Singlish. Поэтому ACC-SIM растет, UT-MOS падает ближе к реальной записи, а WER возвращается в диапазон живой речи.