TTS Graphemes Contrastive
TTS representation

SPARCLE: акустически выровненные graphemes для low-resource TTS

WER 7.5

SPARCLE полезна для low-resource TTS, где phoneme frontend часто требует G2P, лингвистических правил и domain-specific инженерии. Авторы предлагают заменить обычные character embeddings на speaker-aware grapheme representations, которые контрастивно выравниваются с акустическими Wav2Vec2-признаками и затем используются в TTS как более “звучащий” текстовый вход.

Метод. Forced alignment связывает символы transcript с акустическими frame representations; в среднем буква A–Z соответствует 2.8 Wav2Vec2 embeddings, а пробел — 6.7, что уже кодирует длительность и ритм. Wav2Vec2 encoder заморожен, а grapheme embeddings учатся контрастивно на LibriSpeech-960h: batch 1024 pairs, 200k steps, 4×GH200. Затем embeddings подставляются в ParrotTTS и VITS на VCTK с бюджетами от 10 минут до 10 часов.

Результаты. В ParrotTTS SPARCLE резко улучшает intelligibility при малом количестве данных. При 10 минутах VCTK WER падает с 85.7 у character baseline до 42.2; при 30 минутах — с 35.3 до 10.0; при 1 часе — с 24.7 до 7.5. Speaker similarity тоже улучшается: EER для лучшего K=7 +T варианта на 1 часе равен 1.13 против 1.93 у character baseline. На VITS эффект слабее: при 1 часе WER остается очень высоким, 117.34 против 121.7 у character baseline.

Ограничения. Метод зависит от forced alignment и крупного contrastive pretraining, что не бесплатно для маленькой команды. Результаты сильные на ParrotTTS, но перенос на VITS выглядит ограниченным, поэтому SPARCLE не является универсальной заменой frontend. Есть и corpus mismatch: pretraining на LibriSpeech, downstream на VCTK с другими голосами и акцентами.

Фишка из статьи. Самое показательное — SPARCLE особенно помогает в режиме 30 минут – 1 час, где обычные graphemes уже дают речь, но еще плохо передают акустическую структуру.

Text representation в ParrotTTS10 min WER30 min WER1 h WER1 h EER
Characters baseline85.735.324.71.93
Phones baseline96.032.626.82.00
SPARCLE K=3 +T42.211.59.21.39
SPARCLE K=7 +T42.210.07.51.13
SPARCLE unfrozen +T49.312.89.11.33

Как это читать: выигрыш не просто в “лучшей embedding table”. Контрастивное выравнивание с акустикой дает grapheme-level representation, которое частично несет длительность, speaker conditioning и произносительные различия, поэтому TTS меньше полагается на большой downstream датасет.

Оригинальная статья на arXiv