SPARCLE: акустически выровненные graphemes для low-resource TTS
SPARCLE полезна для low-resource TTS, где phoneme frontend часто требует G2P, лингвистических правил и domain-specific инженерии. Авторы предлагают заменить обычные character embeddings на speaker-aware grapheme representations, которые контрастивно выравниваются с акустическими Wav2Vec2-признаками и затем используются в TTS как более “звучащий” текстовый вход.
Метод. Forced alignment связывает символы transcript с акустическими frame representations; в среднем буква A–Z соответствует 2.8 Wav2Vec2 embeddings, а пробел — 6.7, что уже кодирует длительность и ритм. Wav2Vec2 encoder заморожен, а grapheme embeddings учатся контрастивно на LibriSpeech-960h: batch 1024 pairs, 200k steps, 4×GH200. Затем embeddings подставляются в ParrotTTS и VITS на VCTK с бюджетами от 10 минут до 10 часов.
Результаты. В ParrotTTS SPARCLE резко улучшает intelligibility при малом количестве данных. При 10 минутах VCTK WER падает с 85.7 у character baseline до 42.2; при 30 минутах — с 35.3 до 10.0; при 1 часе — с 24.7 до 7.5. Speaker similarity тоже улучшается: EER для лучшего K=7 +T варианта на 1 часе равен 1.13 против 1.93 у character baseline. На VITS эффект слабее: при 1 часе WER остается очень высоким, 117.34 против 121.7 у character baseline.
Ограничения. Метод зависит от forced alignment и крупного contrastive pretraining, что не бесплатно для маленькой команды. Результаты сильные на ParrotTTS, но перенос на VITS выглядит ограниченным, поэтому SPARCLE не является универсальной заменой frontend. Есть и corpus mismatch: pretraining на LibriSpeech, downstream на VCTK с другими голосами и акцентами.
Фишка из статьи. Самое показательное — SPARCLE особенно помогает в режиме 30 минут – 1 час, где обычные graphemes уже дают речь, но еще плохо передают акустическую структуру.
| Text representation в ParrotTTS | 10 min WER | 30 min WER | 1 h WER | 1 h EER |
|---|---|---|---|---|
| Characters baseline | 85.7 | 35.3 | 24.7 | 1.93 |
| Phones baseline | 96.0 | 32.6 | 26.8 | 2.00 |
| SPARCLE K=3 +T | 42.2 | 11.5 | 9.2 | 1.39 |
| SPARCLE K=7 +T | 42.2 | 10.0 | 7.5 | 1.13 |
| SPARCLE unfrozen +T | 49.3 | 12.8 | 9.1 | 1.33 |
Как это читать: выигрыш не просто в “лучшей embedding table”. Контрастивное выравнивание с акустикой дает grapheme-level representation, которое частично несет длительность, speaker conditioning и произносительные различия, поэтому TTS меньше полагается на большой downstream датасет.