TTS Diffusion Latency
TTS

DELTA-TTS: AR-to-diffusion адаптация TTS с confidence-ordered decoding

WER 1.75%

DELTA-TTS показывает, как превратить pretrained autoregressive TTS backbone в discrete diffusion language model, не обучая TTS систему с нуля. Проблема простая: AR TTS генерирует speech tokens слева направо, поэтому latency растет с длиной, а ранние low-confidence tokens могут запускать hallucination и error propagation. Главный ход - LoRA-based AR-to-dLLM adaptation и confidence-ordered decoding, где модель сначала фиксирует наиболее уверенные tokens, а трудные позиции откладывает до появления большего bidirectional context.

Метод. Авторы берут CosyVoice3 как AR backbone, замораживают его и добавляют адаптацию примерно на 94M parameters поверх 0.5B модели. Training objective маскирует target speech tokens и учит модель восстанавливать их в discrete diffusion formulation; time-shifted schedule выделяет больше unmasking steps поздним стадиям, где оставшиеся позиции сложнее. Convolution module помогает локальным зависимостям между соседними speech tokens, а prompt conditioning добавляет контроль длины.

Результаты. На Seed-TTS test-en DELTA-TTS получает WER 1.75% и SIM 0.688, лучше AR backbone CosyVoice3 по WER 2.02% при SIM 0.692. На LibriSpeech-PC test-clean Subset B DELTA-TTS дает WER 2.17%, SIM 0.69 и UTMOS 4.27, уступая CosyVoice3 по WER 1.95%, но превосходя NAR baselines MaskGCT, E2 TTS и F5-TTS. По скорости DELTA-TTS достигает RTF 0.144 против 0.475 у CosyVoice3, то есть 3.3x speedup на Seed-TTS test-en.

Ограничения. Эксперименты в основном английские: адаптация использует 585 часов LibriTTS, а авторы прямо оставляют multilingual extension будущей работой. RTF измерен только для token-generation stage на NVIDIA A100, поэтому end-to-end latency с vocoder и production batching может отличаться. Subjective evaluation небольшая: 20 взрослых участников; кроме того, метод добавляет 94M trainable parameters и проверен на одном AR backbone.

Фишка из статьи. Скорость растет особенно на длинных utterances, потому что фиксированное число diffusion steps заменяет последовательное AR прохождение. При этом DELTA-TTS сохраняет WER advantage в каждом length bucket, а не только в среднем.

Длина utteranceCosyVoice3 WERDELTA WERCosyVoice3 RTFDELTA RTFSpeedup
0-3 s1.54%1.24%0.4790.2302.08x
3-5 s1.74%1.45%0.4750.1443.30x
5-10 s2.80%2.60%0.4730.1064.46x
All2.02%1.75%0.4750.1443.30x

Как это читать: преимущество не сводится к “NAR быстрее”. В длинном bucket speedup доходит до 4.46x, но WER остается ниже AR baseline; это и делает confidence-ordered decoding полезнее простой параллельной генерации с просадкой качества.

Оригинальная статья на arXiv