DELTA-TTS: AR-to-diffusion адаптация TTS с confidence-ordered decoding
DELTA-TTS показывает, как превратить pretrained autoregressive TTS backbone в discrete diffusion language model, не обучая TTS систему с нуля. Проблема простая: AR TTS генерирует speech tokens слева направо, поэтому latency растет с длиной, а ранние low-confidence tokens могут запускать hallucination и error propagation. Главный ход - LoRA-based AR-to-dLLM adaptation и confidence-ordered decoding, где модель сначала фиксирует наиболее уверенные tokens, а трудные позиции откладывает до появления большего bidirectional context.
Метод. Авторы берут CosyVoice3 как AR backbone, замораживают его и добавляют адаптацию примерно на 94M parameters поверх 0.5B модели. Training objective маскирует target speech tokens и учит модель восстанавливать их в discrete diffusion formulation; time-shifted schedule выделяет больше unmasking steps поздним стадиям, где оставшиеся позиции сложнее. Convolution module помогает локальным зависимостям между соседними speech tokens, а prompt conditioning добавляет контроль длины.
Результаты. На Seed-TTS test-en DELTA-TTS получает WER 1.75% и SIM 0.688, лучше AR backbone CosyVoice3 по WER 2.02% при SIM 0.692. На LibriSpeech-PC test-clean Subset B DELTA-TTS дает WER 2.17%, SIM 0.69 и UTMOS 4.27, уступая CosyVoice3 по WER 1.95%, но превосходя NAR baselines MaskGCT, E2 TTS и F5-TTS. По скорости DELTA-TTS достигает RTF 0.144 против 0.475 у CosyVoice3, то есть 3.3x speedup на Seed-TTS test-en.
Ограничения. Эксперименты в основном английские: адаптация использует 585 часов LibriTTS, а авторы прямо оставляют multilingual extension будущей работой. RTF измерен только для token-generation stage на NVIDIA A100, поэтому end-to-end latency с vocoder и production batching может отличаться. Subjective evaluation небольшая: 20 взрослых участников; кроме того, метод добавляет 94M trainable parameters и проверен на одном AR backbone.
Фишка из статьи. Скорость растет особенно на длинных utterances, потому что фиксированное число diffusion steps заменяет последовательное AR прохождение. При этом DELTA-TTS сохраняет WER advantage в каждом length bucket, а не только в среднем.
| Длина utterance | CosyVoice3 WER | DELTA WER | CosyVoice3 RTF | DELTA RTF | Speedup |
|---|---|---|---|---|---|
| 0-3 s | 1.54% | 1.24% | 0.479 | 0.230 | 2.08x |
| 3-5 s | 1.74% | 1.45% | 0.475 | 0.144 | 3.30x |
| 5-10 s | 2.80% | 2.60% | 0.473 | 0.106 | 4.46x |
| All | 2.02% | 1.75% | 0.475 | 0.144 | 3.30x |
Как это читать: преимущество не сводится к “NAR быстрее”. В длинном bucket speedup доходит до 4.46x, но WER остается ниже AR baseline; это и делает confidence-ordered decoding полезнее простой параллельной генерации с просадкой качества.