DLLM-TTS: блочная дискретная диффузия для быстрого синтеза речи
DLLM-TTS пытается занять середину между авторегрессионными codec language models и полностью неавторегрессионными TTS. Первые хорошо держат текстовую точность, но медленно декодируют токены последовательно; вторые быстрее, но часто требуют duration modeling или теряют точность. Авторы формулируют синтез речи как block discrete diffusion по X-Codec2 токенам: блоки идут последовательно, а токены внутри блока предсказываются параллельно.
Метод. Модель - 0.6B Transformer, инициализированный от Qwen2, с 28 слоями, hidden dim 896, 14 attention heads, text vocab 151,936, codec vocab 6,561 и max sequence length 2,048. Последовательность codec tokens разбивается на блоки B=32; каждый блок покрывает 0.64 s аудио. Внутри noised block внимание bidirectional для локальной связности, к предыдущим clean blocks - causal. На inference используется до T=16 или T=32 denoising steps на блок, KV caching и early stopping.
Результаты. На Seed-TTS-eval English DLLM-TTS получает WER 2.25%, CER 1.05%, SIM 0.750 и MOS 4.25. По MOS он уступает только OpenAudio-s1-mini 4.29 и близок к LLASA-3B 4.28, но имеет 0.6B параметров. По speaker similarity он лучший в таблице: 0.750 против 0.735 у DiTAR, 0.718 у CosyVoice3 и 0.706 у IndexTTS2. Скорость: при T=16 и B=32 заявлен RTF 0.15; block-sequential схема дает streaming после первого denoised block.
Ограничения. Работа сообщает только English Seed-TTS-eval; нет широкой многоязычной проверки. Лучший WER не у DLLM-TTS: DiTAR дает 1.69%, F5-TTS 2.00%, OpenAudio-s1-mini 1.94%. Модель обучена на 20K часов, что меньше крупных авторегрессионных систем, но все равно не маленький ресурс. Абляция показывает нестабильность числа denoising steps: T=64 резко ухудшает WER до 8.83%, то есть больше шагов не всегда лучше.
Фишка из статьи. Самая полезная таблица - speed-quality trade-off по числу шагов. T=16 дает RTF 0.15 и хорошую SIM, но WER заметно хуже T=32; T=64 ломает точность, хотя интуитивно можно ожидать обратного.
| Конфигурация, B=32 | WER | CER | SIM | Комментарий |
|---|---|---|---|---|
| T=8 | 14.58% | 7.86% | 0.748 | Слишком мало denoising steps |
| T=16 | 3.84% | 1.25% | 0.765 | RTF 0.15, лучший режим скорости |
| T=32 | 2.25% | 1.05% | 0.750 | Основной quality режим в таблице |
| T=64 | 8.83% | 6.76% | 0.746 | Больше шагов ухудшает результат |
Как это читать: синтез речи на дискретной диффузии имеет не монотонную зависимость от числа шагов. Практический режим выбирается не по принципу "чем больше, тем лучше", а по балансу точности текста, похожести голоса и задержки.