CuteTTS: потоковый синтез речи в непрерывных латентах
CuteTTS пытается совместить нулевой перенос голоса с задержками, приемлемыми для интерактивного ассистента. Вместо дискретных аудиотокенов модель авторегрессионно предсказывает непрерывные латенты причинного VAE, а акустическую детализацию делает небольшой flow-matching head. Главный ход - не просто непрерывное представление, а дистилляция guidance и шагов решателя в более дешевый одноинтервальный student.
Метод. Архитектура использует семантически выровненный причинный VAE, patch-level авторегрессию, явное условие диктора и двунаправленную голову flow matching. Размер основной модели около 0.2B параметров. Для скорости авторы вводят guidance-step distillation: базовая двухветочная CFG-процедура и несколько NFE сжимаются в одно более дешевое предсказание, чтобы уменьшить first-audio latency и RTF.
Результаты. На LibriSpeech test-clean CuteTTS получает WER 2.16% и SIM 78.9; distilled-версия - 2.41% и 76.8. На Seed-TTS EN результат 2.04%/76.5 для базовой модели и 2.03%/74.2 для distilled. Главная инженерная метрика: на RTX 4090 distillation снижает среднюю задержку первого звука с 49.0 до 37.6 мс, P95 с 52.3 до 40.8 мс и RTF с 0.184 до 0.109.
Ограничения. Обучение опирается на внутренний многоязычный корпус примерно 550 тыс. часов, поэтому воспроизводимость ограничена. Часть сравнений берется из официальных реализаций и статей, а субъективная оценка проведена на подвыборке из 50 примеров. Также остается открытым вопрос, как модель поведет себя в сильно шумных prompt speech и при языках вне тренировочного распределения.
Фишка из статьи. Абляция по частоте VAE и размеру patch показывает, что число авторегрессионных шагов в секунду не описывает всю сложность.
| Сравнение | Число | Что означает |
|---|---|---|
| 6.25 Гц, patch 1 | WER 2.53, SIM 62.5 | Короткая последовательность, но слабее дикторское сходство |
| 12.5 Гц, patch 2 | WER 2.70, SIM 71.3, UTMOS 3.878 | Лучший баланс при тех же 6.25 шагах/с |
| 25 Гц, patch 4 | WER 3.92, SIM 72.5 | Больше акустики, но тяжелее генерация patch |
| 50 Гц, patch 8 | WER 7.04, SIM 74.1 | Сходство растет, разборчивость падает |
Как это читать: выигрыш дает не максимальная частота латентов и не минимальная длина последовательности, а умеренная точка, где VAE уже достаточно акустичен, а диффузионная голова еще не перегружена.