Синтез речи Задержка Латенты
arXiv cs.SD

CuteTTS: потоковый синтез речи в непрерывных латентах

arXiv:2608.08638

CuteTTS пытается совместить нулевой перенос голоса с задержками, приемлемыми для интерактивного ассистента. Вместо дискретных аудиотокенов модель авторегрессионно предсказывает непрерывные латенты причинного VAE, а акустическую детализацию делает небольшой flow-matching head. Главный ход - не просто непрерывное представление, а дистилляция guidance и шагов решателя в более дешевый одноинтервальный student.

Метод. Архитектура использует семантически выровненный причинный VAE, patch-level авторегрессию, явное условие диктора и двунаправленную голову flow matching. Размер основной модели около 0.2B параметров. Для скорости авторы вводят guidance-step distillation: базовая двухветочная CFG-процедура и несколько NFE сжимаются в одно более дешевое предсказание, чтобы уменьшить first-audio latency и RTF.

Результаты. На LibriSpeech test-clean CuteTTS получает WER 2.16% и SIM 78.9; distilled-версия - 2.41% и 76.8. На Seed-TTS EN результат 2.04%/76.5 для базовой модели и 2.03%/74.2 для distilled. Главная инженерная метрика: на RTX 4090 distillation снижает среднюю задержку первого звука с 49.0 до 37.6 мс, P95 с 52.3 до 40.8 мс и RTF с 0.184 до 0.109.

Ограничения. Обучение опирается на внутренний многоязычный корпус примерно 550 тыс. часов, поэтому воспроизводимость ограничена. Часть сравнений берется из официальных реализаций и статей, а субъективная оценка проведена на подвыборке из 50 примеров. Также остается открытым вопрос, как модель поведет себя в сильно шумных prompt speech и при языках вне тренировочного распределения.

Фишка из статьи. Абляция по частоте VAE и размеру patch показывает, что число авторегрессионных шагов в секунду не описывает всю сложность.

СравнениеЧислоЧто означает
6.25 Гц, patch 1WER 2.53, SIM 62.5Короткая последовательность, но слабее дикторское сходство
12.5 Гц, patch 2WER 2.70, SIM 71.3, UTMOS 3.878Лучший баланс при тех же 6.25 шагах/с
25 Гц, patch 4WER 3.92, SIM 72.5Больше акустики, но тяжелее генерация patch
50 Гц, patch 8WER 7.04, SIM 74.1Сходство растет, разборчивость падает

Как это читать: выигрыш дает не максимальная частота латентов и не минимальная длина последовательности, а умеренная точка, где VAE уже достаточно акустичен, а диффузионная голова еще не перегружена.

Оригинальная статья на arXiv