Синтез речи Диффузионная модель Потоковая генерация
arXiv cs.SD

Luna-TTS Family Technical Report

arXiv:2608.11593

Luna-TTS заменяет последовательное предсказание кодековых токенов диффузионным уточнением всей сетки, а потоковый вариант делает авторегрессию только между блоками по 1,28 секунды. Это редкая работа, где рядом с качеством опубликованы локальная задержка первого блока, полный RTF и влияние параллельного classifier-free guidance.

Метод. Семейство вырастает из текстовой авторегрессионной модели: внимание последовательно переводят в двунаправленный, а затем в блочно-причинный режим. Luna-TTS целиком заполняет сетку RVQ за фиксированное число шагов; Luna-TTS Realtime генерирует блоки по 32 кодековых кадра и хранит кэш ключей и значений между блоками. Обе модели имеют общий токенизатор и основу на 0,6 млрд параметров, предобученную на одном миллионе часов китайской, английской, японской и корейской речи.

Результаты. На Seed-TTS-Eval непотоковая Luna получает CER 0,73% и SIM 79,7 для китайского, WER 1,49% и SIM 76,8 для английского. Потоковая версия слабее: 1,08%/76,9 и 1,81%/73,4. На сложном CV3-Eval средняя ошибка составляет 4,32% у Luna и 4,95% у Realtime, но на трудных китайском и английском поднаборах потоковая модель поднимается до 12,56% и 13,98%. Самая быстрая конфигурация дает первый блок за 41,6 мс и полный RTF 0,0240 на двух H20.

Ограничения. Поддерживаются только четыре языка, причем корейский заметно слабее - средняя ошибка 5,93%, что согласуется с долей корейских данных 6,9%. Непотоковая версия использует внешний предсказатель длительности, потоковая привязана к блоку 1,28 секунды. Измерения сделаны после прогрева, без сетевой задержки, на мощных H20; перенос на одну потребительскую видеокарту или процессор не показан. Внутренняя TTS Arena не дает статистически ясной победы над Gemini из-за перекрывающихся доверительных интервалов Elo.

Фишка из статьи. Таблица задержек показывает, что восемь шагов и две видеокарты дают почти вдвое меньший RTF, чем 16 шагов на двух картах, при локальной задержке первого блока 41,6 мс.

РежимУстройствоШагиПервый блокПолный RTF
Luna, непотоковая1x H2032-0,0410
Luna, непотоковая1x H2016-0,0211
Realtime, последовательный CFG1x H201698,9 мс0,0790
Realtime, параллельный CFG2x H201663,8 мс0,0426
Realtime, параллельный CFG2x H20841,6 мс0,0240

Как это читать: алгоритмически потоковая модель действительно быстра, но лучший опубликованный режим требует двух ускорителей. Поэтому цифра 41,6 мс описывает серверный путь после прогрева, а не готовую задержку пользовательского устройства.

Оригинальная статья на arXiv