Luna-TTS Family Technical Report
Luna-TTS заменяет последовательное предсказание кодековых токенов диффузионным уточнением всей сетки, а потоковый вариант делает авторегрессию только между блоками по 1,28 секунды. Это редкая работа, где рядом с качеством опубликованы локальная задержка первого блока, полный RTF и влияние параллельного classifier-free guidance.
Метод. Семейство вырастает из текстовой авторегрессионной модели: внимание последовательно переводят в двунаправленный, а затем в блочно-причинный режим. Luna-TTS целиком заполняет сетку RVQ за фиксированное число шагов; Luna-TTS Realtime генерирует блоки по 32 кодековых кадра и хранит кэш ключей и значений между блоками. Обе модели имеют общий токенизатор и основу на 0,6 млрд параметров, предобученную на одном миллионе часов китайской, английской, японской и корейской речи.
Результаты. На Seed-TTS-Eval непотоковая Luna получает CER 0,73% и SIM 79,7 для китайского, WER 1,49% и SIM 76,8 для английского. Потоковая версия слабее: 1,08%/76,9 и 1,81%/73,4. На сложном CV3-Eval средняя ошибка составляет 4,32% у Luna и 4,95% у Realtime, но на трудных китайском и английском поднаборах потоковая модель поднимается до 12,56% и 13,98%. Самая быстрая конфигурация дает первый блок за 41,6 мс и полный RTF 0,0240 на двух H20.
Ограничения. Поддерживаются только четыре языка, причем корейский заметно слабее - средняя ошибка 5,93%, что согласуется с долей корейских данных 6,9%. Непотоковая версия использует внешний предсказатель длительности, потоковая привязана к блоку 1,28 секунды. Измерения сделаны после прогрева, без сетевой задержки, на мощных H20; перенос на одну потребительскую видеокарту или процессор не показан. Внутренняя TTS Arena не дает статистически ясной победы над Gemini из-за перекрывающихся доверительных интервалов Elo.
Фишка из статьи. Таблица задержек показывает, что восемь шагов и две видеокарты дают почти вдвое меньший RTF, чем 16 шагов на двух картах, при локальной задержке первого блока 41,6 мс.
| Режим | Устройство | Шаги | Первый блок | Полный RTF |
|---|---|---|---|---|
| Luna, непотоковая | 1x H20 | 32 | - | 0,0410 |
| Luna, непотоковая | 1x H20 | 16 | - | 0,0211 |
| Realtime, последовательный CFG | 1x H20 | 16 | 98,9 мс | 0,0790 |
| Realtime, параллельный CFG | 2x H20 | 16 | 63,8 мс | 0,0426 |
| Realtime, параллельный CFG | 2x H20 | 8 | 41,6 мс | 0,0240 |
Как это читать: алгоритмически потоковая модель действительно быстра, но лучший опубликованный режим требует двух ускорителей. Поэтому цифра 41,6 мс описывает серверный путь после прогрева, а не готовую задержку пользовательского устройства.