Синтез речи Low latency Mobile
Синтез речи

StellarTTS: низкая задержка без обвала разборчивости

RTF 0.08

StellarTTS решает практичную задачу синтеза речи: получить неавторегрессионную скорость, но не потерять произношение, длительности фонем и просодию на сложных фразах. Авторы предлагают sparse temporal embedding, то есть редкое временное представление, которое задает локальные временные опоры без жесткого полного выравнивания. В итоге модель нацелена на мобильный сценарий, где задержка важна не меньше MOS.

Метод. В отличие от авторегрессионных TTS-систем, StellarTTS не генерирует речь последовательно токен за токеном, а использует легкий masked generative transformer на 83M параметров. Sparse temporal embedding передает длительность, произношение и просодические подсказки в более управляемом виде, а semantic-aware codec позволяет одноэтапное декодирование. Это должно уменьшать типичные ошибки быстрых неавторегрессионных моделей: съеденные слоги, нестабильную длительность и плоскую просодию.

Результаты. На Seed-TTS test-zh модель дает WER 1.44 и SIM-o 0.712 при RTF 0.08; на сложном test-hard WER равен 7.47. Для сравнения, F5-TTS имеет RTF 0.31 и WER 8.67 на test-hard, MaskGCT - RTF 0.71 и WER 10.27. В субъективной оценке StellarTTS получает CMOS 0.06 на обычном наборе и 0.05 на hard-наборе, то есть не проигрывает естественности в обмен на скорость.

Ограничения. По сходству диктора StellarTTS не лучший: SIM-o ниже, чем у MaskGCT и местами ниже, чем у F5-TTS. Основная оценка идет на Seed-TTS и китайском тестовом наборе, поэтому перенос на многоязычный, шумный или эмоциональный синтез не доказан. Также RTF измерен на A100, а заявка на мобильность требует дополнительных чисел по телефону или встроенному ускорителю.

Фишка из статьи. Абляция хорошо показывает, что главный вклад не в размере модели, а во временном представлении. Если убрать sparse temporal embedding, разборчивость на сложном наборе почти рушится.

Вариантtest-zh WERtest-zh SIM-otest-hard WERtest-hard SIM-o
StellarTTS1.440.7127.470.697
без central strategy2.340.7019.150.688
без temporal embedding4.100.69318.120.670
без speaker embedding1.580.6547.310.626

Как это читать: удаление speaker embedding сильнее бьет по сходству голоса, но не по WER; удаление temporal embedding резко ухудшает именно разборчивость. Это подтверждает, что временная разметка в StellarTTS отвечает за устойчивость произношения, а не просто за косметическую просодию.

Оригинальная статья на arXiv