StellarTTS: низкая задержка без обвала разборчивости
StellarTTS решает практичную задачу синтеза речи: получить неавторегрессионную скорость, но не потерять произношение, длительности фонем и просодию на сложных фразах. Авторы предлагают sparse temporal embedding, то есть редкое временное представление, которое задает локальные временные опоры без жесткого полного выравнивания. В итоге модель нацелена на мобильный сценарий, где задержка важна не меньше MOS.
Метод. В отличие от авторегрессионных TTS-систем, StellarTTS не генерирует речь последовательно токен за токеном, а использует легкий masked generative transformer на 83M параметров. Sparse temporal embedding передает длительность, произношение и просодические подсказки в более управляемом виде, а semantic-aware codec позволяет одноэтапное декодирование. Это должно уменьшать типичные ошибки быстрых неавторегрессионных моделей: съеденные слоги, нестабильную длительность и плоскую просодию.
Результаты. На Seed-TTS test-zh модель дает WER 1.44 и SIM-o 0.712 при RTF 0.08; на сложном test-hard WER равен 7.47. Для сравнения, F5-TTS имеет RTF 0.31 и WER 8.67 на test-hard, MaskGCT - RTF 0.71 и WER 10.27. В субъективной оценке StellarTTS получает CMOS 0.06 на обычном наборе и 0.05 на hard-наборе, то есть не проигрывает естественности в обмен на скорость.
Ограничения. По сходству диктора StellarTTS не лучший: SIM-o ниже, чем у MaskGCT и местами ниже, чем у F5-TTS. Основная оценка идет на Seed-TTS и китайском тестовом наборе, поэтому перенос на многоязычный, шумный или эмоциональный синтез не доказан. Также RTF измерен на A100, а заявка на мобильность требует дополнительных чисел по телефону или встроенному ускорителю.
Фишка из статьи. Абляция хорошо показывает, что главный вклад не в размере модели, а во временном представлении. Если убрать sparse temporal embedding, разборчивость на сложном наборе почти рушится.
| Вариант | test-zh WER | test-zh SIM-o | test-hard WER | test-hard SIM-o |
|---|---|---|---|---|
| StellarTTS | 1.44 | 0.712 | 7.47 | 0.697 |
| без central strategy | 2.34 | 0.701 | 9.15 | 0.688 |
| без temporal embedding | 4.10 | 0.693 | 18.12 | 0.670 |
| без speaker embedding | 1.58 | 0.654 | 7.31 | 0.626 |
Как это читать: удаление speaker embedding сильнее бьет по сходству голоса, но не по WER; удаление temporal embedding резко ухудшает именно разборчивость. Это подтверждает, что временная разметка в StellarTTS отвечает за устойчивость произношения, а не просто за косметическую просодию.