CtrlSpeech: локальное управление просодией в синтезе речи
CtrlSpeech решает задачу, где современные системы синтеза речи все еще неудобны: голос можно клонировать, но трудно точечно поправить высоту, громкость или длительность отдельного слова. Авторы строят контролируемую систему поверх DiTAR и разделяют управление на грубое условие диктора и тонкие телефонно-выровненные сигналы просодии. Главная ценность статьи в том, что качество нулевого переноса голоса не приносится в жертву локальному управлению.
Метод. Система использует глобальное условие диктора через speaker embedding и prompt speech, а локальные pitch, loudness и duration подаются на уровне фонем. По сравнению с обычным синтезом из текста модель получает не только текстовую последовательность и пример голоса, но и явные временные контуры, которые можно редактировать. Проверены две версии, 0.1B и 0.6B параметров; основная сильная конфигурация - 0.6B.
Результаты. На LibriSpeech-PC test-clean CtrlSpeech 0.6B получает WER 2.46% и SIM-o 0.65 против воспроизведенного DiTAR с 2.55% и 0.61. На Seed-TTS test-en результат также лучше по объективным метрикам: 2.58% WER и 0.63 SIM-o против 2.89% и 0.59. Контроль просодии дает более сильный эффект: на LJSpeech pitch RMSE снижается с 67.86 до 38.39 Гц, loudness RMSE с 6.35 до 4.56 дБ, а ошибка длительности фонем на LibriSpeech-PC падает с 28.08 до 11.86.
Ограничения. Сравнение с DiTAR основано на собственной репродукции, потому что исходный DiTAR не открыт. Тонкий контроль проверен на ограниченных наборах и в основном через автоматические метрики; перенос на эмоциональные, многоязычные или шумные данные пока не доказан. Младшая версия 0.1B заметно слабее по WER, так что компактность здесь не бесплатна.
Фишка из статьи. Самый сильный результат не в том, что WER немного ниже, а в том, насколько резко падает ошибка длительности при включении фонемного контроля.
| Сравнение | Число | Что означает |
|---|---|---|
| CtrlSpeech 0.6B без duration control | 28.08 MAE | Длительность фонем примерно на уровне DiTAR |
| CtrlSpeech 0.6B с duration control | 11.86 MAE | Модель начинает следовать заданному ритму |
| Pitch control | 67.86 -> 38.39 Гц RMSE | Высота ближе к целевому контуру |
| Loudness control | 6.35 -> 4.56 дБ RMSE | Громкость лучше поддается локальной правке |
Как это читать: статья показывает важный для редакторов речи режим: пользовательский контроль должен оцениваться не только MOS/WER, но и ошибкой следования конкретному управляющему сигналу.