Синтез речи Пение Управление просодией
arXiv cs.SD

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

arXiv:2608.11590

CookVoice объединяет синтез речи, пения, преобразование голоса и редактирование в одной модели на 43,51 млн параметров. Интересен не сам список режимов, а единое разложение голоса на содержание, просодию и стиль с покадровым выравниванием управляющих сигналов: высоту тона и тембр можно менять независимо, не вводя отдельную архитектуру для каждого задания.

Метод. Текст, непрерывная траектория F0, стиль и опорный голос приводятся к общей временной сетке спектрограммы. Небольшой диффузионный преобразователь DiT-S обучается согласованию потоков и генерирует как речь, так и пение; те же факторы используются для подражания голосу, преобразования и локального редактирования. Обучающий набор содержит 168 часов, около 123 тысяч примеров и 6 361 говорящего на английском и китайском, причем отношение пения к речи равно примерно 1:9.

Результаты. Для синтеза с заданным голосом и непрерывной просодией сходство говорящего достигает 91,65%, корреляция F0 - 0,7102; в режиме преобразования текста в певческий голос - 95,00% и 0,8425. CookVoice получает MOS 3,98 для речи при 4,05 у исходных записей, но по разборчивости не всегда лидирует: WER для английского в одном из основных режимов равен 4,19%. На одной видеокарте модель показывает RTF 0,04, тогда как Vevo2 - 14,85 при 872 млн параметров.

Ограничения. Данные сравнительно невелики, языков только два, а пение составляет малую долю набора. Небольшой DiT-S ограничивает верхнюю границу качества, что сами авторы оставляют для дальнейшего масштабирования. Оценки MOS и управляемости охватывают не все заявленные режимы, а модель работает только с человеческим голосом, не с общими звуковыми сценами.

Фишка из статьи. Число шагов решения ОДУ дает нетривиальный компромисс: больше шагов не означает монотонно лучший голос. Сходство содержания и голоса достигает насыщения уже около 4-8 шагов, а затем отдельные показатели ухудшаются.

СистемаПараметрыПамять CUDARTF
CookVoice43,51 млн1,37 ГБ0,04
Vevo2872 млн6,84 ГБ14,85

Как это читать: CookVoice использует около 5% параметров Vevo2, пятую часть памяти и генерирует существенно быстрее реального времени. Практический режим авторов - 4-8 шагов: увеличение числа шагов после этого дает слабый или отрицательный выигрыш и зря увеличивает задержку.

Оригинальная статья на arXiv