CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation
CookVoice объединяет синтез речи, пения, преобразование голоса и редактирование в одной модели на 43,51 млн параметров. Интересен не сам список режимов, а единое разложение голоса на содержание, просодию и стиль с покадровым выравниванием управляющих сигналов: высоту тона и тембр можно менять независимо, не вводя отдельную архитектуру для каждого задания.
Метод. Текст, непрерывная траектория F0, стиль и опорный голос приводятся к общей временной сетке спектрограммы. Небольшой диффузионный преобразователь DiT-S обучается согласованию потоков и генерирует как речь, так и пение; те же факторы используются для подражания голосу, преобразования и локального редактирования. Обучающий набор содержит 168 часов, около 123 тысяч примеров и 6 361 говорящего на английском и китайском, причем отношение пения к речи равно примерно 1:9.
Результаты. Для синтеза с заданным голосом и непрерывной просодией сходство говорящего достигает 91,65%, корреляция F0 - 0,7102; в режиме преобразования текста в певческий голос - 95,00% и 0,8425. CookVoice получает MOS 3,98 для речи при 4,05 у исходных записей, но по разборчивости не всегда лидирует: WER для английского в одном из основных режимов равен 4,19%. На одной видеокарте модель показывает RTF 0,04, тогда как Vevo2 - 14,85 при 872 млн параметров.
Ограничения. Данные сравнительно невелики, языков только два, а пение составляет малую долю набора. Небольшой DiT-S ограничивает верхнюю границу качества, что сами авторы оставляют для дальнейшего масштабирования. Оценки MOS и управляемости охватывают не все заявленные режимы, а модель работает только с человеческим голосом, не с общими звуковыми сценами.
Фишка из статьи. Число шагов решения ОДУ дает нетривиальный компромисс: больше шагов не означает монотонно лучший голос. Сходство содержания и голоса достигает насыщения уже около 4-8 шагов, а затем отдельные показатели ухудшаются.
| Система | Параметры | Память CUDA | RTF |
|---|---|---|---|
| CookVoice | 43,51 млн | 1,37 ГБ | 0,04 |
| Vevo2 | 872 млн | 6,84 ГБ | 14,85 |
Как это читать: CookVoice использует около 5% параметров Vevo2, пятую часть памяти и генерирует существенно быстрее реального времени. Практический режим авторов - 4-8 шагов: увеличение числа шагов после этого дает слабый или отрицательный выигрыш и зря увеличивает задержку.