VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation
VoiceDesigner объединяет создание голоса по текстовому описанию, клонирование и редактирование в одной диффузионной модели. Работа интересна не только архитектурой: авторы явно используют цифровую обработку сигналов, чтобы получить голоса роботов, драконов и других персонажей, для которых обычных записей почти нет.
Метод. Основа системы - многопоточный диффузионный преобразователь MM-DiT. Обычную общую позиционную шкалу авторы заменяют трёхмерным RoPE: инструкция, текст произнесения и звуковые признаки получают собственные координаты, а токенный AdaLN сообщает каждому элементу его уровень диффузионного шума. Предобучение использует 56 165 часов английской речи. Для необычных голосов применяются сдвиг основного тона и формант, реверберация, эквализация, полосовая фильтрация, компрессия и изменение контура высоты тона; второй конвейер расширяет материал клонированием и преобразованием голоса. Синтетические примеры отбрасываются при WER выше 0,1 или сходстве говорящего ниже 0,6.
Результаты. На 520 описаниях VoiceDesigner получает WER 1,22% и точность стилевых признаков 0,66, лучше Qwen3-TTS VoiceDesign с 1,39% и 0,50. В тесте человеческих голосов согласие с описанием MOS-C равно 3,93 против 3,10 у Qwen3-TTS и 4,00 у ElevenLabs; для персонажей результат 3,71 против 3,59 и 4,26 соответственно. Чистота исходного звука слабее: MOS-Q персонажей составляет 3,60, но внешняя обработка повышает его до 3,92. При редактировании VoiceDesigner достигает MOS-E 4,129 и сходства с целевым голосом 0,884 против 3,494 и 0,856 у IndexTTS-2.
Ограничения. Все опыты ограничены английским языком, а редкие персонажные голоса опираются на внутренний 16-часовой набор и синтетические эффекты. Предобучение и адаптация требуют до 64 A100, поэтому воспроизводимость затрат остаётся слабой. Для части сравнений использованы закрытые системы и фирменное средство очистки Adobe; без него слышимый шум остаётся заметным. Субъективные тесты охватывают много слушателей, но каждый пример получает лишь четыре или немного больше оценок.
Фишка из статьи. Единая модель выполняет и создание, и редактирование быстрее реального времени. Особенно показательно, что редактирование не оплачивается двукратной задержкой относительно специализированных систем.
| Задача | Система | RTF на RTX 4090 |
|---|---|---|
| Создание голоса | CapSpeech | 0,33 |
| Создание голоса | VoiceDesigner | 0,36 |
| Создание голоса | Qwen3-TTS | 1,21 |
| Редактирование | VoiceDesigner | 0,42 |
| Редактирование | IndexTTS-2 | 0,72 |
| Редактирование | Step-Audio-EditX | 0,80 |
Как это читать: RTF меньше единицы означает обработку быстрее длительности самого звука. На одной RTX 4090 VoiceDesigner почти не уступает CapSpeech в создании голоса, заметно опережает Qwen3-TTS и сохраняет запас реального времени при редактировании; однако измерение не включает серверную очередь и внешнюю очистку звука.