преобразование голоса потоковые модели ускорение вывода
arXiv cs.SD

MeanVoiceFlow2: совместное обучение среднего потока и кодировщика содержания для быстрого однопроходного преобразования голоса без предварительной настройки

arXiv:2609.40087

MeanVoiceFlow2 решает практическую проблему однопроходного преобразования голоса: быстрый генератор должен одновременно сохранить содержание реплики и перенести голос целевого человека, хотя эти требования тянут обучение в разные стороны. Авторы не просто дистиллируют многопроходную потоковую модель, а совместно обучают генератор и кодировщик содержания на преобразованных и реальных парах, дополняя это учительским возмущением условий.

Метод. Ветка преобразования учится воспроизводить выход учителя, а ветка реконструкции на реальной речи удерживает фонетическую информацию. Диффузионный состязательный критерий со смешиванием примеров позволяет свести генерацию к одному шагу; предварительно обученный вокодер не нужен. Дополнительное возмущение условий заставляет кодировщик не привязываться к единственной траектории учителя.

Результаты. На VCTK модель получает nMOS 3,93 против 3,76 у MeanVoiceFlow при одинаковом CER 1,2% и близком косинусном сходстве говорящего 0,887 против 0,886. Главный выигрыш вычислительный: RTF снижается с 0,0072 до 0,00084, то есть примерно в 8,6 раза. В субъективном тесте участвовали 12 слушателей, для каждой модели собрано более 1500 оценок.

Ограничения. Скорость измерена на RTX 4090 и не показывает задержку на процессоре или мобильном ускорителе. Субъективная выборка невелика, а значительная часть анализа опирается на автоматические MOS-оценщики; перенос на шумную спонтанную речь и языки вне обучающих данных не проверен.

Фишка из статьи. Абляция показывает, что совместное обучение нужно не для небольшого среднего прироста, а для устранения двух разных отказов. Только преобразование хорошо держит голос, но чаще искажает слова; только реконструкция почти идеально сохраняет текст, однако теряет сходство с целевым говорящим.

Обучающая схемаDNSP-MOS ↑CER ↓Сходство говорящего ↑
Только преобразование2,941,8%0,885
Только реконструкция2,400,1%0,641
Совместное обучение2,971,5%0,885
Совместное обучение с возмущением условий2,991,2%0,885

Как это читать: ветка реконструкции сама по себе не решает преобразование голоса, но в совместной схеме служит сильным ограничением на содержание; возмущение условий затем возвращает CER к уровню полной модели без потери сходства.

Оригинальная статья на arXiv