MeanVoiceFlow2: совместное обучение среднего потока и кодировщика содержания для быстрого однопроходного преобразования голоса без предварительной настройки
MeanVoiceFlow2 решает практическую проблему однопроходного преобразования голоса: быстрый генератор должен одновременно сохранить содержание реплики и перенести голос целевого человека, хотя эти требования тянут обучение в разные стороны. Авторы не просто дистиллируют многопроходную потоковую модель, а совместно обучают генератор и кодировщик содержания на преобразованных и реальных парах, дополняя это учительским возмущением условий.
Метод. Ветка преобразования учится воспроизводить выход учителя, а ветка реконструкции на реальной речи удерживает фонетическую информацию. Диффузионный состязательный критерий со смешиванием примеров позволяет свести генерацию к одному шагу; предварительно обученный вокодер не нужен. Дополнительное возмущение условий заставляет кодировщик не привязываться к единственной траектории учителя.
Результаты. На VCTK модель получает nMOS 3,93 против 3,76 у MeanVoiceFlow при одинаковом CER 1,2% и близком косинусном сходстве говорящего 0,887 против 0,886. Главный выигрыш вычислительный: RTF снижается с 0,0072 до 0,00084, то есть примерно в 8,6 раза. В субъективном тесте участвовали 12 слушателей, для каждой модели собрано более 1500 оценок.
Ограничения. Скорость измерена на RTX 4090 и не показывает задержку на процессоре или мобильном ускорителе. Субъективная выборка невелика, а значительная часть анализа опирается на автоматические MOS-оценщики; перенос на шумную спонтанную речь и языки вне обучающих данных не проверен.
Фишка из статьи. Абляция показывает, что совместное обучение нужно не для небольшого среднего прироста, а для устранения двух разных отказов. Только преобразование хорошо держит голос, но чаще искажает слова; только реконструкция почти идеально сохраняет текст, однако теряет сходство с целевым говорящим.
| Обучающая схема | DNSP-MOS ↑ | CER ↓ | Сходство говорящего ↑ |
|---|---|---|---|
| Только преобразование | 2,94 | 1,8% | 0,885 |
| Только реконструкция | 2,40 | 0,1% | 0,641 |
| Совместное обучение | 2,97 | 1,5% | 0,885 |
| Совместное обучение с возмущением условий | 2,99 | 1,2% | 0,885 |
Как это читать: ветка реконструкции сама по себе не решает преобразование голоса, но в совместной схеме служит сильным ограничением на содержание; возмущение условий затем возвращает CER к уровню полной модели без потери сходства.