Диффузионная музыкальная модель для преобразования голоса
Статья проверяет, можно ли взять диффузионную модель, изначально сделанную для синтеза многодорожечной музыки, и перенести ее на преобразование речи и пения. Интерес здесь в междоменном переносе: вместо отдельной модели для речи, отдельной для пения и отдельной для музыки авторы пытаются использовать одну архитектурную идею с разными управляющими признаками. Главный ход простой, но содержательный: нотное условие заменяют на фонетические posteriorgram-признаки и контур основного тона, а тембровое условие трактуют как личность говорящего или певца.
Метод. Вариант T5-Voc получает PPG-признаки, контур f0 и условие на исполнителя через FiLM-модуляцию; это условие подается и в кодировщик, и в декодировщик. Для пения авторы отдельно адаптируют диапазон высоты тона к целевому исполнителю, чтобы перенос женского голоса на мужской не оставлял нереалистично высокий регистр. Есть и модель T5-All, куда добавляют инструментальные данные и piano-roll признаки: она нужна для смешанных вокально-инструментальных сцен, но усложняет задачу для чистого вокала.
Результаты. В тесте естественности T5-Voc получает 68.63±18.11 для речи и 59.11±17.54 для пения. Для речи это практически равно специализированной MAC-Voc модели: 68.34±17.98, p=0.69. Для пения T5-Voc выше MAC-Voc: 59.11 против 55.84, p=7.24e-3. По сходству с целевым певцом T5-Voc поднимает среднюю оценку с 1.76±1.06 при условии на другого певца до 3.25±1.09 при условии на нужного певца; у MAC-Voc средняя оценка ниже, 2.75. По pitch accuracy модель тоже сильна: RPA 83.0 для речи и 94.7 для пения.
Ограничения. Самый важный минус: фонетическая точность хуже, чем у специализированной MAC-Voc. По PPG distance T5-Voc уступает MAC-Voc и для речи, и для пения, а авторы приводят качественный пример, где немецкий гортанный /r/ превращается в английский приближенный /r/. Добавление инструментальных данных ухудшает естественность примерно на 10-15 пунктов. Кроме того, оценка фонетики здесь автоматическая, без отдельного слушательского теста на разборчивость.
Фишка из статьи. Самое полезное наблюдение не в том, что T5-Voc "лучше" базовой системы, а в разрыве между естественностью и фонетической верностью. Модель звучит естественно и хорошо держит высоту, но за это платит большей свободой в произношении.
| Модель | Естественность речи | Естественность пения | Сходство с певцом | PPG J-S, речь |
|---|---|---|---|---|
| T5-Voc | 68.63 | 59.11 | 3.25 | 0.338 |
| MAC-Voc | 68.34 | 55.84 | 2.75 | 0.322 |
| T5-All | 53.15 | 49.94 | не оценивалось | 0.352 |
Как это читать: T5-Voc лучше воспринимается на слух и сильнее передает личность певца, но MAC-Voc точнее сохраняет фонетическое содержание. Для дубляжа или singing voice conversion это означает выбор между выразительностью и буквальной сохранностью произношения.