преобразование голоса без обучения WavLM
arXiv eess.AS

StateVC: локальные преобразования в общем пространстве состояний для преобразования голоса без обучения

arXiv:2610.01952

StateVC выполняет однократное преобразование голоса без дообучения и без явного выравнивания кадров исходной и эталонной речи. Основной ход — построить для обеих записей общее пространство локальных акустических состояний, а затем переносить голос отдельным сдвигом среднего внутри каждого состояния.

Метод. Признаки WavLM исходной и опорной записей объединяются и описываются общей гауссовой смесью. Для каждого состояния вычисляется разность средних, а кадры исходной речи мягко распределяются между состояниями по апостериорным вероятностям. Это заменяет ненадёжное сопоставление кластеров, полученных для двух записей независимо.

Результаты. На 7800 междикторских парах LibriSpeech StateVC достигает WER 8,01%, CER 3,22% и сходства диктора 0,9512. Субъективная естественность равна 3,55, сходство голоса — 2,75; среди рассмотренных методов без обучения это лучшие показатели разборчивости и слушательских оценок, хотя отдельные варианты дают немного более высокий автоматический балл сходства.

Ограничения. Проверка ограничена английской LibriSpeech и режимом с одной опорной записью. Общая смесь оценивается заново для каждой пары и не исследована в потоковом режиме. Автоматическая метрика сходства заметно оптимистичнее субъективной, поэтому перенос на экспрессивную или межъязыковую речь остаётся открытым.

Фишка из статьи. Ключевым оказывается не более гибкое преобразование, а единая система координат. Независимые смеси с одинаковыми номерами компонентов почти разрушают текст, алгоритм Венгера исправляет лишь часть ошибок, а общая смесь сразу снижает WER до однозначных значений.

Вариант состоянийWERCERСходство диктора
Раздельные смеси, одинаковые индексы40,28%26,40%—
Раздельные смеси + алгоритм Венгера13,82%6,60%0,9541
Общая смесь8,44%3,48%0,9540
Общая смесь, итоговый простой сдвиг8,01%3,22%0,9512

Как это читать: почти одинаковое автоматическое сходство скрывает огромную разницу в сохранении содержания. Более сложные диагональные и блочные преобразования дают лишь крошечный выигрыш в сходстве, но ухудшают WER; простой локальный перенос среднего оказывается устойчивее.

Оригинальная статья на arXiv