StateVC: локальные преобразования в общем пространстве состояний для преобразования голоса без обучения
StateVC выполняет однократное преобразование голоса без дообучения и без явного выравнивания кадров исходной и эталонной речи. Основной ход — построить для обеих записей общее пространство локальных акустических состояний, а затем переносить голос отдельным сдвигом среднего внутри каждого состояния.
Метод. Признаки WavLM исходной и опорной записей объединяются и описываются общей гауссовой смесью. Для каждого состояния вычисляется разность средних, а кадры исходной речи мягко распределяются между состояниями по апостериорным вероятностям. Это заменяет ненадёжное сопоставление кластеров, полученных для двух записей независимо.
Результаты. На 7800 междикторских парах LibriSpeech StateVC достигает WER 8,01%, CER 3,22% и сходства диктора 0,9512. Субъективная естественность равна 3,55, сходство голоса — 2,75; среди рассмотренных методов без обучения это лучшие показатели разборчивости и слушательских оценок, хотя отдельные варианты дают немного более высокий автоматический балл сходства.
Ограничения. Проверка ограничена английской LibriSpeech и режимом с одной опорной записью. Общая смесь оценивается заново для каждой пары и не исследована в потоковом режиме. Автоматическая метрика сходства заметно оптимистичнее субъективной, поэтому перенос на экспрессивную или межъязыковую речь остаётся открытым.
Фишка из статьи. Ключевым оказывается не более гибкое преобразование, а единая система координат. Независимые смеси с одинаковыми номерами компонентов почти разрушают текст, алгоритм Венгера исправляет лишь часть ошибок, а общая смесь сразу снижает WER до однозначных значений.
| Вариант состояний | WER | CER | Сходство диктора |
|---|---|---|---|
| Раздельные смеси, одинаковые индексы | 40,28% | 26,40% | — |
| Раздельные смеси + алгоритм Венгера | 13,82% | 6,60% | 0,9541 |
| Общая смесь | 8,44% | 3,48% | 0,9540 |
| Общая смесь, итоговый простой сдвиг | 8,01% | 3,22% | 0,9512 |
Как это читать: почти одинаковое автоматическое сходство скрывает огромную разницу в сохранении содержания. Более сложные диагональные и блочные преобразования дают лишь крошечный выигрыш в сходстве, но ухудшают WER; простой локальный перенос среднего оказывается устойчивее.