Речевые единицы Нормализация говорящего Синтез и преобразование голоса
arXiv eess.AS

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

arXiv:2608.16235

Семантические речевые единицы должны хранить содержание, но часто продолжают кодировать говорящего и темп. ISTP использует простой критерий отбора: всё, что можно надёжно предсказать только по тексту, вероятнее относится к содержанию; непредсказуемые детали голоса и длительности следует ослабить. Для этого речевой и текстовый преобразователи единиц поочерёдно переучивают друг друга.

Метод. Исходный речевой токенизатор на HuBERT выдаёт 4096 дискретных единиц с частотой 25 Гц, после чего повторы удаляются. BART учится предсказывать эту последовательность по фонемам текста. Его декодированный результат становится CTC-целью для заново инициализированного речевого токенизатора, который затем создаёт данные для следующего BART; выполнено четыре цикла. Для честной проверки исходного и итогового пространств отдельно обучаются одинаковые декодеры речи примерно на 100 000 часов Mandarin и English Emilia.

Результаты. От T0 к T4 ошибка согласования речевого и текстового преобразователей снижается относительно на 72,0-86,7%, а BLEU растёт на 58,88-73,39 пункта; к четвёртому циклу разница между ними не превышает 0,0058 WER и 0,85 BLEU. На VCTK расстояние редактирования единиц UED падает с 344,61 до 59,44, SelfBLEU-4 растёт с 27,04 до 94,17. При преобразовании голоса английский WER немного улучшается с 3,00% до 2,94%, а сходство с заданным голосом - с 0,63 до 0,71; для китайского сходство растёт с 0,73 до 0,77.

Ограничения. Четыре переобучения S2U и T2U плюс отдельные декодеры на 100 000 часов делают метод дорогим, хотя время и энергозатраты не приведены. Проверены только китайский и английский, без субъективного прослушивания и задач понимания речи. Точность определения говорящего по исходным единицам уже всего 0,10%, поэтому её снижение до 0,09% мало в абсолютном выражении. Высокая одинаковость последовательностей может удалить полезную просодию, что не проверено на эмоциях или пении.

Фишка из статьи. Нормализация подтверждается сразу на трёх уровнях: одинаковый текст у разных говорящих получает почти одинаковые единицы, простой классификатор хуже восстанавливает личность, а декодер лучше следует темпу опорного голоса.

ЕдиницыUED, ниже лучшеSelfBLEU-4Точность определения говорящегоАнглийский VC: WER / SIM
R-Spin241,4276,640,15%-
ISTP, цикл 0344,6127,040,10%3,00% / 0,63
ISTP, цикл 459,4494,170,09%2,94% / 0,71

Как это читать: рост сходства единиц не покупается явной потерей разборчивости. Но почти нулевая точность классификатора не доказывает полной анонимности: более сильная атака или другие признаки могут всё ещё извлечь личность.

Оригинальная статья на arXiv