Синтез речи Невербальные вокализации DPO
arXiv eess.AS

Preference Optimization for Non-Verbal Vocalization Synthesis

arXiv:2608.24163

Работа разбирает, как дообучать синтезатор на предпочтениях, когда в тексте есть смех, кашель, вздохи и другие невербальные вокализации. Обычная ошибка символов почти не видит, был ли смешок произнесён и в нужном ли месте, поэтому DPO легко улучшает слова ценой исчезновения таких событий. Авторы вводят отдельную меру NV-CER и, что ценнее, систематически проверяют, какие пары «лучше-хуже» действительно пригодны для обучения.

Метод. CosyVoice2-0.5B сначала дообучается четыре эпохи на Emilia-NV, затем для примерно 100 часов сбалансированных примеров генерируется по восемь вариантов. Специализированное распознавание различает 18 тегов невербальных событий. NV-CER считает взвешенную ошибку по объединённой последовательности китайских слогов и тегов; вес тега можно поднять, не меняя сам DPO. Предпочтительной становится синтетическая запись с минимальным NV-CER, отвергнутой - запись с максимальным. Дополнительно авторы проверяют смесь NV-CER с UTMOS, обычный CER, эталонную запись как положительный пример и совмещение DPO с контролируемым обучением.

Результаты. На тесте с одним тегом базовая модель имеет NV-CER 3,47, ошибку невербальных событий PCER 32,78 и обычный CER 2,74. DPO по NV-CER снижает их до 2,59, 21,33 и 2,09; добавление UTMOS сохраняет NV-CER 2,58 и повышает предсказанный UTMOS с 2,01 до 2,11. На примерах с несколькими тегами вариант NV-CER плюс UTMOS получает 4,25/31,31/3,27 против 4,98/39,28/3,69 у исходной модели. В человеческом сравнении много ничьих, но среди определившихся оценок новая модель выигрывает 55,5% против 44,5% по точности событий и 57,2% против 42,8% по словам; убедительного выигрыша естественности нет.

Ограничения. NV-CER зависит от собственного распознавателя тегов и китайского слогового представления, поэтому перенос на другой язык не автоматичен. Предпочтения строятся на синтетических вариантах одной базовой модели и могут закреплять её характерные ошибки. Прослушивание включает 11 носителей языка и показывает в основном небольшие различия с большим числом ничьих. UTMOS почти не оценивает естественность смеха или кашля, что авторы сами видят по расхождению машинных и человеческих оценок.

Фишка из статьи. Самый сильный отрицательный результат касается, казалось бы, идеального положительного примера: эталонная запись делает обычный DPO практически неработоспособным.

Положительный примерОтрицательный примерNV-CERPCERCER
Эталонная записьХудший синтетический93,42104,8993,20
Эталон или лучший синтетическийХудший синтетический65,1875,2264,99
Лучший синтетическийВариант без события22,9552,8922,23
Лучший синтетическийХудший синтетический2,5921,332,09

Как это читать: DPO лучше работает, когда оба ответа взяты из распределения самой модели и различаются качеством, а не когда один из них является внешней записью. Эталон слишком легко отличить по побочным акустическим признакам, и цель предпочтения уводит модель от нужного поведения.

Оригинальная статья на arXiv