Preference Optimization for Non-Verbal Vocalization Synthesis
Работа разбирает, как дообучать синтезатор на предпочтениях, когда в тексте есть смех, кашель, вздохи и другие невербальные вокализации. Обычная ошибка символов почти не видит, был ли смешок произнесён и в нужном ли месте, поэтому DPO легко улучшает слова ценой исчезновения таких событий. Авторы вводят отдельную меру NV-CER и, что ценнее, систематически проверяют, какие пары «лучше-хуже» действительно пригодны для обучения.
Метод. CosyVoice2-0.5B сначала дообучается четыре эпохи на Emilia-NV, затем для примерно 100 часов сбалансированных примеров генерируется по восемь вариантов. Специализированное распознавание различает 18 тегов невербальных событий. NV-CER считает взвешенную ошибку по объединённой последовательности китайских слогов и тегов; вес тега можно поднять, не меняя сам DPO. Предпочтительной становится синтетическая запись с минимальным NV-CER, отвергнутой - запись с максимальным. Дополнительно авторы проверяют смесь NV-CER с UTMOS, обычный CER, эталонную запись как положительный пример и совмещение DPO с контролируемым обучением.
Результаты. На тесте с одним тегом базовая модель имеет NV-CER 3,47, ошибку невербальных событий PCER 32,78 и обычный CER 2,74. DPO по NV-CER снижает их до 2,59, 21,33 и 2,09; добавление UTMOS сохраняет NV-CER 2,58 и повышает предсказанный UTMOS с 2,01 до 2,11. На примерах с несколькими тегами вариант NV-CER плюс UTMOS получает 4,25/31,31/3,27 против 4,98/39,28/3,69 у исходной модели. В человеческом сравнении много ничьих, но среди определившихся оценок новая модель выигрывает 55,5% против 44,5% по точности событий и 57,2% против 42,8% по словам; убедительного выигрыша естественности нет.
Ограничения. NV-CER зависит от собственного распознавателя тегов и китайского слогового представления, поэтому перенос на другой язык не автоматичен. Предпочтения строятся на синтетических вариантах одной базовой модели и могут закреплять её характерные ошибки. Прослушивание включает 11 носителей языка и показывает в основном небольшие различия с большим числом ничьих. UTMOS почти не оценивает естественность смеха или кашля, что авторы сами видят по расхождению машинных и человеческих оценок.
Фишка из статьи. Самый сильный отрицательный результат касается, казалось бы, идеального положительного примера: эталонная запись делает обычный DPO практически неработоспособным.
| Положительный пример | Отрицательный пример | NV-CER | PCER | CER |
|---|---|---|---|---|
| Эталонная запись | Худший синтетический | 93,42 | 104,89 | 93,20 |
| Эталон или лучший синтетический | Худший синтетический | 65,18 | 75,22 | 64,99 |
| Лучший синтетический | Вариант без события | 22,95 | 52,89 | 22,23 |
| Лучший синтетический | Худший синтетический | 2,59 | 21,33 | 2,09 |
Как это читать: DPO лучше работает, когда оба ответа взяты из распределения самой модели и различаются качеством, а не когда один из них является внешней записью. Эталон слишком легко отличить по побочным акустическим признакам, и цель предпочтения уводит модель от нужного поведения.