CVAM: модель эстетики разговорного голоса с обучением с подкреплением по оценкам слушателей
CVAM описывает не содержание, а воспринимаемую манеру разговорной реплики: ключевые моменты голоса и девять признаков от высоты и темпа до эмоции, теплоты и уверенности. Вместо единственной «истины» для субъективных полей модель обучают на распределении примерно десяти человеческих голосов на пример.
Метод. Для 3000 реальных, клонированных и спроектированных ответов из CANDOR собираются слушательские оценки. Qwen2.5-Omni сначала дообучается на 30 тыс. синтетических описаний, затем GRPO согласует его с человеческими голосами; сравниваются награды по большинству, доле голосов, TVD и прямой/обратной KL-дивергенции.
Результаты. Синтетическое SFT даёт средний macro-F1 43,5% по четырём субъективным полям, последующее SFT на людях — 44,9%, GRPO с прямой KL — 50,1%. Это выше Gemini 3.1 Pro (44,2%) и среднего согласия одного слушателя с остальными (43,5%).
Ограничения. Человеческая часть невелика: 3000 ответов, один английский корпус и около десяти голосов на объект. Редкие эмоции остаются трудными, а естественная спонтанная речь сложнее синтетической. Модель оценивает согласие с этой группой слушателей, а не универсальную «эстетику».
Фишка из статьи. Выбор награды меняет цель: доля голосов максимизирует accuracy, но прямая KL лучше покрывает редкие классы и выигрывает по macro-F1. Это наглядный пример того, почему сведение субъективной разметки к большинству теряет полезную неопределённость.
| Награда GRPO | Средняя accuracy, % | Средний macro-F1, % |
|---|---|---|
| Точность по одному голосу | 74,4 | 48,4 |
| Точность по большинству | 76,7 | 47,0 |
| Доля совпавших голосов | 77,8 | 47,6 |
| TVD по распределению | 67,3 | 49,7 |
| Прямая KL по распределению | 69,6 | 50,1 |
| Обратная KL | 68,6 | 44,7 |
Как это читать: лучшая accuracy и лучший macro-F1 принадлежат разным наградам. Если модель станет оценщиком для выразительного синтеза, предпочтение большинства может сузить диапазон допустимых голосовых интерпретаций.