паралингвистика оценка качества речевые языковые модели
arXiv eess.AS

CVAM: модель эстетики разговорного голоса с обучением с подкреплением по оценкам слушателей

arXiv:2610.10868

CVAM описывает не содержание, а воспринимаемую манеру разговорной реплики: ключевые моменты голоса и девять признаков от высоты и темпа до эмоции, теплоты и уверенности. Вместо единственной «истины» для субъективных полей модель обучают на распределении примерно десяти человеческих голосов на пример.

Метод. Для 3000 реальных, клонированных и спроектированных ответов из CANDOR собираются слушательские оценки. Qwen2.5-Omni сначала дообучается на 30 тыс. синтетических описаний, затем GRPO согласует его с человеческими голосами; сравниваются награды по большинству, доле голосов, TVD и прямой/обратной KL-дивергенции.

Результаты. Синтетическое SFT даёт средний macro-F1 43,5% по четырём субъективным полям, последующее SFT на людях — 44,9%, GRPO с прямой KL — 50,1%. Это выше Gemini 3.1 Pro (44,2%) и среднего согласия одного слушателя с остальными (43,5%).

Ограничения. Человеческая часть невелика: 3000 ответов, один английский корпус и около десяти голосов на объект. Редкие эмоции остаются трудными, а естественная спонтанная речь сложнее синтетической. Модель оценивает согласие с этой группой слушателей, а не универсальную «эстетику».

Фишка из статьи. Выбор награды меняет цель: доля голосов максимизирует accuracy, но прямая KL лучше покрывает редкие классы и выигрывает по macro-F1. Это наглядный пример того, почему сведение субъективной разметки к большинству теряет полезную неопределённость.

Награда GRPOСредняя accuracy, %Средний macro-F1, %
Точность по одному голосу74,448,4
Точность по большинству76,747,0
Доля совпавших голосов77,847,6
TVD по распределению67,349,7
Прямая KL по распределению69,650,1
Обратная KL68,644,7

Как это читать: лучшая accuracy и лучший macro-F1 принадлежат разным наградам. Если модель станет оценщиком для выразительного синтеза, предпочтение большинства может сузить диапазон допустимых голосовых интерпретаций.

Оригинальная статья на arXiv