Речевые LLM Эмоции Policy optimization
Речевые LLM

Spoken LLMs: отдельные награды для слов и просодии

ES 51.25

Статья рассматривает речевой диалог как задачу, где намерение пользователя живет не только в словах, но и в паралингвистике: эмоции, интонации и голосовом контексте. Авторы вводят ParaIntent, китайский benchmark с 14 категориями намерений и явными/неявными случаями, а затем предлагают ALPO - обучение с подкреплением, где текстовая и акустическая награды не смешиваются в один общий сигнал. Главный ход - направлять textual advantage на текстовые токены, а acoustic advantage на речевые токены.

Метод. ParaIntent строится вокруг single-turn emotional spoken dialogue: модель должна понять намерение из речевого запроса и сгенерировать ответ, корректный по смыслу и выразительный по эмоции. Для оценки используются Intent Fulfillment, Response Quality, Emotion Accuracy и Emotion Similarity. В GRPO общий reward назначается всей последовательности, из-за чего усиление акустической награды может ухудшать текст. ALPO отдельно нормализует format, textual и acoustic rewards внутри группы rollout и применяет их только к соответствующим типам токенов.

Результаты. На synthetic ParaIntent ALPO дает IF/RQ/EA/ES 92.28/85.51/88.72/51.92, улучшая GRPO 91.99/84.60/87.35/49.37 по всем четырем метрикам. На human-recorded тесте ALPO получает 81.61/77.84/71.78/51.25 против 79.67/74.43/69.33/48.73 у GRPO. В субъективной оценке ALPO также выше: pairwise win rates text/emotion/overall 61.13/62.45/62.96 и human ratings 4.78/4.72 против 4.32/4.24 у GRPO.

Ограничения. Работа сосредоточена на китайском эмоциональном диалоге и одном семействе обучаемых моделей Step-Audio-2-mini. Часть метрик основана на сильных моделях-судьях, включая GLM, DeepSeek и Gemini, а ES близко связан с акустической наградой. Авторы сообщают один прогон для trainable configurations, поэтому дисперсия обучения остается открытым вопросом.

Фишка из статьи. Очень показателен prosody neutralization test: авторы заново синтезируют 2500 запросов с нулевым эмоциональным вектором и смотрят, насколько падает распознавание намерения. Неявные намерения ломаются гораздо сильнее явных.

МодельExplicit IF доExplicit IF послеПадениеImplicit IF доImplicit IF послеПадение
SFT82.7364.4118.3275.6034.5241.08
GRPO83.6469.0814.5677.2437.0840.16
ALPO86.9272.4014.5280.1640.6439.52

Как это читать: если намерение явно написано словами, нейтрализация просодии ухудшает IF умеренно. Если намерение скрыто в интонации, падение примерно на 40 пунктов, поэтому речевые LLM нельзя оценивать только по текстовой транскрипции.

Оригинальная статья на arXiv