Spoken LLMs: отдельные награды для слов и просодии
Статья рассматривает речевой диалог как задачу, где намерение пользователя живет не только в словах, но и в паралингвистике: эмоции, интонации и голосовом контексте. Авторы вводят ParaIntent, китайский benchmark с 14 категориями намерений и явными/неявными случаями, а затем предлагают ALPO - обучение с подкреплением, где текстовая и акустическая награды не смешиваются в один общий сигнал. Главный ход - направлять textual advantage на текстовые токены, а acoustic advantage на речевые токены.
Метод. ParaIntent строится вокруг single-turn emotional spoken dialogue: модель должна понять намерение из речевого запроса и сгенерировать ответ, корректный по смыслу и выразительный по эмоции. Для оценки используются Intent Fulfillment, Response Quality, Emotion Accuracy и Emotion Similarity. В GRPO общий reward назначается всей последовательности, из-за чего усиление акустической награды может ухудшать текст. ALPO отдельно нормализует format, textual и acoustic rewards внутри группы rollout и применяет их только к соответствующим типам токенов.
Результаты. На synthetic ParaIntent ALPO дает IF/RQ/EA/ES 92.28/85.51/88.72/51.92, улучшая GRPO 91.99/84.60/87.35/49.37 по всем четырем метрикам. На human-recorded тесте ALPO получает 81.61/77.84/71.78/51.25 против 79.67/74.43/69.33/48.73 у GRPO. В субъективной оценке ALPO также выше: pairwise win rates text/emotion/overall 61.13/62.45/62.96 и human ratings 4.78/4.72 против 4.32/4.24 у GRPO.
Ограничения. Работа сосредоточена на китайском эмоциональном диалоге и одном семействе обучаемых моделей Step-Audio-2-mini. Часть метрик основана на сильных моделях-судьях, включая GLM, DeepSeek и Gemini, а ES близко связан с акустической наградой. Авторы сообщают один прогон для trainable configurations, поэтому дисперсия обучения остается открытым вопросом.
Фишка из статьи. Очень показателен prosody neutralization test: авторы заново синтезируют 2500 запросов с нулевым эмоциональным вектором и смотрят, насколько падает распознавание намерения. Неявные намерения ломаются гораздо сильнее явных.
| Модель | Explicit IF до | Explicit IF после | Падение | Implicit IF до | Implicit IF после | Падение |
|---|---|---|---|---|---|---|
| SFT | 82.73 | 64.41 | 18.32 | 75.60 | 34.52 | 41.08 |
| GRPO | 83.64 | 69.08 | 14.56 | 77.24 | 37.08 | 40.16 |
| ALPO | 86.92 | 72.40 | 14.52 | 80.16 | 40.64 | 39.52 |
Как это читать: если намерение явно написано словами, нейтрализация просодии ухудшает IF умеренно. Если намерение скрыто в интонации, падение примерно на 40 пунктов, поэтому речевые LLM нельзя оценивать только по текстовой транскрипции.