Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does
Hear2Act проверяет не распознавание эмоции как таковое, а более практический вопрос: изменит ли просодический сигнал следующее действие помощника, если слова остаются почти теми же. Главный результат довольно жёсткий: добавление звука к расшифровке повышает долю оптимальных решений лишь с 14,6% до 15,3%, хотя модель способна распознать нужный оттенок речи. Если сначала превратить этот оттенок в явное текстовое состояние собеседника, качество поднимается до 39,6%, почти до уровня 40,7% с истинной меткой.
Метод. Набор содержит 480 сценариев из 48 областей услуг. В каждом сценарии есть видимый запрос, три скрытых ограничения разной важности и 11 вариантов с проверяемой пригодностью. Один и тот же нерешённый вопрос выражается либо словами, либо преимущественно голосом; далее Qwen2.5-Omni и Qwen2-Audio должны спрашивать, уточнять, рекомендовать и вовремя завершать диалог. Сравниваются расшифровка, звук, их сочетание, текстовые метки общего аффекта от HuBERT или SpeechBrain, состояние, выведенное самой звуковой моделью, и истинное состояние. Всего получено 54 240 прогонов. Речь синтезирована двумя системами, Qwen3-TTS и VoxCPM2, а различимость метки отдельно проверена людьми и моделью.
Результаты. При просодической обратной связи средняя доля оптимального выбора составляет 14,6% по одной расшифровке, 15,3% со звуком, 32,6% с текстовой меткой HuBERT, 29,2% с SpeechBrain, 39,6% с предметно согласованным состоянием и 40,7% с истинной меткой. Для Qwen2.5-Omni двухшаговая схема даёт 43,0% против 15,9% при прямой подаче звука и 44,5% с истинным состоянием. Полезная метка меняет сам ход разговора: среднее число вопросов и уточнений растёт с 1,8 до 4,4, доля диалогов с раскрытием всех трёх потребностей - с 3% до 30%, а преждевременное завершение на неоптимальном варианте падает с 69,7% до 26,7%. Когда проблема и так сформулирована словами, преимущество просодии почти исчезает.
Ограничения. Сценарии, пользователи и речь синтетические, а просодия кодирует одну узкую функцию: остаётся ли рекомендация нерешённой и насколько сильно. Проверены только две звуковые модели и два синтезатора; в проверке восприятия участвовали лишь два аннотатора по 100 фрагментов на синтезатор. Условие с выведенным состоянием одновременно добавляет отдельный этап вывода и явное текстовое представление, поэтому опыт показывает достаточность такого моста, но не изолирует единственный механизм улучшения. Истинные метки полезны для диагностики и недоступны в рабочей системе.
Фишка из статьи. Авторы проверили разрыв между слуховым восприятием и действием на двух разных синтезаторах. Люди уверенно слышат различие «решено или не решено», модель тоже распознаёт его заметно выше случайного уровня, но прямое решение остаётся слабым. Почти весь разрыв закрывается только после перевода услышанного в предметную текстовую переменную.
| Синтезатор | Точность людей | Точность чтения сигнала моделью | Звук + расшифровка | Выведенное состояние |
|---|---|---|---|---|
| Qwen3-TTS | 0,92 | 0,85 | 15,9% | 43,0% |
| VoxCPM2 | 0,92 | 0,76 | 16,9% | 42,6% |
Как это читать: два средних столбца показывают, что просодический сигнал в записи действительно есть и в значительной мере доступен модели. Последние два столбца измеряют уже выбор оптимального варианта: потеря возникает главным образом при переносе воспринятого сигнала в политику диалога.