Где речевые языковые модели теряют паралингвистическую информацию
Статья показывает, что ошибка речевой языковой модели в задачах эмоций и просодии не всегда означает отсутствие нужной информации в скрытом состоянии. Авторы строят диагностическую лестницу от сгенерированного ответа к логитам вариантов и линейному чтению полного скрытого состояния. Главный результат: в среднем скрытое состояние содержит гораздо больше паралингвистической информации, чем модель выводит в ответ.
Метод. Для одного и того же answer-token события сравниваются четыре уровня: фактическая генерация, argmax по логитам вариантов, обучаемое affine-чтение этих логитов и линейное чтение полного hidden state. Разности между уровнями разделяют endpoint-проблемы, mismatch правила решения и readout-coverage gap - потерю информации между состоянием и штатным словарным считыванием. Проверка проводится на CREMA-D и VESUS для Audio-Flamingo-3, Qwen2-Audio, Qwen2.5-Omni, Kimi-Audio и Phi-4-MM.
Результаты. Средняя точность генерации по десяти условиям - 0.474, а линейное чтение полного состояния в среднем существенно выше; в тексте приведен разрыв 0.278 абсолютной точности. Все условия имеют положительный decision-rule gap и readout-coverage gap. Например, Phi-4-MM на CREMA-D генерирует с точностью 0.2793, affine-чтение логитов дает 0.3544, а полное состояние - 0.7223. Метка-без-обучения logit correction улучшает фактическую генерацию во всех десяти условиях на +0.0098..+0.1392.
Ограничения. Линейная декодируемость не равна причинному использованию информации. Авторы сами показывают, что readout-external направления часто доступны, но слабо влияют на ответ при вмешательстве. Задача ограничена наборами эмоций и просодии, а не всеми формами речевого смысла, поэтому результаты нужно аккуратно переносить на диалоговых агентов.
Фишка из статьи. Самое сильное наблюдение - разные модели теряют информацию в разных местах. У Qwen2-Audio на CREMA-D основная потеря в decision-rule, а у Phi-4-MM на CREMA-D - в покрытии штатного считывания.
| Условие | A_gen | A_aff | A_state | Главный разрыв |
|---|---|---|---|---|
| Qwen2-Audio x CREMA-D | 0.7025 | 0.8995 | 0.9594 | decision +0.1970 |
| Qwen2.5-Omni x CREMA-D | 0.5265 | 0.7332 | 0.8714 | оба разрыва велики |
| Kimi-Audio x CREMA-D | 0.3994 | 0.5852 | 0.8572 | coverage +0.2720 |
| Phi-4-MM x CREMA-D | 0.2793 | 0.3544 | 0.7223 | coverage +0.3679 |
Как это читать: A_gen - то, что модель реально отвечает; A_aff - насколько хорошо можно перенастроить правило выбора по тем же логитам; A_state - что линейно доступно в полном состоянии. Если A_state намного выше, проблема не в слуховом кодировщике как таковом, а в том, как информация доходит до ответа.