Паралингвистика Диагностика Audio LLM
arXiv cs.CL

Где речевые языковые модели теряют паралингвистическую информацию

arXiv:2608.06409

Статья показывает, что ошибка речевой языковой модели в задачах эмоций и просодии не всегда означает отсутствие нужной информации в скрытом состоянии. Авторы строят диагностическую лестницу от сгенерированного ответа к логитам вариантов и линейному чтению полного скрытого состояния. Главный результат: в среднем скрытое состояние содержит гораздо больше паралингвистической информации, чем модель выводит в ответ.

Метод. Для одного и того же answer-token события сравниваются четыре уровня: фактическая генерация, argmax по логитам вариантов, обучаемое affine-чтение этих логитов и линейное чтение полного hidden state. Разности между уровнями разделяют endpoint-проблемы, mismatch правила решения и readout-coverage gap - потерю информации между состоянием и штатным словарным считыванием. Проверка проводится на CREMA-D и VESUS для Audio-Flamingo-3, Qwen2-Audio, Qwen2.5-Omni, Kimi-Audio и Phi-4-MM.

Результаты. Средняя точность генерации по десяти условиям - 0.474, а линейное чтение полного состояния в среднем существенно выше; в тексте приведен разрыв 0.278 абсолютной точности. Все условия имеют положительный decision-rule gap и readout-coverage gap. Например, Phi-4-MM на CREMA-D генерирует с точностью 0.2793, affine-чтение логитов дает 0.3544, а полное состояние - 0.7223. Метка-без-обучения logit correction улучшает фактическую генерацию во всех десяти условиях на +0.0098..+0.1392.

Ограничения. Линейная декодируемость не равна причинному использованию информации. Авторы сами показывают, что readout-external направления часто доступны, но слабо влияют на ответ при вмешательстве. Задача ограничена наборами эмоций и просодии, а не всеми формами речевого смысла, поэтому результаты нужно аккуратно переносить на диалоговых агентов.

Фишка из статьи. Самое сильное наблюдение - разные модели теряют информацию в разных местах. У Qwen2-Audio на CREMA-D основная потеря в decision-rule, а у Phi-4-MM на CREMA-D - в покрытии штатного считывания.

УсловиеA_genA_affA_stateГлавный разрыв
Qwen2-Audio x CREMA-D0.70250.89950.9594decision +0.1970
Qwen2.5-Omni x CREMA-D0.52650.73320.8714оба разрыва велики
Kimi-Audio x CREMA-D0.39940.58520.8572coverage +0.2720
Phi-4-MM x CREMA-D0.27930.35440.7223coverage +0.3679

Как это читать: A_gen - то, что модель реально отвечает; A_aff - насколько хорошо можно перенастроить правило выбора по тем же логитам; A_state - что линейно доступно в полном состоянии. Если A_state намного выше, проблема не в слуховом кодировщике как таковом, а в том, как информация доходит до ответа.

Оригинальная статья на arXiv