аудиоязыковые модели паралингвистика анализ представлений
arXiv cs.SD

Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

arXiv:2609.00727

Аудиоязыковые модели хорошо кодируют манеру речи, но часто перестают ею пользоваться к моменту ответа. Работа локализует эту потерю по слоям и отделяет наличие сведений в представлении от их фактического влияния на текстовый вывод.

Метод. Whisper-large-v2, Qwen2-Audio-7B-Instruct, Qwen2.5-Omni-7B и Chroma-4B исследуются на Expresso с семью стилями одной и той же реплики. Авторы совмещают CKA для геометрического сходства, линейное зондирование с исключением одного говорящего, открытое определение тона и отношение взаимной информации «текст против стиля». Так можно различить преобразование геометрии и действительную утрату доступного признака.

Результаты. Во всех моделях линейная точность достигает примерно 82–85% в верхней трети звукового кодировщика при случайном уровне 14,3%. Но итоговое определение стиля даёт лишь 19,68% у Qwen2-Audio, 53,70% у Qwen2.5-Omni и 22,57% у Chroma. У Qwen2-Audio сведения о стиле остаются линейно доступны через весь декодер, однако отношение утечки 0,977 показывает, что ответ почти полностью определяется словами; у Omni оно равно 0,272.

Ограничения. Expresso здесь представлен четырьмя говорящими и семью стилями; усреднение по времени скрывает динамику смеха и пауз. Анализ касается текстовых ответов, но не того, использует ли Omni просодию при синтезе. Абсолютное значение отношения утечки смещено разным числом текстов и стилевых классов, а переход от корреляционного зондирования к причинному вмешательству остаётся будущей работой.

Фишка из статьи. Самый наглядный разрыв возникает у Qwen2-Audio: представление сохраняет стиль, а ответ ведёт себя так, будто слышит главным образом слова.

МодельТочность стиля на выходеОтношение утечки к текстуОдинаковый ответ для всех 7 подач
Qwen2-Audio19,68%0,97730,53%
Qwen2.5-Omni53,70%0,2720,59%
Chroma22,57%0,84419,93%

Как это читать: отношение около единицы означает зависимость предсказания от содержания фразы, а не от подачи. Поэтому высокая доступность признака внутри сети сама по себе не доказывает, что голосовой агент применит его в ответе.

Оригинальная статья на arXiv