Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models
Аудиоязыковые модели хорошо кодируют манеру речи, но часто перестают ею пользоваться к моменту ответа. Работа локализует эту потерю по слоям и отделяет наличие сведений в представлении от их фактического влияния на текстовый вывод.
Метод. Whisper-large-v2, Qwen2-Audio-7B-Instruct, Qwen2.5-Omni-7B и Chroma-4B исследуются на Expresso с семью стилями одной и той же реплики. Авторы совмещают CKA для геометрического сходства, линейное зондирование с исключением одного говорящего, открытое определение тона и отношение взаимной информации «текст против стиля». Так можно различить преобразование геометрии и действительную утрату доступного признака.
Результаты. Во всех моделях линейная точность достигает примерно 82–85% в верхней трети звукового кодировщика при случайном уровне 14,3%. Но итоговое определение стиля даёт лишь 19,68% у Qwen2-Audio, 53,70% у Qwen2.5-Omni и 22,57% у Chroma. У Qwen2-Audio сведения о стиле остаются линейно доступны через весь декодер, однако отношение утечки 0,977 показывает, что ответ почти полностью определяется словами; у Omni оно равно 0,272.
Ограничения. Expresso здесь представлен четырьмя говорящими и семью стилями; усреднение по времени скрывает динамику смеха и пауз. Анализ касается текстовых ответов, но не того, использует ли Omni просодию при синтезе. Абсолютное значение отношения утечки смещено разным числом текстов и стилевых классов, а переход от корреляционного зондирования к причинному вмешательству остаётся будущей работой.
Фишка из статьи. Самый наглядный разрыв возникает у Qwen2-Audio: представление сохраняет стиль, а ответ ведёт себя так, будто слышит главным образом слова.
| Модель | Точность стиля на выходе | Отношение утечки к тексту | Одинаковый ответ для всех 7 подач |
|---|---|---|---|
| Qwen2-Audio | 19,68% | 0,977 | 30,53% |
| Qwen2.5-Omni | 53,70% | 0,272 | 0,59% |
| Chroma | 22,57% | 0,844 | 19,93% |
Как это читать: отношение около единицы означает зависимость предсказания от содержания фразы, а не от подачи. Поэтому высокая доступность признака внутри сети сама по себе не доказывает, что голосовой агент применит его в ответе.