Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models
Работа показывает неприятный разрыв в звуковых языковых моделях: они часто сохраняют сведения об интонации и эмоции во внутренних состояниях, но не используют их в окончательном ответе. Это важнее обычного сравнения точности, потому что авторы разделяют три разных причины ошибки: модель не услышала просодию, неверно её истолковала или правильно представила, но проигнорировала при выборе ответа. Для большинства проверенных сочетаний модели и задачи повторяется третий сценарий.
Метод. Диагностическая лестница проходит по всей вычислительной цепочке четырёх моделей: Qwen2.5-Omni, Phi-4-MM, Audio-Flamingo-3 и DeSTA2.5-Audio. Линейные классификаторы проверяют, сохранились ли признаки просодии в звуковом кодировщике и проекторе; чтение логитов по слоям показывает, можно ли извлечь нужный класс из позднего состояния языковой модели. Затем поведение сравнивается между расшифровкой без подсказки, исходным звуком и текстом с явно указанной интонацией. Причинную роль найденного состояния авторы проверяют двумя вмешательствами в один слой: добавляют направление между средними состояниями классов либо подставляют состояние парного высказывания противоположного класса. Отдельно обученный разреженный автоэнкодер локализует эффект в малом наборе признаков.
Результаты. Сильный поздний код просодии обнаружен в 8 из 11 чистых сочетаний модели и контраста: AUC чтения логитов составляет 0,81-1,00, а для уверенных эмоциональных контрастов извлекается 1,49-1,75 бита из примерно 2 бит энтропии метки. При этом на различении вопроса и утверждения три модели используют лишь 30-36% диапазона между текстовой исходной вероятностью и явной подсказкой, а DeSTA не использует его вовсе. Все 18 наклонов при добавлении направления имеют ожидаемый знак и доверительный интервал, не включающий ноль; все 16 подстановок состояний на VESUS тоже сдвигают логиты в нужную сторону. Набор из 33-102 разреженных признаков, не более 0,5% словаря, доводит полноту подавленного класса до максимума в 17 из 18 сочетаний.
Ограничения. Недоиспользование просодии подтверждено в 7 из 11 чистых сочетаний, а не во всех: у Phi-4 часть эмоциональной информации теряется раньше, Qwen с VESUS слабо кодирует сам контраст, Audio-Flamingo-3 на CREMA-D почти достигает текстовой опоры. Одно сочетание исключено из-за возможного присутствия корпуса в обучении. Выводы относятся к четырём плотным Transformer-моделям понимания; модели со смесью экспертов и речевым выходом не проверялись. Сильное вмешательство смещает решение к выбранному полюсу и может перевести туда даже примеры другого класса, поэтому это направленное управление, а не точное восстановление правильного решения. Ясная связь разреженных признаков с акустическими параметрами получена в основном для эмоций, но не для интонации вопроса.
Фишка из статьи. Самый чистый отрицательный результат даёт задача «вопрос или утверждение» на IViE. У DeSTA внутренние состояния разделяют классы идеально, но звуковой ответ не закрывает ни одного процента разрыва до явной текстовой подсказки. То есть хорошая линейная извлекаемость сама по себе почти ничего не гарантирует о фактическом использовании признака.
| Модель | AUC внутреннего чтения | Использованная доля доступного диапазона | Диагноз |
|---|---|---|---|
| Qwen2.5-Omni | 0,82 | 36% | Недоиспользование |
| Phi-4-MM | 0,81 | 31% | Недоиспользование |
| Audio-Flamingo-3 | 0,83 | 30% | Недоиспользование |
| DeSTA2.5-Audio | 1,00 | 0% | Полное недоиспользование |
Как это читать: AUC показывает, насколько хорошо класс уже разделён во внутреннем состоянии, а последний столбец измеряет, сколько этого преимущества дошло до ответа. Строка DeSTA отделяет «модель знает» от «модель действует на основании знания» особенно наглядно.