звуковые языковые модели привязка к звуку анализ внимания
arXiv cs.CL

Tracing Audio Grounding and Answer Selection in Audio LLMs

arXiv:2609.04637

Работа прослеживает, как звуковая LLM после дообучения сначала извлекает свидетельство из аудио, а затем связывает его с вариантом ответа. Вмешательства в внимание показывают разные временные зоны этих операций и объясняют, почему дообучение иногда повышает тестовую точность, одновременно ослабляя реальную чувствительность к звуку.

Метод. Qwen2-Audio и Qwen2.5-Omni дообучают LoRA rank 16 на 19 480 вопросах AudioMCQ, затем проверяют на ADQA, MMAR, MMAU и MMSU. Направленные связи внимания зануляются по слоям: звук к вариантам и варианты к ответу. Дополнительная метрика меняет звук и проверяет, изменится ли решение.

Результаты. У Qwen2-Audio точность ADQA растёт с 36,9% до 51,1%, MMAR — с 41,2% до 52,5%, MMSU — с 47,3% до 58,8%, но MMAU падает с 59,7% до 58,6%. У Qwen2.5-Omni MMAU падает сильнее, с 77,0% до 63,5%. Чувствительность к звуку на этом наборе уменьшается на 9,1 и 7,1 пункта соответственно.

Ограничения. Все задачи имеют варианты ответа, поэтому механизм свободной генерации может быть иным. Исследованы лишь две модели Qwen, а зануление внимания не доказывает, что наблюдаемая связь является единственным причинным каналом. Результаты чувствительны к формату подсказки.

Фишка из статьи. Дообучение может улучшить три теста и одновременно научить модель хуже слушать четвёртый.

Модель на MMAUТочность доТочность послеИзменение чувствительности к звуку
Qwen2-Audio59,7%58,6%−9,1 п.п.
Qwen2.5-Omni77,0%63,5%−7,1 п.п.

Как это читать: отрицательный перенос виден не только по точности, но и по реакции на подмену аудио. Модель усилила шаблон выбора ответа за счёт звуковой опоры, поэтому среднее по наборам скрывало бы важную поломку.

Оригинальная статья на arXiv