Tracing Audio Grounding and Answer Selection in Audio LLMs
Работа прослеживает, как звуковая LLM после дообучения сначала извлекает свидетельство из аудио, а затем связывает его с вариантом ответа. Вмешательства в внимание показывают разные временные зоны этих операций и объясняют, почему дообучение иногда повышает тестовую точность, одновременно ослабляя реальную чувствительность к звуку.
Метод. Qwen2-Audio и Qwen2.5-Omni дообучают LoRA rank 16 на 19 480 вопросах AudioMCQ, затем проверяют на ADQA, MMAR, MMAU и MMSU. Направленные связи внимания зануляются по слоям: звук к вариантам и варианты к ответу. Дополнительная метрика меняет звук и проверяет, изменится ли решение.
Результаты. У Qwen2-Audio точность ADQA растёт с 36,9% до 51,1%, MMAR — с 41,2% до 52,5%, MMSU — с 47,3% до 58,8%, но MMAU падает с 59,7% до 58,6%. У Qwen2.5-Omni MMAU падает сильнее, с 77,0% до 63,5%. Чувствительность к звуку на этом наборе уменьшается на 9,1 и 7,1 пункта соответственно.
Ограничения. Все задачи имеют варианты ответа, поэтому механизм свободной генерации может быть иным. Исследованы лишь две модели Qwen, а зануление внимания не доказывает, что наблюдаемая связь является единственным причинным каналом. Результаты чувствительны к формату подсказки.
Фишка из статьи. Дообучение может улучшить три теста и одновременно научить модель хуже слушать четвёртый.
| Модель на MMAU | Точность до | Точность после | Изменение чувствительности к звуку |
|---|---|---|---|
| Qwen2-Audio | 59,7% | 58,6% | −9,1 п.п. |
| Qwen2.5-Omni | 77,0% | 63,5% | −7,1 п.п. |
Как это читать: отрицательный перенос виден не только по точности, но и по реакции на подмену аудио. Модель усилила шаблон выбора ответа за счёт звуковой опоры, поэтому среднее по наборам скрывало бы важную поломку.