аудиоязыковые модели устойчивость интерпретируемость
arXiv cs.SD

Избирательное слушание: управление влиянием аудио в больших аудиоязыковых моделях

arXiv:2610.11196

Большая аудиоязыковая модель может менять текстовый ответ из-за постороннего звука даже тогда, когда слушать не требуется. ICAP-Gate локализует поздний аудиотракт каждой архитектуры и ослабляет его только для текстовых инструкций, сохраняя канал открытым для задач, где аудио действительно нужно.

Метод. Авторы вводят парные показатели Influence Rate и Answer Flip: они считают изменения конкретных ответов, которые средняя accuracy может скрыть взаимной компенсацией. Маршрутизатор по инструкции выбирает, применять ли масштабирование найденного слоя; для четырёх моделей слой и коэффициент подбираются отдельно.

Результаты. На ARC/MMLU с шумами и посторонней речью обе оценки дрейфа ниже исходных во всех 16 комбинациях. Например, у Qwen2.5-Omni-7B на MMLU-FSD Influence Rate падает с 11,80 до 9,16%, Answer Flip — с 16,06 до 12,60%, почти без изменения accuracy.

Ограничения. Выбранные слои и масштабы архитектурно-зависимы, а маршрутизация опирается на формулировку инструкции. Исследованы четыре модели и два reasoning-бенчмарка; сложные запросы, где аудио полезно лишь частично, остаются пограничным случаем.

Фишка из статьи. Простое постоянное подавление аудиотракта катастрофически ломает распознавание речи, тогда как условный шлюз полностью восстанавливает исходный WER. Это прямое доказательство, что найденный путь не «вредный», а условно полезный.

МодельWER без шлюза, %WER при постоянном подавлении, %WER с ICAP-Gate, %
Qwen2.5-Omni-7B17,7498,6017,74
Qwen2.5-Omni-3B60,82184,5860,82
Phi-4-MM2,4518,732,45
Voxtral-Mini-3B16,7261,0516,72

Как это читать: шлюз не улучшает ASR, а предотвращает ущерб от вмешательства, когда инструкция явно требует слушать. По стоимости он использует одну генерацию и 0,894–1,057× исходной задержки против 7,0–9,2× у self-consistency с восемью ответами.

Оригинальная статья на arXiv