Избирательное слушание: управление влиянием аудио в больших аудиоязыковых моделях
Большая аудиоязыковая модель может менять текстовый ответ из-за постороннего звука даже тогда, когда слушать не требуется. ICAP-Gate локализует поздний аудиотракт каждой архитектуры и ослабляет его только для текстовых инструкций, сохраняя канал открытым для задач, где аудио действительно нужно.
Метод. Авторы вводят парные показатели Influence Rate и Answer Flip: они считают изменения конкретных ответов, которые средняя accuracy может скрыть взаимной компенсацией. Маршрутизатор по инструкции выбирает, применять ли масштабирование найденного слоя; для четырёх моделей слой и коэффициент подбираются отдельно.
Результаты. На ARC/MMLU с шумами и посторонней речью обе оценки дрейфа ниже исходных во всех 16 комбинациях. Например, у Qwen2.5-Omni-7B на MMLU-FSD Influence Rate падает с 11,80 до 9,16%, Answer Flip — с 16,06 до 12,60%, почти без изменения accuracy.
Ограничения. Выбранные слои и масштабы архитектурно-зависимы, а маршрутизация опирается на формулировку инструкции. Исследованы четыре модели и два reasoning-бенчмарка; сложные запросы, где аудио полезно лишь частично, остаются пограничным случаем.
Фишка из статьи. Простое постоянное подавление аудиотракта катастрофически ломает распознавание речи, тогда как условный шлюз полностью восстанавливает исходный WER. Это прямое доказательство, что найденный путь не «вредный», а условно полезный.
| Модель | WER без шлюза, % | WER при постоянном подавлении, % | WER с ICAP-Gate, % |
|---|---|---|---|
| Qwen2.5-Omni-7B | 17,74 | 98,60 | 17,74 |
| Qwen2.5-Omni-3B | 60,82 | 184,58 | 60,82 |
| Phi-4-MM | 2,45 | 18,73 | 2,45 |
| Voxtral-Mini-3B | 16,72 | 61,05 | 16,72 |
Как это читать: шлюз не улучшает ASR, а предотвращает ущерб от вмешательства, когда инструкция явно требует слушать. По стоимости он использует одну генерацию и 0,894–1,057× исходной задержки против 7,0–9,2× у self-consistency с восемью ответами.