Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict
Аудиовизуальная языковая модель может отдельно распознать звук и изображение, но провалиться, когда они противоречат друг другу. Работа показывает, что дополнительное согласование модальностей в VideoLLaMA2 в основном сдвигает априорный ответ «да/нет», а не учит модель надёжно разрешать конфликт.
Метод. Авторы очищают AVHBench от сильного перекоса к ответу «нет» и оценивают около 6,3 тысячи конфликтных вопросов. Для VideoLLaMA2-7B последовательно добавляются согласование звука с подписью ACTC, временное выравнивание TATI и обнаружение несоответствия AMD. Затем траектория ответа исследуется через проекцию скрытых состояний в словарь и поиск голов внимания, чувствительных к конфликту.
Результаты. InternVideo2 получает 60,1% на полном AVHBench, но лишь 27,8% на исходном конфликтном срезе, падение на 32,3 пункта. На очищенной сбалансированной оценке его точность составляет 52,3%, а варианты VideoLLaMA2 остаются между 49,0% и 50,2%. Найдена 21 голова, связанная с конфликтом, главным образом в слоях 15–18, однако окончательный ответ стабилизируется только около слоя 25,5: ранний сигнал не переживает позднее давление языкового приоритета.
Ограничения. Подробный анализ скрытых состояний выполнен для одной основной архитектуры и остаётся корреляционным: вмешательства в найденные головы не проводились. Точный строковый разбор отбрасывает часть нестандартных ответов. Порог значимости голов не калиброван статистически, ручная проверка подписей охватывает 100 примеров, а более длинная последовательность при смешивании модальностей сама может менять поведение.
Фишка из статьи. Поэтапное обучение почти не меняет среднюю точность, зато заметно перемещает баланс ответов. Полный тракт с AMD «исправляет» склонность к «да» настолько сильно, что начинает отвечать «нет» почти вдвое чаще.
| Вариант | Примеров | Точность | Точность «да» | Точность «нет» | Ответы да / нет |
|---|---|---|---|---|---|
| ACTC | 5165 | 49,8% | 55,5% | 44,1% | 2895 / 2270 |
| ACTC+TATI | 5288 | 49,0% | 46,9% | 51,1% | 2529 / 2759 |
| ACTC+TATI+AMD | 5299 | 50,2% | 35,1% | 65,2% | 1853 / 3446 |
| InternVideo2 | 5302 | 52,3% | 51,3% | 53,3% | 2600 / 2702 |
Как это читать: рост точности класса «нет» у полного тракта не означает лучшего композиционного рассуждения, потому что он куплен падением класса «да». Таблица выявляет смену априорного предпочтения, которую одна итоговая точность почти скрывает.