аудиовизуальные языковые модели межмодальный конфликт интерпретируемость
arXiv cs.CL

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

arXiv:2608.27785

Аудиовизуальная языковая модель может отдельно распознать звук и изображение, но провалиться, когда они противоречат друг другу. Работа показывает, что дополнительное согласование модальностей в VideoLLaMA2 в основном сдвигает априорный ответ «да/нет», а не учит модель надёжно разрешать конфликт.

Метод. Авторы очищают AVHBench от сильного перекоса к ответу «нет» и оценивают около 6,3 тысячи конфликтных вопросов. Для VideoLLaMA2-7B последовательно добавляются согласование звука с подписью ACTC, временное выравнивание TATI и обнаружение несоответствия AMD. Затем траектория ответа исследуется через проекцию скрытых состояний в словарь и поиск голов внимания, чувствительных к конфликту.

Результаты. InternVideo2 получает 60,1% на полном AVHBench, но лишь 27,8% на исходном конфликтном срезе, падение на 32,3 пункта. На очищенной сбалансированной оценке его точность составляет 52,3%, а варианты VideoLLaMA2 остаются между 49,0% и 50,2%. Найдена 21 голова, связанная с конфликтом, главным образом в слоях 15–18, однако окончательный ответ стабилизируется только около слоя 25,5: ранний сигнал не переживает позднее давление языкового приоритета.

Ограничения. Подробный анализ скрытых состояний выполнен для одной основной архитектуры и остаётся корреляционным: вмешательства в найденные головы не проводились. Точный строковый разбор отбрасывает часть нестандартных ответов. Порог значимости голов не калиброван статистически, ручная проверка подписей охватывает 100 примеров, а более длинная последовательность при смешивании модальностей сама может менять поведение.

Фишка из статьи. Поэтапное обучение почти не меняет среднюю точность, зато заметно перемещает баланс ответов. Полный тракт с AMD «исправляет» склонность к «да» настолько сильно, что начинает отвечать «нет» почти вдвое чаще.

ВариантПримеровТочностьТочность «да»Точность «нет»Ответы да / нет
ACTC516549,8%55,5%44,1%2895 / 2270
ACTC+TATI528849,0%46,9%51,1%2529 / 2759
ACTC+TATI+AMD529950,2%35,1%65,2%1853 / 3446
InternVideo2530252,3%51,3%53,3%2600 / 2702

Как это читать: рост точности класса «нет» у полного тракта не означает лучшего композиционного рассуждения, потому что он куплен падением класса «да». Таблица выявляет смену априорного предпочтения, которую одна итоговая точность почти скрывает.

Оригинальная статья на arXiv