звуковые языковые модели галлюцинации мультимодальность
arXiv eess.AS

CAD: Conflict-Aware Decoding to Mitigate Cross-Modal Hallucinations in Omnimodal Large Language Models

arXiv:2609.04247

CAD уменьшает галлюцинации звуково-зрительной модели без обучения: декодер измеряет конфликт между ветвями восприятия и перераспределяет их вклад только тогда, когда расхождение способно изменить ответ. Важное различие — высокий конфликт сам по себе не считается ошибкой, пока он не относится к текущему варианту ответа.

Метод. Для звука, видео и совместного контекста строятся распределения уверенности, которые объединяются по Демпстеру–Шаферу. Два множителя описывают величину конфликта и его значимость для кандидата; ими динамически корректируются логиты совместной ветви. Все вычисления выполняются во время декодирования Qwen2.5-Omni-7B.

Результаты. На CMM точность базовой модели около 70,9% повышается до 85,0%, на AVH — с 76,1% до 84,1%. Равномерное смешивание на AVH даёт 78,0%, выбор максимальной ветви — 79,6%. Метод также улучшает WorldSense с 25,9% до 28,8% и VideoMME с 47,9% до 49,4%, то есть эффект не полностью ограничен тестами на конфликт.

Ограничения. Пороговые коэффициенты настроены вручную, а несколько прогонов ветвей увеличивают стоимость вывода. Проверка сосредоточена на вопросах с вариантами ответа и одной модели. Причинность конфликтной меры не доказана: она хорошо коррелирует с ошибкой, но может отражать общую неуверенность.

Фишка из статьи. Два сигнала дополняют друг друга: просто обнаружить расхождение недостаточно, нужно проверить, влияет ли оно на выбираемый ответ.

Вариант CAD на AVHТочность, %
Базовая модель76,1
Только веса по значимости модальностей80,7
Только величина конфликта C82,7
Только шлюз обоснованности B83,3
C и B вместе84,1

Как это читать: даже лучший одиночный признак не достигает полного варианта. Средний конфликт у ошибочных ответов 0,100 против 0,033 у правильных, но полезен он лишь после привязки к текущему решению.

Оригинальная статья на arXiv