CAD: Conflict-Aware Decoding to Mitigate Cross-Modal Hallucinations in Omnimodal Large Language Models
CAD уменьшает галлюцинации звуково-зрительной модели без обучения: декодер измеряет конфликт между ветвями восприятия и перераспределяет их вклад только тогда, когда расхождение способно изменить ответ. Важное различие — высокий конфликт сам по себе не считается ошибкой, пока он не относится к текущему варианту ответа.
Метод. Для звука, видео и совместного контекста строятся распределения уверенности, которые объединяются по Демпстеру–Шаферу. Два множителя описывают величину конфликта и его значимость для кандидата; ими динамически корректируются логиты совместной ветви. Все вычисления выполняются во время декодирования Qwen2.5-Omni-7B.
Результаты. На CMM точность базовой модели около 70,9% повышается до 85,0%, на AVH — с 76,1% до 84,1%. Равномерное смешивание на AVH даёт 78,0%, выбор максимальной ветви — 79,6%. Метод также улучшает WorldSense с 25,9% до 28,8% и VideoMME с 47,9% до 49,4%, то есть эффект не полностью ограничен тестами на конфликт.
Ограничения. Пороговые коэффициенты настроены вручную, а несколько прогонов ветвей увеличивают стоимость вывода. Проверка сосредоточена на вопросах с вариантами ответа и одной модели. Причинность конфликтной меры не доказана: она хорошо коррелирует с ошибкой, но может отражать общую неуверенность.
Фишка из статьи. Два сигнала дополняют друг друга: просто обнаружить расхождение недостаточно, нужно проверить, влияет ли оно на выбираемый ответ.
| Вариант CAD на AVH | Точность, % |
|---|---|
| Базовая модель | 76,1 |
| Только веса по значимости модальностей | 80,7 |
| Только величина конфликта C | 82,7 |
| Только шлюз обоснованности B | 83,3 |
| C и B вместе | 84,1 |
Как это читать: даже лучший одиночный признак не достигает полного варианта. Средний конфликт у ошибочных ответов 0,100 против 0,033 у правильных, но полезен он лишь после привязки к текущему решению.