MACH: согласие и конфликт модальностей для понимания намерений
MACH полезна для речевых интерфейсов, где намерение выражается не только словами, но и интонацией, паузами и мимикой. Авторы спорят с привычным подходом, где несогласие модальностей считается шумом: иногда именно конфликт текста, голоса и лица показывает сарказм, раздражение или сомнение. Поэтому модель отдельно строит представления согласия и конфликта, а затем решает, какие признаки важнее для конкретного примера.
Метод. Входные текстовые, акустические и визуальные признаки берутся из Qwen2.5-Omni-7B, адаптированного через QLoRA. Дальше MACH проходит три уровня: одномодальный, парный и тримодальный. Для согласия используются банки прототипов и разреженные гиперграфы: каждый якорь взаимодействия соединяется только с ближайшими прототипами. Для конфликта берутся попарные различия представлений, также пропускаемые через отдельные прототипы. Feature-wise arbitration смешивает согласие и конфликт по каждому признаку, а обучение идет шестистадийной программой, чтобы иерархия стабилизировалась до совместной настройки.
Результаты. На MIntRec MACH получает Accuracy 80.99, weighted F1 80.79 и macro F1 78.41; сильный базовый HIER дает 80.00, 79.59 и 76.91. На MIntRec2.0 результат 65.67 Accuracy, 65.46 weighted F1 и 61.21 macro F1 против 64.15, 63.79 и 60.31 у HIER. На MELD-DA accuracy 62.11 и weighted F1 60.85 немного выше HIER, но macro F1 52.81 ниже HIER 54.80, что важно читать как частичный, а не абсолютный выигрыш.
Ограничения. Модель зависит от сильного предобученного мультимодального кодировщика, а визуальная модальность в абляциях сама по себе очень слаба. В статье нет потокового сценария, оценки задержки и проверки на длинном диалоговом контексте. Кроме того, улучшения на MELD-DA неоднозначны: средние метрики растут, но macro F1 не лучший.
Фишка из статьи. Абляция хорошо показывает, что в этих данных текст и звук несут основную нагрузку, а прототипы и иерархические потери не декоративны.
| Вариант | MIntRec Acc | MIntRec WF1 | MIntRec2.0 Acc | MIntRec2.0 WF1 |
|---|---|---|---|---|
| Qwen2.5-Omni-7B признаки | 77.98 | 77.50 | 64.88 | 64.23 |
| Text + Audio | 79.96 | 79.92 | 65.33 | 64.88 |
| Без agreement-прототипов | 77.66 | 77.30 | 64.27 | 64.01 |
| Без diversity loss | 77.53 | 77.13 | 63.24 | 63.04 |
| Полная MACH | 80.99 | 80.79 | 65.67 | 65.46 |
Как это читать: почти весь выигрыш нельзя объяснить только сильным кодировщиком. Удаление diversity loss на MIntRec снижает Accuracy на 3.46 пункта, а отсутствие agreement-прототипов почти возвращает модель к уровню исходных признаков.