Multimodal Intent Audio cues
arXiv cs.CL

MACH: согласие и конфликт модальностей для понимания намерений

arXiv:2608.04054

MACH полезна для речевых интерфейсов, где намерение выражается не только словами, но и интонацией, паузами и мимикой. Авторы спорят с привычным подходом, где несогласие модальностей считается шумом: иногда именно конфликт текста, голоса и лица показывает сарказм, раздражение или сомнение. Поэтому модель отдельно строит представления согласия и конфликта, а затем решает, какие признаки важнее для конкретного примера.

Метод. Входные текстовые, акустические и визуальные признаки берутся из Qwen2.5-Omni-7B, адаптированного через QLoRA. Дальше MACH проходит три уровня: одномодальный, парный и тримодальный. Для согласия используются банки прототипов и разреженные гиперграфы: каждый якорь взаимодействия соединяется только с ближайшими прототипами. Для конфликта берутся попарные различия представлений, также пропускаемые через отдельные прототипы. Feature-wise arbitration смешивает согласие и конфликт по каждому признаку, а обучение идет шестистадийной программой, чтобы иерархия стабилизировалась до совместной настройки.

Результаты. На MIntRec MACH получает Accuracy 80.99, weighted F1 80.79 и macro F1 78.41; сильный базовый HIER дает 80.00, 79.59 и 76.91. На MIntRec2.0 результат 65.67 Accuracy, 65.46 weighted F1 и 61.21 macro F1 против 64.15, 63.79 и 60.31 у HIER. На MELD-DA accuracy 62.11 и weighted F1 60.85 немного выше HIER, но macro F1 52.81 ниже HIER 54.80, что важно читать как частичный, а не абсолютный выигрыш.

Ограничения. Модель зависит от сильного предобученного мультимодального кодировщика, а визуальная модальность в абляциях сама по себе очень слаба. В статье нет потокового сценария, оценки задержки и проверки на длинном диалоговом контексте. Кроме того, улучшения на MELD-DA неоднозначны: средние метрики растут, но macro F1 не лучший.

Фишка из статьи. Абляция хорошо показывает, что в этих данных текст и звук несут основную нагрузку, а прототипы и иерархические потери не декоративны.

ВариантMIntRec AccMIntRec WF1MIntRec2.0 AccMIntRec2.0 WF1
Qwen2.5-Omni-7B признаки77.9877.5064.8864.23
Text + Audio79.9679.9265.3364.88
Без agreement-прототипов77.6677.3064.2764.01
Без diversity loss77.5377.1363.2463.04
Полная MACH80.9980.7965.6765.46

Как это читать: почти весь выигрыш нельзя объяснить только сильным кодировщиком. Удаление diversity loss на MIntRec снижает Accuracy на 3.46 пункта, а отсутствие agreement-прототипов почти возвращает модель к уровню исходных признаков.

Оригинальная статья на arXiv