Распознавание эмоций Мультимодальные модели Интерпретируемость
arXiv cs.CL

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

arXiv:2608.17102

Статья проверяет сильную и неочевидную гипотезу: распознавание эмоций по голосу и по лицу в мультимодальной модели может сходиться к одним и тем же разреженным элементам декодера. Авторы не ограничиваются сходством представлений, а находят нейроны, избирательные к отдельным эмоциям, затем выключают или усиливают их и переносят это вмешательство между речью и изображениями. Получается редкий для речевых моделей причинный, а не только корреляционный опыт.

Метод. Эксперименты проведены с Gemma-4-12B-it, MiniCPM-o-4.5 и Qwen2.5-Omni-7B на пяти общих классах: гнев, страх, радость, нейтральное состояние и грусть. Для речи используется MSP-Podcast, для лиц - AffectNet. Метод ConAct ранжирует элементы MLP-блоков декодера по избирательности активации; для каждой эмоции берутся верхние 0,5% нейронов. Их либо обнуляют, либо усиливают множителем 1,5. Контрольная группа состоит из случайных масок того же размера, а выбор нейронов и проверка выполнены на непересекающихся примерах. В речевой проверке на эмоцию приходится 150 высказываний, в зрительной - 300 изображений; ещё по 100 правильно распознанных примеров на эмоцию используются для поиска нейронов.

Результаты. Внутри одной модальности вмешательство действует избирательно. Например, у Gemma выключение найденных по речи нейронов снижает среднюю точность на соответствующей эмоции с базовых 35,87% до 20,93%, тогда как на остальных эмоциях она в среднем остаётся 37,23%; усиление поднимает целевой показатель до 46,40%. Главное наблюдение сохраняется при переносе между модальностями. Нейроны, найденные по лицам, при выключении снижают речевое распознавание целевой эмоции на 8,54 пункта у Gemma, на 4,14 у MiniCPM и на 7,33 у Qwen; усиление даёт соответственно +4,00, +3,06 и +2,40 пункта. Случайные маски почти не меняют исходный уровень.

Ограничения. Исходное распознавание речи слабое: UAR трёх моделей лежит примерно между 27% и 37%, поэтому работа объясняет поведение несовершенного классификатора, а не демонстрирует надёжный распознаватель эмоций. Нейроны выбираются только по уже правильно распознанным примерам, классов всего пять, а задача сведена к выбору варианта ответа. Средние и поздние слои могут кодировать не саму эмоцию, а переменную решения перед выдачей ответа. Для доли 0,5% и коэффициента усиления нет развёрнутой проверки чувствительности, а статистическая неопределённость итоговых эффектов не приведена.

Фишка из статьи. Самый убедительный опыт идёт против обычной границы модальностей: нейроны, найденные только по лицам, меняют распознавание эмоций только по речи. В таблице показан перенос зрительных нейронов на речевую задачу.

МодельБазовый уровеньПосле выключенияИзменениеПосле усиленияИзменение
Gemma-4-12B-it35,87%27,33%-8,54 п.п.39,87%+4,00 п.п.
MiniCPM-o-4.527,47%23,33%-4,14 п.п.30,53%+3,06 п.п.
Qwen2.5-Omni-7B36,93%29,60%-7,33 п.п.39,33%+2,40 п.п.

Как это читать: это точность на подмножестве, соответствующем эмоции маски, а не общая точность модели. Базовые значения для опытов с выключением и усилением чуть различаются из-за протокола, поэтому в столбце усиления важнее указанное авторами изменение. Симметричный знак эффекта и слабое действие случайных масок поддерживают причинную трактовку, но не доказывают существование единого универсального «нейрона эмоции».

Оригинальная статья на arXiv