Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models
Статья проверяет сильную и неочевидную гипотезу: распознавание эмоций по голосу и по лицу в мультимодальной модели может сходиться к одним и тем же разреженным элементам декодера. Авторы не ограничиваются сходством представлений, а находят нейроны, избирательные к отдельным эмоциям, затем выключают или усиливают их и переносят это вмешательство между речью и изображениями. Получается редкий для речевых моделей причинный, а не только корреляционный опыт.
Метод. Эксперименты проведены с Gemma-4-12B-it, MiniCPM-o-4.5 и Qwen2.5-Omni-7B на пяти общих классах: гнев, страх, радость, нейтральное состояние и грусть. Для речи используется MSP-Podcast, для лиц - AffectNet. Метод ConAct ранжирует элементы MLP-блоков декодера по избирательности активации; для каждой эмоции берутся верхние 0,5% нейронов. Их либо обнуляют, либо усиливают множителем 1,5. Контрольная группа состоит из случайных масок того же размера, а выбор нейронов и проверка выполнены на непересекающихся примерах. В речевой проверке на эмоцию приходится 150 высказываний, в зрительной - 300 изображений; ещё по 100 правильно распознанных примеров на эмоцию используются для поиска нейронов.
Результаты. Внутри одной модальности вмешательство действует избирательно. Например, у Gemma выключение найденных по речи нейронов снижает среднюю точность на соответствующей эмоции с базовых 35,87% до 20,93%, тогда как на остальных эмоциях она в среднем остаётся 37,23%; усиление поднимает целевой показатель до 46,40%. Главное наблюдение сохраняется при переносе между модальностями. Нейроны, найденные по лицам, при выключении снижают речевое распознавание целевой эмоции на 8,54 пункта у Gemma, на 4,14 у MiniCPM и на 7,33 у Qwen; усиление даёт соответственно +4,00, +3,06 и +2,40 пункта. Случайные маски почти не меняют исходный уровень.
Ограничения. Исходное распознавание речи слабое: UAR трёх моделей лежит примерно между 27% и 37%, поэтому работа объясняет поведение несовершенного классификатора, а не демонстрирует надёжный распознаватель эмоций. Нейроны выбираются только по уже правильно распознанным примерам, классов всего пять, а задача сведена к выбору варианта ответа. Средние и поздние слои могут кодировать не саму эмоцию, а переменную решения перед выдачей ответа. Для доли 0,5% и коэффициента усиления нет развёрнутой проверки чувствительности, а статистическая неопределённость итоговых эффектов не приведена.
Фишка из статьи. Самый убедительный опыт идёт против обычной границы модальностей: нейроны, найденные только по лицам, меняют распознавание эмоций только по речи. В таблице показан перенос зрительных нейронов на речевую задачу.
| Модель | Базовый уровень | После выключения | Изменение | После усиления | Изменение |
|---|---|---|---|---|---|
| Gemma-4-12B-it | 35,87% | 27,33% | -8,54 п.п. | 39,87% | +4,00 п.п. |
| MiniCPM-o-4.5 | 27,47% | 23,33% | -4,14 п.п. | 30,53% | +3,06 п.п. |
| Qwen2.5-Omni-7B | 36,93% | 29,60% | -7,33 п.п. | 39,33% | +2,40 п.п. |
Как это читать: это точность на подмножестве, соответствующем эмоции маски, а не общая точность модели. Базовые значения для опытов с выключением и усилением чуть различаются из-за протокола, поэтому в столбце усиления важнее указанное авторами изменение. Симметричный знак эффекта и слабое действие случайных масок поддерживают причинную трактовку, но не доказывают существование единого универсального «нейрона эмоции».