распознавание эмоций интерпретируемость понятийные модели
arXiv cs.SD

От речи к редактируемым понятиям: анализ распознавания эмоций через интерпретируемый слой признаков

arXiv:2609.39453

Работа заменяет непрозрачный звуковой вход распознавания эмоций набором редактируемых словесных понятий: транскриптом, высотой и интенсивностью голоса, темпом, оценками возраста и пола. Такой промежуточный слой уступает прямой звуковой модели по точности, зато позволяет измерить, какой признак меняет решение и в каком направлении.

Метод. Акустические признаки дискретизируются и вместе с транскриптом передаются текстовым языковым моделям. Сравниваются нулевой режим и дообучение на CREMA-D, IEMOCAP и MELD; затем отдельные понятия удаляются или редактируются. Прямой звуковой ориентир построен на Qwen-Omni.

Результаты. На CREMA-D дообученная понятийная модель достигает Macro-F1 45,57 против 78,67 у прямой звуковой модели; на IEMOCAP — 74,97 против 82,66, на MELD — 38,48 против 41,07. В нулевом режиме добавление транскрипта к акустическим понятиям у Qwen снижает CREMA-D с 27,88 до 5,87, но после дообучения сочетание признаков уже помогает.

Ограничения. Понятия извлекаются готовыми оценщиками и грубо квантуются; точность определения возраста невысока. Три корпуса не покрывают естественную многокультурную речь, а разрыв с прямой звуковой моделью особенно велик на CREMA-D. Интерпретируемое объяснение показывает чувствительность модели, но не обязательно причинность человеческой эмоции.

Фишка из статьи. Средняя Macro-F1 может почти не измениться, хотя конкретный класс массово перетекает в другой. На MELD удаление одного понятия меняет итоговую метрику менее чем на 0,3 пункта, но до 7% примеров Happy становятся Neutral; на CREMA-D темп речи вызывает ещё более резкий сдвиг.

ВмешательствоИзменение решенияИзменение Macro-F1
Удалить темп речи, CREMA-D48% Neutral → Disgust−2,49…−6,30
Удалять отдельные понятия, MELDДо 7% Happy → NeutralМенее 0,3
Добавить транскрипт без дообучения, CREMA-DСильное текстовое смещение27,88 → 5,87

Как это читать: интерпретируемый слой полезен именно потому, что обнаруживает перестройку классов, которую одна агрегированная метрика скрывает; однако редактирование понятия проверяет поведение модели, а не достоверность самого автоматически извлечённого признака.

Оригинальная статья на arXiv