От речи к редактируемым понятиям: анализ распознавания эмоций через интерпретируемый слой признаков
Работа заменяет непрозрачный звуковой вход распознавания эмоций набором редактируемых словесных понятий: транскриптом, высотой и интенсивностью голоса, темпом, оценками возраста и пола. Такой промежуточный слой уступает прямой звуковой модели по точности, зато позволяет измерить, какой признак меняет решение и в каком направлении.
Метод. Акустические признаки дискретизируются и вместе с транскриптом передаются текстовым языковым моделям. Сравниваются нулевой режим и дообучение на CREMA-D, IEMOCAP и MELD; затем отдельные понятия удаляются или редактируются. Прямой звуковой ориентир построен на Qwen-Omni.
Результаты. На CREMA-D дообученная понятийная модель достигает Macro-F1 45,57 против 78,67 у прямой звуковой модели; на IEMOCAP — 74,97 против 82,66, на MELD — 38,48 против 41,07. В нулевом режиме добавление транскрипта к акустическим понятиям у Qwen снижает CREMA-D с 27,88 до 5,87, но после дообучения сочетание признаков уже помогает.
Ограничения. Понятия извлекаются готовыми оценщиками и грубо квантуются; точность определения возраста невысока. Три корпуса не покрывают естественную многокультурную речь, а разрыв с прямой звуковой моделью особенно велик на CREMA-D. Интерпретируемое объяснение показывает чувствительность модели, но не обязательно причинность человеческой эмоции.
Фишка из статьи. Средняя Macro-F1 может почти не измениться, хотя конкретный класс массово перетекает в другой. На MELD удаление одного понятия меняет итоговую метрику менее чем на 0,3 пункта, но до 7% примеров Happy становятся Neutral; на CREMA-D темп речи вызывает ещё более резкий сдвиг.
| Вмешательство | Изменение решения | Изменение Macro-F1 |
|---|---|---|
| Удалить темп речи, CREMA-D | 48% Neutral → Disgust | −2,49…−6,30 |
| Удалять отдельные понятия, MELD | До 7% Happy → Neutral | Менее 0,3 |
| Добавить транскрипт без дообучения, CREMA-D | Сильное текстовое смещение | 27,88 → 5,87 |
Как это читать: интерпретируемый слой полезен именно потому, что обнаруживает перестройку классов, которую одна агрегированная метрика скрывает; однако редактирование понятия проверяет поведение модели, а не достоверность самого автоматически извлечённого признака.