Robust Speech Emotion Recognition under Tone-Word Conflict: A Benchmark and Framework
TWIN-SER проверяет распознавание эмоций в неприятном, но реалистичном случае: интонация выражает одно состояние, а слова подсказывают другое. Большинство речевых и многомодальных основ резко теряет точность, поэтому авторы разводят акустический и смысловой тракты и объединяют только наиболее информативные участки.
Метод. Набор содержит 378 многоязычных синтетических реплик, созданных связкой языковой модели и синтеза речи и затем вручную проверенных. В DAS смысл извлекается Whisper, акустические признаки — MingTok-Audio; высокоэнергетические фрагменты отбираются отдельно, а Q-Former с обучаемыми запросами согласует два потока. Обучение проходит на MELD, RAVDESS и ESD без примеров TWIN-SER, поэтому конфликтный набор используется без дополнительной настройки.
Результаты. На TWIN-SER Whisper достигает взвешенной точности 47,26% и WF1 44,97%, Qwen2.5-Omni — 34,66% и 30,21%, а DAS — 59,38% и 55,08%. На обычных Emo-Emilia и EmoDB специализированные или крупные модели снова сильнее: DAS получает 51,14% и 68,10% точности против 70,64% и 87,85% у Qwen2.5-Omni. Это не универсальное превосходство, а выигрыш именно при противоречии тона и слов.
Ограничения. TWIN-SER мал и полностью синтетический; для страха и отвращения есть лишь 33 и 28 примеров. Ни одна система не распознала правильно ни одного примера этих двух классов. Неясно, сохранится ли преимущество на естественной спонтанной речи, где конфликт тоньше и нет чистой исходной метки эмоции.
Фишка из статьи. Абляция показывает, что полезен не любой механизм внимания: полный просмотр последовательности и случайный выбор уступают отбору высокоэнергетических участков, а простое объединение признаков уступает запросам Q-Former.
| Вариант | Параметры объединения | Взвешенная точность, % | WF1, % |
|---|---|---|---|
| Случайный выбор фрагментов | 3,45 млн | 55,47 | 51,57 |
| Полное внимание | 0,82 млн | 55,99 | 52,48 |
| Конкатенация | 1,22 млн | 53,65 | 50,77 |
| Шлюзовое объединение | 1,65 млн | 53,12 | 50,84 |
| DAS | 3,45 млн | 59,38 | 55,08 |
Как это читать: преимущество DAS над полным вниманием составляет 3,39 пункта точности, а над простым объединением — 5,73. При конфликте признаков модели важно сначала локализовать эмоционально насыщенные моменты, а затем выборочно опросить их, хотя цена этого решения выше по числу обучаемых параметров.