Речевые языковые модели Эмоции в речи Потоковая обработка
arXiv cs.SD

Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamination in Streaming Emotion Understanding

arXiv:2608.20769

Работа обнаруживает самоподдерживающуюся ошибку в потоковом понимании эмоций: если предыдущий ответ модели снова подать ей как контекст, он меняет восприятие того же самого звука. Это не просто инерция сглаживания, потому что при неизменной записи разные подставленные метки резко перестраивают распределение текущего ответа. Авторы не только измеряют эффект, но и показывают, что историю лучше вводить после извлечения акустического свидетельства, а не внутрь запроса на распознавание.

Метод. В контрфактической проверке фиксируются звук, инструкция и декодирование, меняется только предыдущая метка эмоции: 120 фрагментов CREMA-D-Stream умножаются на шесть меток, всего 720 условий. EmoUpdate сначала делает независимый вызов речевой языковой модели только с текущим звуком, затем объединяет полученное распределение с прошлым состоянием причинным байесовским фильтром. Асимметричные переходы сохраняются лишь при достаточной статистической поддержке, иначе фильтр сжимается к равномерной модели. Для закрытых интерфейсов, где убрать прошлую метку нельзя, предложена явная поправка логитов, оценённая по той же сетке вмешательств.

Результаты. У Qwen2-Audio точность текущего звука падает с 72,50% без прошлой метки до 30,42% с ней; меняются 65,69% ответов, а неверная подсказка перетягивает решение в 71,00% допустимых случаев. На Qwen2-Audio, Qwen2.5-Omni, Phi-4MM и MiniCPM-o 2.6, а также двух английских наборах EmoUpdate получает лучшую пошаговую и сбалансированную по смене состояния точность во всех восьми сочетаниях. Максимальный выигрыш относительно сильнейшего контролируемого варианта составляет 69,71 процентного пункта по S-BAcc и 38,41 пункта по пошаговой точности. На испытании не добавляется ни одного вызова модели и нет обучаемых параметров.

Ограничения. Проверяются только английские записи и замкнутые наборы дискретных эмоций; культурная неоднозначность таких меток остаётся вне модели. CREMA-D-Stream построен искусственно из четырёх фрагментов, а HumDial-En невелик: 315 проверочных шагов против 976. У некоторых моделей исходная точность на CREMA-D-Stream ниже 25%, поэтому улучшение траектории не делает акустический классификатор хорошим. Выбор инструкции и параметров требует размеченной выборки разработки и 1350-4800 предварительных вызовов на модель. На HumDial-En итоговая точность Qwen2-Audio и MiniCPM-o на 1,9 пункта ниже лучшего базового варианта, несмотря на лучшую траекторию.

Фишка из статьи. Обычная просьба «не учитывать прошлую метку» не устраняет загрязнение: ни одна из десяти инструкций не опускает притяжение неверной метки ниже 59,7%. Зато простая поправка распределения, оценённая без обучения и проверенная перекрёстно, возвращает больше половины потерянной точности.

Режим, Qwen2-AudioТочностьСмена ответаПритяжение неверной метки
Без прошлой метки72,50%--
С подставленной меткой30,42%65,69%71,00%
После поправки логитов53,89%39,31%12,17%

Как это читать: поправка не достигает чистого режима 72,50%, но резко убирает именно причинный симптом - копирование неверного прошлого состояния. Более того, авторы показывают почти насыщенный результат уже на 36 условиях настройки, то есть на шести фрагментах со всеми шестью подставленными метками.

Оригинальная статья на arXiv