паралингвистика аудиоязыковые модели эмоции
arXiv eess.AS

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

arXiv:2608.28966

Когда интонация и буквальный смысл расходятся, аудиоязыковая модель должна удерживать два независимых ответа: как звучит голос и что означает фраза. Работа показывает, что готовые модели часто смешивают эти признаки, а целевое дообучение резко улучшает контролируемый тест, но перенос на естественные записи остаётся неоднозначным.

Метод. CREMA-ASIS строится с помощью IndexTTS2: голоса и акустические эмоции берутся из CREMA-D, тексты с положительной, нейтральной и отрицательной окраской — из GoEmotions. Получаются сочетания пяти голосовых эмоций и трёх смысловых классов. Qwen2-Audio, Kimi-Audio и AudioFlamingo-3 дообучаются через rsLoRA и должны отдельно назвать акустическую эмоцию и смысловую окраску; GPT-audio-mini используется как закрытая точка сравнения.

Результаты. На 5879 тестовых примерах совместная точность Qwen2-Audio растёт с 20,7% до 68,3%, Kimi-Audio — с 28,5% до 67,3%, AudioFlamingo-3 — с 32,0% до 67,8%; ошибка расшифровки остаётся около 7%, то есть выигрыш не объясняется простым улучшением распознавания слов. На MELD перенос в основном положительный или нейтральный, а на LISTEN результаты расходятся по моделям и целям.

Ограничения. Основной набор синтезирован одной системой речи из актёрских эмоций и заранее выбранных текстовых меток. Естественная интонация, сарказм и неоднозначность богаче этой сетки. На LISTEN исходная смысловая разметка совпадает с оценкой текста только в 36,9% случаев, но и замена её выводом Qwen3-32B не создаёт ручного эталона. Линейные пробы показывают доступность признака в слое, а не его причинное использование.

Фишка из статьи. Отрицательный результат на LISTEN меняет знак после смены эталона. Это не повод объявлять дообучение успешным, а сигнал, что измерение смысловой окраски звука может быть ограничено качеством метки сильнее, чем самой моделью.

МодельСогласие с исходной меткой LISTEN: до → послеСогласие с меткой по расшифровке: до → после
Qwen2-Audio0,409 → 0,4700,622 → 0,662
Kimi-Audio0,565 → 0,3300,594 → 0,731
AudioFlamingo-30,508 → 0,4790,711 → 0,720

Как это читать: во втором столбце Kimi-Audio выглядит существенно хуже после обучения, в третьем — существенно лучше на тех же ответах. Пока смысловая разметка естественного корпуса не подтверждена человеком, такой перенос следует считать диагностическим, а не доказанным.

Оригинальная статья на arXiv