When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models
Когда интонация и буквальный смысл расходятся, аудиоязыковая модель должна удерживать два независимых ответа: как звучит голос и что означает фраза. Работа показывает, что готовые модели часто смешивают эти признаки, а целевое дообучение резко улучшает контролируемый тест, но перенос на естественные записи остаётся неоднозначным.
Метод. CREMA-ASIS строится с помощью IndexTTS2: голоса и акустические эмоции берутся из CREMA-D, тексты с положительной, нейтральной и отрицательной окраской — из GoEmotions. Получаются сочетания пяти голосовых эмоций и трёх смысловых классов. Qwen2-Audio, Kimi-Audio и AudioFlamingo-3 дообучаются через rsLoRA и должны отдельно назвать акустическую эмоцию и смысловую окраску; GPT-audio-mini используется как закрытая точка сравнения.
Результаты. На 5879 тестовых примерах совместная точность Qwen2-Audio растёт с 20,7% до 68,3%, Kimi-Audio — с 28,5% до 67,3%, AudioFlamingo-3 — с 32,0% до 67,8%; ошибка расшифровки остаётся около 7%, то есть выигрыш не объясняется простым улучшением распознавания слов. На MELD перенос в основном положительный или нейтральный, а на LISTEN результаты расходятся по моделям и целям.
Ограничения. Основной набор синтезирован одной системой речи из актёрских эмоций и заранее выбранных текстовых меток. Естественная интонация, сарказм и неоднозначность богаче этой сетки. На LISTEN исходная смысловая разметка совпадает с оценкой текста только в 36,9% случаев, но и замена её выводом Qwen3-32B не создаёт ручного эталона. Линейные пробы показывают доступность признака в слое, а не его причинное использование.
Фишка из статьи. Отрицательный результат на LISTEN меняет знак после смены эталона. Это не повод объявлять дообучение успешным, а сигнал, что измерение смысловой окраски звука может быть ограничено качеством метки сильнее, чем самой моделью.
| Модель | Согласие с исходной меткой LISTEN: до → после | Согласие с меткой по расшифровке: до → после |
|---|---|---|
| Qwen2-Audio | 0,409 → 0,470 | 0,622 → 0,662 |
| Kimi-Audio | 0,565 → 0,330 | 0,594 → 0,731 |
| AudioFlamingo-3 | 0,508 → 0,479 | 0,711 → 0,720 |
Как это читать: во втором столбце Kimi-Audio выглядит существенно хуже после обучения, в третьем — существенно лучше на тех же ответах. Пока смысловая разметка естественного корпуса не подтверждена человеком, такой перенос следует считать диагностическим, а не доказанным.