Паралингвистика Evaluation Judges
arXiv cs.CL

Контрфактический аудит аудио-судей для паралингвистики

arXiv:2608.06718

Эта работа проверяет, используют ли аудио-языковые модели-судьи сам звук, когда оценивают ответы в speech-to-speech системах. Авторы строят контрфактические пары: текст пользователя одинаковый, но эмоция, просодия или момент эмоционального сдвига разные, и правильный ответ зависит именно от звучания. Это важно, потому что высокая оценка модели-судьи может скрывать то, что она судит по тексту или стилю ответа, а не по аудио.

Метод. Аудит идет каскадом. В POINTWISE судья видит один аудиоконтекст и два ответа, а в PAIRWISE - обе контрфактические аудиоверсии и оба ответа; разница между ними показывает, восстанавливаема ли паралингвистическая информация при явном сравнении. Дополнительные пробы разделяют восприятие состояния пользователя и умение сопоставить состояние с правильным ответом. Есть single-turn-emotions с 378 pointwise-примерами и positional-emotion с 1000 pointwise-примерами, где важен момент эмоционального сдвига в диалоге.

Результаты. В single-turn Gemini-модели часто хорошо решают PAIRWISE, но заметно хуже POINTWISE: Gemini-3-Pro получает 91.0% в pairwise hard cue и 65.3% в pointwise hard cue, Gemini-2.5-Pro - 86.0% против 60.1%. В positional setting провал сильнее: Gemini-3-Flash достигает 79.4% в pairwise transition cue, но только 53.0% в pointwise; Gemini-3-Pro - 66.4% против 51.6%. GPT-4o, Qwen-2.5-Omni, Phi-4-Multimodal и другие открытые модели в большинстве режимов остаются около случайного уровня.

Ограничения. Аудит опирается в основном на синтетически озвученные контрфакты, потому что для такой проверки нужен точный контроль паралингвистического признака. Это дает чистую диагностику, но не покрывает все языки, микрофоны, естественные эмоции и шумы. Также работа оценивает модели как судей, а не как конечные разговорные системы.

Фишка из статьи. Хороший результат в контрастивном PAIRWISE не означает готовность к применению. Когда модель видит обе версии сразу, она может выбрать правильное соответствие; когда ей дают один реальный контекст, надежность резко падает.

СудьяSingle pointwise hardSingle pairwise hardPositional pointwise transitionPositional pairwise transition
Gemini-2.5-Pro60.1%86.0%54.5%65.8%
Gemini-3-Flash58.7%83.1%53.0%79.4%
Gemini-3-Pro65.3%91.0%51.6%66.4%
GPT-4o53.8%55.9%49.2%51.6%
Qwen-2.5-Omni-7B47.1%54.1%51.1%48.4%

Как это читать: около 50% - почти случайный выбор из двух ответов. Разрыв pairwise-pointwise показывает, что часть моделей умеет различать контраст, но не умеет стабильно применять это знание в обычном одно-контекстном режиме судьи.

Оригинальная статья на arXiv