Контрфактический аудит аудио-судей для паралингвистики
Эта работа проверяет, используют ли аудио-языковые модели-судьи сам звук, когда оценивают ответы в speech-to-speech системах. Авторы строят контрфактические пары: текст пользователя одинаковый, но эмоция, просодия или момент эмоционального сдвига разные, и правильный ответ зависит именно от звучания. Это важно, потому что высокая оценка модели-судьи может скрывать то, что она судит по тексту или стилю ответа, а не по аудио.
Метод. Аудит идет каскадом. В POINTWISE судья видит один аудиоконтекст и два ответа, а в PAIRWISE - обе контрфактические аудиоверсии и оба ответа; разница между ними показывает, восстанавливаема ли паралингвистическая информация при явном сравнении. Дополнительные пробы разделяют восприятие состояния пользователя и умение сопоставить состояние с правильным ответом. Есть single-turn-emotions с 378 pointwise-примерами и positional-emotion с 1000 pointwise-примерами, где важен момент эмоционального сдвига в диалоге.
Результаты. В single-turn Gemini-модели часто хорошо решают PAIRWISE, но заметно хуже POINTWISE: Gemini-3-Pro получает 91.0% в pairwise hard cue и 65.3% в pointwise hard cue, Gemini-2.5-Pro - 86.0% против 60.1%. В positional setting провал сильнее: Gemini-3-Flash достигает 79.4% в pairwise transition cue, но только 53.0% в pointwise; Gemini-3-Pro - 66.4% против 51.6%. GPT-4o, Qwen-2.5-Omni, Phi-4-Multimodal и другие открытые модели в большинстве режимов остаются около случайного уровня.
Ограничения. Аудит опирается в основном на синтетически озвученные контрфакты, потому что для такой проверки нужен точный контроль паралингвистического признака. Это дает чистую диагностику, но не покрывает все языки, микрофоны, естественные эмоции и шумы. Также работа оценивает модели как судей, а не как конечные разговорные системы.
Фишка из статьи. Хороший результат в контрастивном PAIRWISE не означает готовность к применению. Когда модель видит обе версии сразу, она может выбрать правильное соответствие; когда ей дают один реальный контекст, надежность резко падает.
| Судья | Single pointwise hard | Single pairwise hard | Positional pointwise transition | Positional pairwise transition |
|---|---|---|---|---|
| Gemini-2.5-Pro | 60.1% | 86.0% | 54.5% | 65.8% |
| Gemini-3-Flash | 58.7% | 83.1% | 53.0% | 79.4% |
| Gemini-3-Pro | 65.3% | 91.0% | 51.6% | 66.4% |
| GPT-4o | 53.8% | 55.9% | 49.2% | 51.6% |
| Qwen-2.5-Omni-7B | 47.1% | 54.1% | 51.1% | 48.4% |
Как это читать: около 50% - почти случайный выбор из двух ответов. Разрыв pairwise-pointwise показывает, что часть моделей умеет различать контраст, но не умеет стабильно применять это знание в обычном одно-контекстном режиме судьи.