Когда аудиоязыковые судьи следуют протоколу, а не речи
Работа показывает неприятную вещь про большие аудиоязыковые модели как автоматических оценщиков речи: высокая согласованность с людьми еще не доказывает, что модель слушает аудио. В некоторых протоколах она может копировать служебную метку, опираться на референс или выбирать фиксированную позицию A/B. Новизна статьи в том, что авторы проверяют не только модель, а пару "модель плюс протокол оценки".
Метод. Проверяются шесть моделей: Gemini-3-Flash, GPT-Audio, две Qwen3-Omni, Audio-Flamingo-3 и Voxtral-Small-24B. Авторы строят три диагностических протокола. В первом аудио сопровождается текстовым "чертежом" акустических признаков и меткой от специализированного классификатора. Во втором в подсказку добавляется вербальная референсная метка в разных местах. В третьем пары A/B прогоняются в обоих порядках, чтобы отделить реальный выбор аудио от привязки к слоту. Атрибуты разные: эмоция, язык, естественность и сходство говорящего.
Результаты. На эмоциях неправильная specialist-метка почти ломает оценку: в условии wrong-label+audio пять из шести моделей дают точность 0.10 или ниже, хотя аудио присутствует. Audio-Flamingo-3 частично сопротивляется и получает 0.38. Для языка картина другая: четыре модели с почти идеальным audio-only распознаванием языка игнорируют неверную метку и остаются около 1.00. В A/B сравнении Qwen3-Omni-Thinking полностью фиксируется на одном слоте: lock=1.00 и gold-aligned rate=0.50 на всех задачах, то есть ровно поведение случайного выбора при перестановке порядка.
Ограничения. Это аудит на специально сконструированных ловушках, а не полный рейтинг всех возможных моделей-судей. Набор моделей небольшой, версии закрытых API могут измениться, а задания ограничены четырьмя атрибутами. Тем не менее результат важен практически: валидировать надо конкретный протокол применения, а не модель "вообще".
Фишка из статьи. Самая сильная часть статьи: конфликт двух ложных каналов на одном и том же аудио. Оказалось, что структурированный specialist-блок часто сильнее простой референсной фразы.
| Модель | Audio-only эмоция | CONF-SPEC | CONF-REF | CONF-BOTH |
|---|---|---|---|---|
| Gemini-3-Flash | 0.44 | 0.86 | 0.68 | 0.87 |
| GPT-Audio | 0.23 | 1.00 | 0.95 | 1.00 |
| Qwen3-Omni-Instruct | 0.36 | 1.00 | 0.77 | 1.00 |
| Qwen3-Omni-Thinking | 0.13 | 0.91 | 0.30 | 0.95 |
| Audio-Flamingo-3 | 0.70 | 0.52 | 0.16 | 0.68 |
Как это читать: значения показывают долю ответов, где модель следует неверной подсказке вместо аудио. Если оценщик получает 1.00 в CONF-SPEC, он фактически копирует специализированную метку, даже когда та противоречит записи.