Оценка речи LALM Надежность
Оценка речи

Когда аудиоязыковые судьи следуют протоколу, а не речи

wrong+audio <=0.10

Работа показывает неприятную вещь про большие аудиоязыковые модели как автоматических оценщиков речи: высокая согласованность с людьми еще не доказывает, что модель слушает аудио. В некоторых протоколах она может копировать служебную метку, опираться на референс или выбирать фиксированную позицию A/B. Новизна статьи в том, что авторы проверяют не только модель, а пару "модель плюс протокол оценки".

Метод. Проверяются шесть моделей: Gemini-3-Flash, GPT-Audio, две Qwen3-Omni, Audio-Flamingo-3 и Voxtral-Small-24B. Авторы строят три диагностических протокола. В первом аудио сопровождается текстовым "чертежом" акустических признаков и меткой от специализированного классификатора. Во втором в подсказку добавляется вербальная референсная метка в разных местах. В третьем пары A/B прогоняются в обоих порядках, чтобы отделить реальный выбор аудио от привязки к слоту. Атрибуты разные: эмоция, язык, естественность и сходство говорящего.

Результаты. На эмоциях неправильная specialist-метка почти ломает оценку: в условии wrong-label+audio пять из шести моделей дают точность 0.10 или ниже, хотя аудио присутствует. Audio-Flamingo-3 частично сопротивляется и получает 0.38. Для языка картина другая: четыре модели с почти идеальным audio-only распознаванием языка игнорируют неверную метку и остаются около 1.00. В A/B сравнении Qwen3-Omni-Thinking полностью фиксируется на одном слоте: lock=1.00 и gold-aligned rate=0.50 на всех задачах, то есть ровно поведение случайного выбора при перестановке порядка.

Ограничения. Это аудит на специально сконструированных ловушках, а не полный рейтинг всех возможных моделей-судей. Набор моделей небольшой, версии закрытых API могут измениться, а задания ограничены четырьмя атрибутами. Тем не менее результат важен практически: валидировать надо конкретный протокол применения, а не модель "вообще".

Фишка из статьи. Самая сильная часть статьи: конфликт двух ложных каналов на одном и том же аудио. Оказалось, что структурированный specialist-блок часто сильнее простой референсной фразы.

МодельAudio-only эмоцияCONF-SPECCONF-REFCONF-BOTH
Gemini-3-Flash0.440.860.680.87
GPT-Audio0.231.000.951.00
Qwen3-Omni-Instruct0.361.000.771.00
Qwen3-Omni-Thinking0.130.910.300.95
Audio-Flamingo-30.700.520.160.68

Как это читать: значения показывают долю ответов, где модель следует неверной подсказке вместо аудио. Если оценщик получает 1.00 в CONF-SPEC, он фактически копирует специализированную метку, даже когда та противоречит записи.

Оригинальная статья на arXiv