речевые модели атрибуция говорящих рассуждение
arXiv cs.CL

HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

arXiv:2608.29120

HEAR проверяет, понимает ли речевая модель не только содержание разговора, но и принадлежность каждой реплики конкретному голосу. Ключевой ход — парный контрфактический тест: голоса меняют местами, и ответ засчитывается только тогда, когда модель правильно перестраивает вывод, а не угадывает его по тексту.

Метод. В наборе 887 фрагментов VoxMM, AMI и ICSI общей длительностью 22,84 часа и 2395 проверенных человеком вопросов. Задания охватывают различение голосов, привязку реплик и рассуждение; для последних создаётся версия со сменой голосов. Модель A2R на 30 млрд параметров дообучена от Qwen3-Omni на 60 тыс. контрфактических примеров CASH с трудными отрицательными примерами и GRPO.

Результаты. Gemini 3.1 Pro получает 88,8% обычной средней точности, но 75,8% в парной оценке. У GPT-4o Audio показатели 48,5% и 32,8%, у Qwen3-Omni-Instruct — 35,4% и 24,1%. A2R достигает 67,1% и 60,5%, а на внешних WDYL и Gaokao — 97,7% и 88,2%. В одноразовой абляции удаление трудных отрицательных примеров снижает парное рассуждение примерно с 60% до 43%.

Ограничения. A2R велика и требует синтетического контрфактического обучения, включая клонирование голосов; стоимость построения и вывода почти не анализируется. HEAR опирается на три семейства корпусов и вопросы с вариантами ответа, поэтому не измеряет свободное объяснение и потоковую работу. Сравнение с закрытыми моделями зависит от их текущих версий, а ключевая абляция приведена без нескольких случайных запусков.

Фишка из статьи. Обычная точность систематически переоценивает способность привязать смысл к голосу. Парная оценка снимает балл, если модель дала тот же ответ после перестановки говорящих, и тем самым отделяет текстовое рассуждение от голосового обоснования.

МодельОбычная средняя точностьПарная контрфактическая точностьПадение
Gemini 3.1 Pro88,8%75,8%13,0 п.п.
Gemini 3 Flash73,1%58,5%14,6 п.п.
GPT-4o Audio48,5%32,8%15,7 п.п.
Qwen3-Omni-Instruct35,4%24,1%11,3 п.п.
A2R67,1%60,5%6,6 п.п.

Как это читать: третий столбец требует правильного ответа и на исходном, и на переставленном звуке. Меньший разрыв A2R согласуется с целью обучения, но не отменяет заметного отставания от лучшей закрытой модели.

Оригинальная статья на arXiv