HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding
HEAR проверяет, понимает ли речевая модель не только содержание разговора, но и принадлежность каждой реплики конкретному голосу. Ключевой ход — парный контрфактический тест: голоса меняют местами, и ответ засчитывается только тогда, когда модель правильно перестраивает вывод, а не угадывает его по тексту.
Метод. В наборе 887 фрагментов VoxMM, AMI и ICSI общей длительностью 22,84 часа и 2395 проверенных человеком вопросов. Задания охватывают различение голосов, привязку реплик и рассуждение; для последних создаётся версия со сменой голосов. Модель A2R на 30 млрд параметров дообучена от Qwen3-Omni на 60 тыс. контрфактических примеров CASH с трудными отрицательными примерами и GRPO.
Результаты. Gemini 3.1 Pro получает 88,8% обычной средней точности, но 75,8% в парной оценке. У GPT-4o Audio показатели 48,5% и 32,8%, у Qwen3-Omni-Instruct — 35,4% и 24,1%. A2R достигает 67,1% и 60,5%, а на внешних WDYL и Gaokao — 97,7% и 88,2%. В одноразовой абляции удаление трудных отрицательных примеров снижает парное рассуждение примерно с 60% до 43%.
Ограничения. A2R велика и требует синтетического контрфактического обучения, включая клонирование голосов; стоимость построения и вывода почти не анализируется. HEAR опирается на три семейства корпусов и вопросы с вариантами ответа, поэтому не измеряет свободное объяснение и потоковую работу. Сравнение с закрытыми моделями зависит от их текущих версий, а ключевая абляция приведена без нескольких случайных запусков.
Фишка из статьи. Обычная точность систематически переоценивает способность привязать смысл к голосу. Парная оценка снимает балл, если модель дала тот же ответ после перестановки говорящих, и тем самым отделяет текстовое рассуждение от голосового обоснования.
| Модель | Обычная средняя точность | Парная контрфактическая точность | Падение |
|---|---|---|---|
| Gemini 3.1 Pro | 88,8% | 75,8% | 13,0 п.п. |
| Gemini 3 Flash | 73,1% | 58,5% | 14,6 п.п. |
| GPT-4o Audio | 48,5% | 32,8% | 15,7 п.п. |
| Qwen3-Omni-Instruct | 35,4% | 24,1% | 11,3 п.п. |
| A2R | 67,1% | 60,5% | 6,6 п.п. |
Как это читать: третий столбец требует правильного ответа и на исходном, и на переставленном звуке. Меньший разрыв A2R согласуется с целью обучения, но не отменяет заметного отставания от лучшей закрытой модели.