Preference-ASR: WER должен учитывать формат, сущности и disfluencies
Preference-ASR разбирает неприятную проблему современной оценки ASR: две транскрипции могут быть одинаково “правильными” по смыслу, но одна соответствует нужному стилю вывода, а другая ломает downstream-сценарий. Статья предлагает тестовый набор, где оцениваются не только слова, но и предпочтения к нормализации, сущностям, disfluencies и регистру, то есть к тем деталям, которые speech LLM всё чаще пытаются контролировать инструкцией.
Метод. Авторы собирают 3210 preference triples из семи корпусов: AMI, Common Voice, Earnings-22, GigaSpeech, LibriSpeech, SPGISpeech и VoxPopuli. Для каждого примера есть аудио, preferred transcript и dispreferred transcript; затем вводится preference-aware WER, где нормализация из обычного WER отключается только тогда, когда она стирает саму проверяемую разницу. Это важное отличие от стандартного scoring pipeline: если задача проверить, сохранила ли модель “twenty five” как слова или записала “25”, обычная нормализация может искусственно сделать оба ответа одинаковыми.
Результаты. На стандартном WER модели выглядят сильнее, чем на preference-aware оценке. Например, Canary-Qwen имеет overall WER 5.64 в обычной оценке и 8.16 в preference-aware; Qwen3-Omni — 5.66 против 8.30. Инструкции тоже не всегда помогают: у Phi-4-multimodal instruction снижает стандартный overall WER с 13.79 до 9.95, но preference-aware WER остаётся высоким — 12.64. Особенно показателен Qwen3-Omni: instruction улучшает нормализацию 6.00 → 5.25 и case 3.32 → 3.09, но entity WER ухудшается 5.12 → 12.85, что авторы связывают с появлением лишних или искажённых сущностей под влиянием prompt.
Ограничения. Preference-ASR не заменяет обычные ASR-бенчмарки: это стресс-тест для формата вывода, а не полный замер акустической устойчивости. Набор относительно небольшой и англоцентричный по многим источникам, а категории предпочтений заданы авторами заранее. Для production-систем придётся добавлять свои preference classes: пунктуацию, числа, медицинские или юридические сущности, casing policy и корпоративный словарь.
Фишка из статьи. Главная фишка — не сам preference-aware WER, а то, что prompt может улучшать одни предпочтения и одновременно ломать другие. Это делает “instruction-following ASR” менее очевидным: инструкция не просто добавляет контроль, она меняет профиль ошибок.
| Модель / режим | Standard overall WER | Preference-aware overall WER | Показательный эффект |
|---|---|---|---|
| Canary-Qwen, default | 5.64 | 8.16 | После учёта предпочтений ошибка заметно выше |
| Phi-4-multimodal, instruction | 9.95 | 12.64 | Instruction помогает, но не закрывает format gap |
| Qwen3-Omni, default | 5.66 | 8.30 | Обычный WER скрывает часть ошибок стиля |
| Qwen3-Omni, instruction | 7.81 | 10.34 | Entity WER ухудшается 5.12 → 12.85 |
Как это читать: если ASR используется как front-end для поиска, CRM, протоколов или субтитров, “почти правильный текст” может быть неправильным продуктовым результатом. Preference-ASR даёт способ отдельно тестировать такие контрактные детали.