Towards Quantifying Benchmark Optimization in ASR Models
Статья показывает, что низкая WER на открытом наборе может частично отражать не более точное распознавание, а узнавание самого набора. Некоторые сильные модели воспроизводят ошибочную эталонную расшифровку даже тогда, когда звук ей противоречит, угадывают заглушённые числа и переключают написание одинаково звучащих форм по акустическому окружению. Особенно полезно, что авторы не ограничиваются корреляцией с рейтингом: контекст и внутреннее состояние модели позволяют включать и выключать это поведение.
Метод. Проверены 11 открытых распознавателей двух семейств, от Whisper и Parakeet до речевых языковых моделей Qwen3-ASR, Phi-4, Canary-Qwen, Granite и Voxtral. Основные наборы - английские VoxPopuli и LibriSpeech; для контроля собраны парламентские записи и аудиокниги 2026 года после границ обучения, частный разговорный набор и синтетические клоны голосов. Три проверки создают недоопределённость: эталон содержит известную ошибку, число физически заглушено или две записи слова звучат одинаково. Показатель accept-ref измеряет выбор эталонного варианта против варианта, поддержанного звуком. Затем авторы обрезают окружение, добавляют восьмисекундный фрагмент другого корпуса, подменяют кодировки и обучают разностное направление в одном слое кодировщика.
Результаты. Шесть моделей с лучшей WER на VoxPopuli, 5,4-5,8%, имеют и наибольшую склонность повторять ошибочный эталон: accept-ref 0,18-0,30; у всех моделей с WER не ниже 6,5% он не превышает 0,10. На проверке написания обращения шесть из 11 моделей переключаются по корпусу чаще случайного уровня, на старом и современном написании слитных слов - восемь из 11. Короткое окно вокруг спорного места и разговорный добавочный фрагмент обычно возвращают расшифровку к звуку. Для Cohere, Parakeet и Canary одна главная компонента внутреннего направления воспроизводит 65-80% полного эффекта; удаление направления переводит 88%, 95% и 93% ошибочных эталонных ответов к звуковому варианту. WER относительно исходного ошибочного эталона при этом растёт, а относительно исправленного падает на 25-40%.
Ограничения. Основной анализ охватывает английский язык и два широко используемых набора; часть контрольных записей закрыта, а голосовые клоны не заменяют естественную речь. Авторы показывают поведение при выводе, но не устанавливают, возникло ли оно из-за утечки данных, отбора контрольных точек, настройки по тесту или другого этапа обучения. Линейное управление срабатывает не везде: у Phi-4 направление различает условия, но причинно не действует, а у Higgs сильное вмешательство разрушает распознавание. Результат зависит и от качества исправления эталонов, хотя порядок моделей подтверждён отдельной человеческой разметкой.
Фишка из статьи. Эталонная ошибка ведёт себя не как заученная фраза, а как политика, запускаемая акустической «подписью» корпуса. Если оставить тот же спорный фрагмент, но убрать окружение или добавить разговорную запись, несколько лучших по WER моделей перестают следовать ошибочному эталону. У Granite этот переключатель слабее, что подчёркивает модельную зависимость эффекта.
| Модель | Полная запись | Короткое окно | Разговорный фрагмент | Удалено внутреннее направление |
|---|---|---|---|---|
| Cohere-Transcribe | 0,30 | 0,13 | 0,06 | 0,04 |
| Canary-Qwen-2.5B | 0,23 | 0,12 | 0,05 | 0,02 |
| Granite-Speech-4.1-2B | 0,21 | 0,12 | 0,20 | 0,14 |
| Parakeet-TDT-0.6B-v2 | 0,18 | 0,08 | 0,06 | 0,01 |
Как это читать: значения показывают долю спорных мест, где модель выбирает ошибочный эталон вместо варианта, соответствующего звуку. Резкое падение при неизменном целевом фрагменте означает, что решение зависит от окружающего акустического регистра, а не только от локальной фонетики или языкового приоритета.