распознавание речи структурированные данные оценка качества
arXiv cs.CL

VoiceCodeBench: Evaluating Exact Structured-Token Recovery in Automatic Speech Recognition

arXiv:2608.28916

VoiceCodeBench проверяет то, что WER часто скрывает: сможет ли распознаватель без единой ошибки вернуть адрес, команду, имя файла или URL. Для голосового ввода в рабочие системы это ближе к фактической полезности, потому что одна неверная буква в структурированном значении делает весь фрагмент непригодным.

Метод. Набор содержит 300 записанных людьми английских отрывков из восьми рабочих областей и 1482 вручную проверенных целевых значения 26 типов. CTEM измеряет долю точно восстановленных сущностей после допустимой нормализации, TSR — долю записей, в которых восстановлены все целевые значения. Двенадцать локальных и облачных систем получают только звуковой сигнал, без словаря и текстовой подсказки; решения автоматического проверяющего дополнительно сверяются человеком.

Результаты. Ранговая корреляция WER и обеих новых мер равна примерно −0,73: связь заметна, но порядок систем не совпадает. Deepgram Nova-3 Batch показывает лучший WER 8,6% и TSR 68,7%, тогда как лучший CTEM 91,6% получает ElevenLabs Scribe v2 Batch при WER 16,1%. Даже лучший TSR означает, что в 31,3% записей остаётся хотя бы одно критическое значение, которое нельзя безопасно передать дальше.

Ограничения. В наборе только английская, сравнительно чёткая диктовка без естественных диалогов, сильного шума и перекрытий; сценарии и значения синтетически спроектированы. Облачные системы могут изменяться после публикации. Нормализация и проверка на основе языковой модели задают прикладное, но не единственно возможное определение точного совпадения.

Фишка из статьи. Система с наименьшим WER не имеет лучшей доли точно восстановленных сущностей. Разница невелика на среднем слове, но принципиальна для кода и идентификаторов, где частичное совпадение не помогает.

СистемаWERCTEMTSR
Deepgram Nova-3 Batch8,6%90,9%68,7%
ElevenLabs Scribe v2 Batch16,1%91,6%67,7%
GPT Realtime Whisper16,3%88,7%59,3%
Whisper large-v323,1%87,6%54,3%
Amazon Streaming25,6%75,2%33,7%

Как это читать: CTEM считает отдельные сущности, TSR требует безошибочной записи целиком. Поэтому TSR резко падает, когда в одном отрывке несколько адресов или команд: для автоматического действия это более реалистичный критерий, чем средняя доля ошибочных слов.

Оригинальная статья на arXiv