VoiceCodeBench: Evaluating Exact Structured-Token Recovery in Automatic Speech Recognition
VoiceCodeBench проверяет то, что WER часто скрывает: сможет ли распознаватель без единой ошибки вернуть адрес, команду, имя файла или URL. Для голосового ввода в рабочие системы это ближе к фактической полезности, потому что одна неверная буква в структурированном значении делает весь фрагмент непригодным.
Метод. Набор содержит 300 записанных людьми английских отрывков из восьми рабочих областей и 1482 вручную проверенных целевых значения 26 типов. CTEM измеряет долю точно восстановленных сущностей после допустимой нормализации, TSR — долю записей, в которых восстановлены все целевые значения. Двенадцать локальных и облачных систем получают только звуковой сигнал, без словаря и текстовой подсказки; решения автоматического проверяющего дополнительно сверяются человеком.
Результаты. Ранговая корреляция WER и обеих новых мер равна примерно −0,73: связь заметна, но порядок систем не совпадает. Deepgram Nova-3 Batch показывает лучший WER 8,6% и TSR 68,7%, тогда как лучший CTEM 91,6% получает ElevenLabs Scribe v2 Batch при WER 16,1%. Даже лучший TSR означает, что в 31,3% записей остаётся хотя бы одно критическое значение, которое нельзя безопасно передать дальше.
Ограничения. В наборе только английская, сравнительно чёткая диктовка без естественных диалогов, сильного шума и перекрытий; сценарии и значения синтетически спроектированы. Облачные системы могут изменяться после публикации. Нормализация и проверка на основе языковой модели задают прикладное, но не единственно возможное определение точного совпадения.
Фишка из статьи. Система с наименьшим WER не имеет лучшей доли точно восстановленных сущностей. Разница невелика на среднем слове, но принципиальна для кода и идентификаторов, где частичное совпадение не помогает.
| Система | WER | CTEM | TSR |
|---|---|---|---|
| Deepgram Nova-3 Batch | 8,6% | 90,9% | 68,7% |
| ElevenLabs Scribe v2 Batch | 16,1% | 91,6% | 67,7% |
| GPT Realtime Whisper | 16,3% | 88,7% | 59,3% |
| Whisper large-v3 | 23,1% | 87,6% | 54,3% |
| Amazon Streaming | 25,6% | 75,2% | 33,7% |
Как это читать: CTEM считает отдельные сущности, TSR требует безошибочной записи целиком. Поэтому TSR резко падает, когда в одном отрывке несколько адресов или команд: для автоматического действия это более реалистичный критерий, чем средняя доля ошибочных слов.