ASR Hallucinations Dataset
ASR reliability

HALAS: реальные hallucinations ASR вместо синтетических шумовых ловушек

F1 56.1%

HALAS — датасет и benchmark для галлюцинаций современных ASR-систем на реальной речи. Это важно, потому что многие методы детекции проверялись на non-speech или искусственно испорченном аудио, а в настоящих записях hallucination выглядит иначе: короткая, беглая, иногда почти незаметная вставка, которая не имеет фонетической опоры в сигнале.

Как собрали датасет

Исходный материал — Earnings 22: 119 часов earnings calls, 57 390 сегментов, английская речь спикеров из 27 стран. Авторы прогнали весь корпус через 7 сильных ASR-моделей: Whisper large v3, large v3 Turbo, large v2, Crisper Whisper, Canary-1B, Canary-1B-Flash и Parakeet-TDT v2. Чтобы повысить плотность интересных случаев, кандидаты для разметки выбирались по inter-model WER: если разные ASR сильно расходятся на одном audio segment, там выше шанс реальной ошибки.

Разметку делали 10 paid professional annotators с уровнем английского B2+. Каждый файл проходил две независимые разметки и arbitration третьим annotator-ом; Cohen's kappa составил 0.87. В итоге HALAS содержит 3 611 аудиофайлов со span-level hallucination labels для всех семи моделей.

Что нашли

  • Train split: 2 866 файлов, hallucination rate 33.6%; test split: 745 файлов, hallucination rate 22.6%.
  • Среди выбранных сложных examples hallucination rate по моделям варьируется от 21.4% до 43.8%, looping в среднем встречается только в 1.1% случаев.
  • Ошибки сильно повторяются: в среднем top-10 hallucinated phrases покрывают 55% отмеченных вставок, top-30 — 75%.
  • Hallucinations встречаются даже при низком WER: авторы приводят случаи до 6.25%, то есть “почти правильная” транскрипция может содержать опасную вставку.
  • LLM-оценка severity показывает, что у Par, Crisper Whisper и Whisper v3 больше 25% hallucinations все равно сильно меняют смысл; у Canary-Flash, Canary и Whisper v2 severe доля выше 38%.

Детекция пока слабая

Простые proxy metrics — WER, CER, insertion rate, BERTScore, SeMaScore, perplexity — дают ROC-AUC примерно 0.7-0.8, но по отдельности не решают задачу: hallucinated text часто fluent и короткий. XGBoost на семи proxy metrics достигает среднего ROC-AUC 0.835 в режиме ALL, причем режим OTHER почти не уступает OWN: это намекает, что HALAS можно использовать для моделей, которых не было в train split.

Для Whisper large v3 SOTA-подходы тоже не выглядят зрелыми. GPT-4o mini как detector получает F1 40.7%, Gemini 2.0 Flash — 41.6%, decoder embedding layer 21 — 53.1%. Лучший вариант с embeddings из layers 2, 13 и 23 поднимает F1 до 56.1%, но это всё еще далеко от надежного safety filter.

Практический вывод

HALAS полезен как reality check для ASR-пайплайнов. Низкий WER сам по себе не гарантирует отсутствие вредной вставки, а “пустые” или синтетически зашумленные тесты переоценивают готовность hallucination detectors. Для медицинских, финансовых, юридических и call-center сценариев такой benchmark стоит держать рядом с обычными WER/CER тестами.

Фишка из статьи. HALAS полезна тем, что отделяет hallucination от обычного “ASR ошибся”. В распределениях WER hallucinated и non-hallucinated сегменты сильно пересекаются, а сами галлюцинации часто фразово-скошены: несколько популярных фраз дают заметную долю всех ошибок.

ASR модельHallucinationLoopingWERTop-10 / Top-30 фраз
Wv243.8%1.3%74.1653 / 68
Wv323.8%0.5%31.4659 / 79
Wv3T29.4%0.9%37.3366 / 84
CrW21.4%0.6%41.1048 / 75
Can33.6%0.9%48.4844 / 67
CanF30.4%3.1%110.5034 / 58
Par33.7%0.2%42.9183 / 93
Среднее30.9%1.1%55.1355 / 75
DetectorAccuracyPrecisionRecallF1
GPT-4o mini71.730.162.640.7
Gemini 2.0 Flash84.550.035.741.6
Discriminative encoder, single87.157.849.153.1
Discriminative encoder, ensemble86.453.958.556.1

Датасет построен на Earnings22: 119 часов, 57 390 сегментов и семь ASR-систем. Важный вывод для мониторинга ASR: proxy-метрики могут дать ROC-AUC около 81%, но надежно ловить hallucination по одному WER нельзя.

Оригинальная статья на arXiv