HALAS: реальные hallucinations ASR вместо синтетических шумовых ловушек
HALAS — датасет и benchmark для галлюцинаций современных ASR-систем на реальной речи. Это важно, потому что многие методы детекции проверялись на non-speech или искусственно испорченном аудио, а в настоящих записях hallucination выглядит иначе: короткая, беглая, иногда почти незаметная вставка, которая не имеет фонетической опоры в сигнале.
Как собрали датасет
Исходный материал — Earnings 22: 119 часов earnings calls, 57 390 сегментов, английская речь спикеров из 27 стран. Авторы прогнали весь корпус через 7 сильных ASR-моделей: Whisper large v3, large v3 Turbo, large v2, Crisper Whisper, Canary-1B, Canary-1B-Flash и Parakeet-TDT v2. Чтобы повысить плотность интересных случаев, кандидаты для разметки выбирались по inter-model WER: если разные ASR сильно расходятся на одном audio segment, там выше шанс реальной ошибки.
Разметку делали 10 paid professional annotators с уровнем английского B2+. Каждый файл проходил две независимые разметки и arbitration третьим annotator-ом; Cohen's kappa составил 0.87. В итоге HALAS содержит 3 611 аудиофайлов со span-level hallucination labels для всех семи моделей.
Что нашли
- Train split: 2 866 файлов, hallucination rate 33.6%; test split: 745 файлов, hallucination rate 22.6%.
- Среди выбранных сложных examples hallucination rate по моделям варьируется от 21.4% до 43.8%, looping в среднем встречается только в 1.1% случаев.
- Ошибки сильно повторяются: в среднем top-10 hallucinated phrases покрывают 55% отмеченных вставок, top-30 — 75%.
- Hallucinations встречаются даже при низком WER: авторы приводят случаи до 6.25%, то есть “почти правильная” транскрипция может содержать опасную вставку.
- LLM-оценка severity показывает, что у Par, Crisper Whisper и Whisper v3 больше 25% hallucinations все равно сильно меняют смысл; у Canary-Flash, Canary и Whisper v2 severe доля выше 38%.
Детекция пока слабая
Простые proxy metrics — WER, CER, insertion rate, BERTScore, SeMaScore, perplexity — дают ROC-AUC примерно 0.7-0.8, но по отдельности не решают задачу: hallucinated text часто fluent и короткий. XGBoost на семи proxy metrics достигает среднего ROC-AUC 0.835 в режиме ALL, причем режим OTHER почти не уступает OWN: это намекает, что HALAS можно использовать для моделей, которых не было в train split.
Для Whisper large v3 SOTA-подходы тоже не выглядят зрелыми. GPT-4o mini как detector получает F1 40.7%, Gemini 2.0 Flash — 41.6%, decoder embedding layer 21 — 53.1%. Лучший вариант с embeddings из layers 2, 13 и 23 поднимает F1 до 56.1%, но это всё еще далеко от надежного safety filter.
Практический вывод
HALAS полезен как reality check для ASR-пайплайнов. Низкий WER сам по себе не гарантирует отсутствие вредной вставки, а “пустые” или синтетически зашумленные тесты переоценивают готовность hallucination detectors. Для медицинских, финансовых, юридических и call-center сценариев такой benchmark стоит держать рядом с обычными WER/CER тестами.
Фишка из статьи. HALAS полезна тем, что отделяет hallucination от обычного “ASR ошибся”. В распределениях WER hallucinated и non-hallucinated сегменты сильно пересекаются, а сами галлюцинации часто фразово-скошены: несколько популярных фраз дают заметную долю всех ошибок.
| ASR модель | Hallucination | Looping | WER | Top-10 / Top-30 фраз |
|---|---|---|---|---|
| Wv2 | 43.8% | 1.3% | 74.16 | 53 / 68 |
| Wv3 | 23.8% | 0.5% | 31.46 | 59 / 79 |
| Wv3T | 29.4% | 0.9% | 37.33 | 66 / 84 |
| CrW | 21.4% | 0.6% | 41.10 | 48 / 75 |
| Can | 33.6% | 0.9% | 48.48 | 44 / 67 |
| CanF | 30.4% | 3.1% | 110.50 | 34 / 58 |
| Par | 33.7% | 0.2% | 42.91 | 83 / 93 |
| Среднее | 30.9% | 1.1% | 55.13 | 55 / 75 |
| Detector | Accuracy | Precision | Recall | F1 |
|---|---|---|---|---|
| GPT-4o mini | 71.7 | 30.1 | 62.6 | 40.7 |
| Gemini 2.0 Flash | 84.5 | 50.0 | 35.7 | 41.6 |
| Discriminative encoder, single | 87.1 | 57.8 | 49.1 | 53.1 |
| Discriminative encoder, ensemble | 86.4 | 53.9 | 58.5 | 56.1 |
Датасет построен на Earnings22: 119 часов, 57 390 сегментов и семь ASR-систем. Важный вывод для мониторинга ASR: proxy-метрики могут дать ROC-AUC около 81%, но надежно ловить hallucination по одному WER нельзя.