Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts
Lost in Speech исследует обнаружение фактических искажений не только в тексте, но и после прохождения через синтез и распознавание речи на английском, русском и казахском. Работа особенно полезна тем, что отделяет две причины высокого качества детектора: понимание истинности и простое узнавание машинного стиля. Результаты показывают, что расшифровка пока надёжнее прямого анализа звука, а нехватка речевых ресурсов усиливает ошибку всей цепочки.
Метод. Корпус содержит 12 013 новостных примеров: исходные статьи и версии с противоречием, выдуманным фактом или контекстным искажением трёх уровней тяжести. Английская речь синтезируется XTTS-v2, русская - Silero, казахская - отдельной открытой моделью; затем Whisper-large-v3 расшифровывает английский и русский, а дообученный wav2vec2-large - казахский. Многоязычные кодировщики обучаются отдельно на исходном тексте и расшифровках, пять звуковых декодеров проверяются без дообучения на звуке и тексте. Для реального переноса добавлены 290 проверенных ложных новостей factcheck.kz на русском и казахском и тематически подобранные правдивые статьи. Отдельная матрица скрещивает истинность с человеческим или машинным происхождением текста.
Результаты. Ошибка цепочки синтез-распознавание равна WER/CER 7,30/2,74% для английского, 9,08/4,74% для русского и 34,04/16,90% для казахского. Обученные текстовые кодировщики получают macro-F1 0,52-0,89 в двоичной задаче, но лишь 0,14-0,68 для типа и 0,15-0,66 для тяжести. Прямой анализ звука пятью моделями обычно уступает работе с расшифровкой; малые модели часто близки к случайному уровню. При этом синтетическое обучение переносится на реальные подделки: для ReMBERT F1 русского растёт с 0,786 на синтетическом тесте до 0,819 на реальном тексте, а казахского - с 0,863 до 0,883.
Ограничения. Это читаемая синтетическая речь, а не спонтанный разговор; наблюдаемая потеря смешивает артефакты синтеза и распознавания. Охвачены только новости и три языка. Для агглютинативного казахского WER завышивает разрыв из-за сегментации слов, поэтому прямое сравнение языков требует CER. Галлюцинации создаются языковыми моделями, и происхождение текста изначально совпадает с меткой; реальная часть частично исправляет это, но невелика. Прямой звуковой режим проверяется без специального обучения, поэтому его слабость нельзя считать пределом мультимодальных методов.
Фишка из статьи. Контроль происхождения показывает, что один сильный детектор почти полностью принимает машинный стиль за ложность даже тогда, когда все факты сохранены.
| Происхождение | Истинный текст: доля «галлюцинация» | Ложный текст: доля «галлюцинация» |
|---|---|---|
| Человек, ReMBERT | 0,352 | 1,000 |
| Языковая модель, ReMBERT | 1,000 | 0,986 |
| Человек, mDeBERTa | 0,221 | 0,962 |
| Языковая модель, mDeBERTa | 0,586 | 0,893 |
Как это читать: ReMBERT помечает все правдивые машинные переформулировки как галлюцинации, поэтому его высокий F1 нельзя считать чистой проверкой фактов. mDeBERTa тоже чувствителен к происхождению, но сохраняет разницу между правдивым и ложным внутри машинных текстов. Для будущих наборов важно балансировать не только метки, но и способ создания каждого класса.