TRILOGUE: A Trilingual Spoken Dialogue Fact-Checking Benchmark with Evidence and Paired Audio
TRILOGUE связывает разговорную речь с полноценной проверкой фактов: нужно определить проверяемую реплику, найти подтверждающий фрагмент исходной статьи и вынести решение «истина, ложь или недостаточно данных». Английская, русская и казахская части позволяют отделить ошибки рассуждения от потерь распознавания речи, причём казахский становится особенно жёсткой проверкой всей цепочки.
Метод. Набор содержит 11 957 двухголосых диалогов, 187 544 реплики и 390,3 часа звука; 4998 файлов на русском и казахском записаны людьми, остальные синтезированы. Для каждой проверяемой реплики заданы метка, отрывок свидетельства и исходная статья. Whisper large-v3 даёт текст и временные границы, после чего сравниваются классификаторы TF-IDF, XLM-R и mDeBERTa, поиск BM25 и E5, а также проверка с истинным или найденным свидетельством.
Результаты. WER составляет 4,24% для английского, 12,24% для русского и 68,49% для казахского. С истинным свидетельством mDeBERTa получает F1 по ложным утверждениям 91,2%, 84,3% и 76,3%; с тремя фрагментами BM25 — 88,5%, 80,4% и 72,0%. Без свидетельства остаются 72,3%, 58,7% и 58,0%. Контекст всего диалога дополнительно повышает этот показатель с 72,3 до 80,3 на английском и с 58,0 до 63,7 на казахском.
Ограничения. Поиск идёт внутри заранее известной исходной статьи, а не по открытому интернету, и не охватывает противоречивые или меняющиеся источники. В языках смешаны человеческая и синтетическая речь с разным содержанием, поэтому их нельзя трактовать как чистое причинное сравнение. Казахский WER настолько высок, что часть оценки характеризует распознаватель больше, чем проверяющую модель.
Фишка из статьи. Чистый текст показывает, сколько качества отнимает распознавание именно на этапах, где требуется найти и применить свидетельство; для казахского потеря почти не видна в простом определении проверяемости, но достигает примерно 12 пунктов дальше по цепочке.
| Казахский, показатель | Чистый текст | Распознанная речь | Потеря |
|---|---|---|---|
| F1 проверяемости | 92,0 | 85,6 | 6,4 |
| Recall@5 поиска BM25 | 86,2 | 74,3 | 11,9 |
| F1 ложных, истинное свидетельство | 88,8 | 76,3 | 12,5 |
| F1 ложных, найденное свидетельство | 84,0 | 72,0 | 12,0 |
Как это читать: распознавание ухудшает не только текст реплики, но и доступ к статье, поэтому ошибка на входе усиливается на последующих этапах. При этом найденное BM25 свидетельство почти достигает истинного на английском и русском; узкое место казахской части находится прежде всего в речевом входе, а не в одной только логике проверки.