Речевые биомаркеры WhisperX Bayesian network
Речевые биомаркеры

NeSyQuaKE: речевые тесты verbal fluency для AD-маркеров

162 audio files

NeSyQuaKE интересна как осторожная попытка связать аудиозаписи verbal fluency tests с объяснимыми когнитивными маркерами, а не просто обучить черный классификатор MCI. Авторы используют WhisperX для расшифровки, локальную MedGemma-27B для структурирования, затем символические программы и байесовскую сеть для извлечения качественных связей. Работа важна для речевых биомаркеров, потому что показывает и потенциал, и слабое место такого конвейера: ошибки распознавания речи особенно заметны у группы MCI.

Метод. Данные состоят из 162 аудиофайлов University of Nebraska Medical Center: участники HC и MCI выполняют задания на беглость речи по буквам F/L и категориям animals/vegetables. Из речи извлекаются лексические признаки, например total words, word frequency, word length и age of acquisition; семантические признаки, включая число кластеров, средний размер кластера и переключения; а также акустический speech rate. LLM используется под Pydantic-ограничениями для структурных выходов, а численные переменные считаются детерминированными программами, после чего Qualitative Knowledge Extraction сравнивает связи с экспертными.

Результаты. Структурный вывод LLM дает 97.5% schema-compliant outputs по пяти seed. По PCEE, где меньше лучше, NeSyQuaKE сильно лучше rule-based baseline: для semantic fluency среднее улучшение заявлено как 94.3%, для phonemic fluency 77.2%; feedback добавляет еще 13.7% и 14.5% соответственно. Например, для semantic total words PCEE падает с 0.087 у rule-based до 0.005 у NeSy и 0.004 с feedback; для phonemic speech rate с 0.162 до 0.007. В сравнении структур NeSyQuaKE воспроизводит все экспертно заданные влияния; LLM-generated Bayesian network находит 80% экспертных ребер, но добавляет 43% лишних, а PC algorithm восстанавливает только 1 из 15 экспертных ребер.

Ограничения. Это медицинская область, и статья не демонстрирует готовую диагностическую систему с внешней валидацией классификации. Датасет небольшой, 162 аудиофайла, и включает HC/MCI в первом году наблюдения. Feedback-коррекция работает поверх текста и не возвращается к акустическому сигналу. Распознавание речи остается сильным источником смещения, особенно для патологической или менее беглой речи, поэтому конвейер нельзя использовать как клиническое решение без независимой проверки.

Фишка из статьи. Наиболее честный и полезный блок - анализ ошибок транскрипции. Он показывает, что группа MCI страдает сильнее, особенно в phonemic fluency, где каждое пропущенное или неверно распознанное слово напрямую портит счетчики кластеров, переключений и скорости речи.

Задание и группаOriginal countCorrected countРазница
Semantic HC35.62 +/- 7.2035.82 +/- 6.963.94 +/- 4.64%
Semantic MCI26.58 +/- 8.5427.44 +/- 8.419.08 +/- 10.73%
Phonemic HC28.30 +/- 7.9429.69 +/- 7.468.41 +/- 15.20%
Phonemic MCI22.24 +/- 9.2624.37 +/- 8.6918.04 +/- 20.74%

Как это читать: ошибка расшифровки не является равномерным шумом. У MCI в phonemic task разница после ручной коррекции достигает 18.04% в среднем, поэтому автоматический речевой фронтенд может сам создавать или усиливать эффект, который затем интерпретируется как когнитивный маркер.

Оригинальная статья на arXiv