NeSyQuaKE: речевые тесты verbal fluency для AD-маркеров
NeSyQuaKE интересна как осторожная попытка связать аудиозаписи verbal fluency tests с объяснимыми когнитивными маркерами, а не просто обучить черный классификатор MCI. Авторы используют WhisperX для расшифровки, локальную MedGemma-27B для структурирования, затем символические программы и байесовскую сеть для извлечения качественных связей. Работа важна для речевых биомаркеров, потому что показывает и потенциал, и слабое место такого конвейера: ошибки распознавания речи особенно заметны у группы MCI.
Метод. Данные состоят из 162 аудиофайлов University of Nebraska Medical Center: участники HC и MCI выполняют задания на беглость речи по буквам F/L и категориям animals/vegetables. Из речи извлекаются лексические признаки, например total words, word frequency, word length и age of acquisition; семантические признаки, включая число кластеров, средний размер кластера и переключения; а также акустический speech rate. LLM используется под Pydantic-ограничениями для структурных выходов, а численные переменные считаются детерминированными программами, после чего Qualitative Knowledge Extraction сравнивает связи с экспертными.
Результаты. Структурный вывод LLM дает 97.5% schema-compliant outputs по пяти seed. По PCEE, где меньше лучше, NeSyQuaKE сильно лучше rule-based baseline: для semantic fluency среднее улучшение заявлено как 94.3%, для phonemic fluency 77.2%; feedback добавляет еще 13.7% и 14.5% соответственно. Например, для semantic total words PCEE падает с 0.087 у rule-based до 0.005 у NeSy и 0.004 с feedback; для phonemic speech rate с 0.162 до 0.007. В сравнении структур NeSyQuaKE воспроизводит все экспертно заданные влияния; LLM-generated Bayesian network находит 80% экспертных ребер, но добавляет 43% лишних, а PC algorithm восстанавливает только 1 из 15 экспертных ребер.
Ограничения. Это медицинская область, и статья не демонстрирует готовую диагностическую систему с внешней валидацией классификации. Датасет небольшой, 162 аудиофайла, и включает HC/MCI в первом году наблюдения. Feedback-коррекция работает поверх текста и не возвращается к акустическому сигналу. Распознавание речи остается сильным источником смещения, особенно для патологической или менее беглой речи, поэтому конвейер нельзя использовать как клиническое решение без независимой проверки.
Фишка из статьи. Наиболее честный и полезный блок - анализ ошибок транскрипции. Он показывает, что группа MCI страдает сильнее, особенно в phonemic fluency, где каждое пропущенное или неверно распознанное слово напрямую портит счетчики кластеров, переключений и скорости речи.
| Задание и группа | Original count | Corrected count | Разница |
|---|---|---|---|
| Semantic HC | 35.62 +/- 7.20 | 35.82 +/- 6.96 | 3.94 +/- 4.64% |
| Semantic MCI | 26.58 +/- 8.54 | 27.44 +/- 8.41 | 9.08 +/- 10.73% |
| Phonemic HC | 28.30 +/- 7.94 | 29.69 +/- 7.46 | 8.41 +/- 15.20% |
| Phonemic MCI | 22.24 +/- 9.26 | 24.37 +/- 8.69 | 18.04 +/- 20.74% |
Как это читать: ошибка расшифровки не является равномерным шумом. У MCI в phonemic task разница после ручной коррекции достигает 18.04% в среднем, поэтому автоматический речевой фронтенд может сам создавать или усиливать эффект, который затем интерпретируется как когнитивный маркер.