LSEAD: локальный анализ речи для раннего скрининга болезни Альцгеймера
LSEAD использует автоматическое распознавание речи и локально запускаемую языковую модель для скрининга болезни Альцгеймера по спонтанному описанию картинки. Интерес статьи в прагматичной связке: речь переводится в текст, Zephyr-7B-beta используется как извлекатель языковых признаков, PCA уменьшает размерность, а классификатор остается простым. Это не медицинская диагностика сама по себе, но аккуратный пример privacy-preserving контура без отправки клинической речи во внешнюю модель.
Метод. Проверка идет на ADReSS20 и ADReSSo2021, где участники описывают Cookie Theft picture. ADReSS20 содержит 54 AD и 54 cognitively normal участника в train, 24 и 24 в test; ADReSSo2021 - 87/79 в train и 35/36 в test. После распознавания речи текст очищается и подается в Zephyr для получения вложений, затем PCA строит компактное пространство признаков, а классификация выполняется LR, SVC, XGBoost или нейросетями.
Результаты. На независимом тесте лучший вариант LR получает accuracy 90.0%, precision 91.2%, recall 88.1% и F1 89.7%. Это выше сравненных работ: Mortensen et al. 84.9% accuracy, Bang et al. 83.1%, Agbavor et al. 80.3%, Luz et al. 78.9%. Qwen3-30B в той же схеме достигает 87.4% accuracy и 87.0% F1, а Llama 2 - 83.2% и 81.8%. ROC AUC для Zephyr-варианта равен 0.95±0.034 против 0.92±0.035 у Qwen3.
Ограничения. Данные небольшие и взяты из стандартных benchmark-наборов, а не из разнообразной клинической практики. Система использует только текстовые признаки после распознавания речи и не включает акустические маркеры вроде пауз, темпа и голоса, хотя они могут быть диагностически важны. Кроме того, интерпретируемость признаков языковой модели ограничена, что критично для клинического доверия.
Фишка из статьи. Самая практичная проверка - устойчивость к разным системам распознавания речи. Whisper дает лучший итог, но Wav2Vec 2.0 тоже сохраняет высокую точность, то есть классификатор не полностью привязан к одному распознавателю.
| Распознавание + классификатор | Accuracy | Precision | Recall | F1 |
|---|---|---|---|---|
| Wav2Vec 2.0 + LR | 88.20% | 90.90% | 84.70% | 87.70% |
| Wav2Vec 2.0 + SVC | 82.40% | 82.80% | 81.40% | 82.10% |
| Whisper + LR | 90.00% | 91.20% | 88.10% | 89.70% |
| Whisper + SVC | 87.40% | 89.30% | 84.70% | 87.00% |
Как это читать: LR на PCA-сжатых языковых признаках стабильно лучше более сложных классификаторов. Разница Whisper/Wav2Vec есть, но не разрушительная; главный сигнал, по мнению авторов, лежит в компактном лингвистическом пространстве, а не только в конкретном ASR.