Речь и здоровье Privacy Whisper
arXiv eess.AS

LSEAD: локальный анализ речи для раннего скрининга болезни Альцгеймера

arXiv:2608.07378

LSEAD использует автоматическое распознавание речи и локально запускаемую языковую модель для скрининга болезни Альцгеймера по спонтанному описанию картинки. Интерес статьи в прагматичной связке: речь переводится в текст, Zephyr-7B-beta используется как извлекатель языковых признаков, PCA уменьшает размерность, а классификатор остается простым. Это не медицинская диагностика сама по себе, но аккуратный пример privacy-preserving контура без отправки клинической речи во внешнюю модель.

Метод. Проверка идет на ADReSS20 и ADReSSo2021, где участники описывают Cookie Theft picture. ADReSS20 содержит 54 AD и 54 cognitively normal участника в train, 24 и 24 в test; ADReSSo2021 - 87/79 в train и 35/36 в test. После распознавания речи текст очищается и подается в Zephyr для получения вложений, затем PCA строит компактное пространство признаков, а классификация выполняется LR, SVC, XGBoost или нейросетями.

Результаты. На независимом тесте лучший вариант LR получает accuracy 90.0%, precision 91.2%, recall 88.1% и F1 89.7%. Это выше сравненных работ: Mortensen et al. 84.9% accuracy, Bang et al. 83.1%, Agbavor et al. 80.3%, Luz et al. 78.9%. Qwen3-30B в той же схеме достигает 87.4% accuracy и 87.0% F1, а Llama 2 - 83.2% и 81.8%. ROC AUC для Zephyr-варианта равен 0.95±0.034 против 0.92±0.035 у Qwen3.

Ограничения. Данные небольшие и взяты из стандартных benchmark-наборов, а не из разнообразной клинической практики. Система использует только текстовые признаки после распознавания речи и не включает акустические маркеры вроде пауз, темпа и голоса, хотя они могут быть диагностически важны. Кроме того, интерпретируемость признаков языковой модели ограничена, что критично для клинического доверия.

Фишка из статьи. Самая практичная проверка - устойчивость к разным системам распознавания речи. Whisper дает лучший итог, но Wav2Vec 2.0 тоже сохраняет высокую точность, то есть классификатор не полностью привязан к одному распознавателю.

Распознавание + классификаторAccuracyPrecisionRecallF1
Wav2Vec 2.0 + LR88.20%90.90%84.70%87.70%
Wav2Vec 2.0 + SVC82.40%82.80%81.40%82.10%
Whisper + LR90.00%91.20%88.10%89.70%
Whisper + SVC87.40%89.30%84.70%87.00%

Как это читать: LR на PCA-сжатых языковых признаках стабильно лучше более сложных классификаторов. Разница Whisper/Wav2Vec есть, но не разрушительная; главный сигнал, по мнению авторов, лежит в компактном лингвистическом пространстве, а не только в конкретном ASR.

Оригинальная статья на arXiv