Motor, Cognitive, or Corpus? What Survives Cross-Lingual Transfer in Speech-Based Parkinsons Disease Detection
Статья проверяет неудобный, но клинически важный вопрос: различает ли модель болезнь Паркинсона или просто узнаёт корпус, условия записи и общий признак «пациент против здорового». При последовательном переносе между записями, условиями, языками и патологиями устойчивого специфического сигнала почти не остаётся.
Метод. Девять замороженных речевых кодировщиков, включая HuBERT, WavLM, wav2vec 2.0, XLS-R и MMS, сравниваются с 88 признаками eGeMAPS. Для каждого слоя временное среднее подаётся в логистическую регрессию; слой выбирается только внутри исходного корпуса по десяти зернам и пяти блокам перекрёстной проверки, затем фиксируется. Материал включает немецкий, испанский и чешский корпуса с задачами DDK, чтения и протяжной гласной, а TREND добавляет немецких участников с Паркинсоном, деменцией и подобранными здоровыми группами.
Результаты. Простая повторная запись снижает сбалансированную точность в среднем на 1,9 пункта, смена акустических условий - на 12,5, перенос между корпусами и языками - на 16,3. Оптимальный слой зависит прежде всего от корпуса: например, WavLM-L для DDK выбирает слои 24, 1 и 22 на немецких, испанских и чешских данных. Из 540 переносов на TREND только девять одновременно превысили AUC 0,6 и сбалансированную точность 0,6. Лучшие модели дают лишь 0,67, 0,66 и 0,64 при сравнении Паркинсона со здоровыми и при этом назначают высокую вероятность болезни также речи людей с деменцией.
Ограничения. Клинические выборки невелики: в TREND всего 18 участников с Паркинсоном и 36 с деменцией, а языков только три. Используются простые линейные пробники и временное усреднение, поэтому более сложная модель могла бы извлечь другой сигнал. Возраст, пол, образование, протокол задания и запись переплетены с диагнозом; остаточная поправка уменьшает, но не устраняет все смешивающие факторы. Авторы корректно трактуют результат как отсутствие доказательства специфичности, а не доказательство её отсутствия.
Фишка из статьи. Демографические данные различают группы Паркинсона и деменции лучше, чем перенесённый речевой показатель. После удаления влияния возраста, пола и образования способность речевой оценки отличать две патологии падает до случайной.
| Проверка | Результат | Что меняется |
|---|---|---|
| Повторная запись того же человека | -1,9 пункта BA | только дубль записи |
| Чистая запись -> шумная | -12,5 пункта BA в среднем | условия и участники |
| Другой корпус и язык | -16,3 пункта BA | язык, корпус и участники |
| Демография: Паркинсон против деменции | AUC 0,73-0,75 | возраст, пол, образование |
| Речевая оценка после поправки | AUC 0,50-0,55 | влияние демографии удалено |
Как это читать: модель лучше переживает второй дубль той же сессии, чем реальную смену условий или корпуса. Наиболее тревожен последний переход: то, что выглядело речевым признаком болезни Паркинсона, после поправки не отличает её от деменции лучше случайного выбора.