Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection
Работа проверяет неудобную гипотезу: очистка записей для распознавания болезни Альцгеймера может повышать качество звука и внутрикорпусные оценки, но уничтожать полезные для переноса акустические признаки. Это особенно важно для медицинской обработки речи, где «чище» не равнозначно «надёжнее».
Метод. Авторы сопоставляют исходный Pitt Corpus и четыре производных набора, а перенос проверяют на независимом Lu из 56 записей. Используются признаки eGeMAPS, XLS-R и модель SLS с замороженным XLS-R; дополнительно пять современных систем улучшения речи применяются в согласованных и несогласованных условиях. Чувствительность больших аудиоязыковых моделей проверяется на Kimi-Audio с одним звуком и со звуком плюс расшифровка.
Результаты. У Pitt очистка поднимает DNSMOS-BAK с 2,729 до 3,602, но SLS, обученная на нём, получает на Lu Macro-F1 0,630 против 0,745 при обучении на исходном Pitt. Для ADReSS внутрикорпусный Macro-F1 достигает 0,875, а на Lu падает до 0,417. Даже когда одна и та же очистка применяется к обучению и проверке, лучший результат 0,736 у MAP-SEMamba остаётся ниже необработанной пары 0,745. У Kimi-Audio добавление расшифровки не устраняет сдвиг: на очищенном Pitt нулевой пример даёт Macro-F1 0,476 при F1 0,716 для класса AD и лишь 0,235 для контроля.
Ограничения. Независимый проверочный корпус очень мал и содержит только английскую речь; все крупные обучающие варианты происходят из одних записей Pitt. Точные старые цепочки обработки не опубликованы, поэтому часть сдвига нельзя воспроизвести. Это опыт по бинарному различению групп, а не подтверждение клинической пригодности или причинной роли шума.
Фишка из статьи. Таблица связывает повышение оценки фонового шума с противоположным движением качества переноса.
| Обучающий набор | DNSMOS-BAK | Macro-F1 внутри набора | Macro-F1 на Lu |
|---|---|---|---|
| Pitt-origin | 2,729 | 0,791 | 0,745 |
| Pitt | 3,602 | 0,812 | 0,630 |
| ADReSS | 3,595 | 0,875 | 0,417 |
| ADReSSo | 3,183 | 0,896 | 0,675 |
| ADReSS-M | 2,697 | 0,771 | 0,547 |
Как это читать: DNSMOS-BAK оценивает отсутствие раздражающего фона, а Macro-F1 усредняет качество по двум классам. Рост первой величины сопровождается улучшением «домашнего» теста, но не переносом на Lu; вероятно, модель частично учит особенности обработки конкретного корпуса.