Низкоуровневые акустические признаки для выявления дизартрии большими аудиоязыковыми моделями
Большие аудиоязыковые модели почти случайно отвечают на задачу выявления дизартрии без настройки, но после дообучения становятся конкурентоспособными, особенно если явно сообщить им несколько клинически осмысленных акустических величин. Работа полезна тем, что отделяет вклад самой большой модели от вклада высоты тона, громкости, HNR и темпа речи.
Метод. Qwen2-Audio-7B-Instruct и Phi-4-multimodal получают 30-секундные фрагменты и текстовый запрос с числовыми значениями средней и разброса F0, громкости, отношения гармоник к шуму, темпа речи и демографическими данными. Проверка проводится по дикторам в десятикратной перекрёстной схеме на испанском PC-GITA: 50 людей с болезнью Паркинсона и 50 контрольных участников, по три случайных запуска.
Результаты. Базовые wav2vec 2.0 и XLS-R достигают 82,3±3,1% и 80,3±1,7%. После обычного дообучения Phi-4 получает около 79%, Qwen2-Audio — 84%; добавление признаков поднимает их до 83,0±2,2% и 85,0±0,8%. В режиме без обучения обе модели остаются около случайных 50–51%. Среди отдельных признаков наиболее полезны HNR и темп речи, а совместное добавление четырёх акустических групп даёт лучший результат.
Ограничения. Это небольшая двоичная выборка одного языка и одной клинической группы, а сегменты одного диктора сильно связаны между собой. Признаки выбраны по литературе, но не оптимизировались и не сравнивались с более широким набором клинических дескрипторов. Прирост Qwen2-Audio над сильным wav2vec-базисом составляет лишь 2,7 п.п., поэтому вывод о преимуществе больших моделей пока локален.
Фишка из статьи. Самая показательная абляция — не лидерство Qwen2-Audio, а разница между нулевым и обученным режимами. Знаний большой аудиоязыковой модели недостаточно для клинического решения без размеченной адаптации; явные акустические числа дают умеренный, но стабильный последний шаг и снижают разброс.
| Модель | Режим | Точность по дикторам |
|---|---|---|
| Phi-4-multimodal | Без обучения | около 50% |
| Phi-4-multimodal | Дообучение | около 79% |
| Phi-4-multimodal | Дообучение + акустические признаки | 83,0±2,2% |
| Qwen2-Audio | Дообучение | около 84% |
| Qwen2-Audio | Дообучение + акустические признаки | 85,0±0,8% |
| wav2vec 2.0 | Специализированный базис | 82,3±3,1% |
Как это читать: основной скачок создаёт размеченное дообучение, а не подсказка признаками. Низкоуровневые дескрипторы особенно полезны как небольшое структурированное дополнение, а не как замена акустическому представлению.