дизартрия аудиоязыковые модели акустические признаки
arXiv eess.AS

Низкоуровневые акустические признаки для выявления дизартрии большими аудиоязыковыми моделями

arXiv:2610.03352

Большие аудиоязыковые модели почти случайно отвечают на задачу выявления дизартрии без настройки, но после дообучения становятся конкурентоспособными, особенно если явно сообщить им несколько клинически осмысленных акустических величин. Работа полезна тем, что отделяет вклад самой большой модели от вклада высоты тона, громкости, HNR и темпа речи.

Метод. Qwen2-Audio-7B-Instruct и Phi-4-multimodal получают 30-секундные фрагменты и текстовый запрос с числовыми значениями средней и разброса F0, громкости, отношения гармоник к шуму, темпа речи и демографическими данными. Проверка проводится по дикторам в десятикратной перекрёстной схеме на испанском PC-GITA: 50 людей с болезнью Паркинсона и 50 контрольных участников, по три случайных запуска.

Результаты. Базовые wav2vec 2.0 и XLS-R достигают 82,3±3,1% и 80,3±1,7%. После обычного дообучения Phi-4 получает около 79%, Qwen2-Audio — 84%; добавление признаков поднимает их до 83,0±2,2% и 85,0±0,8%. В режиме без обучения обе модели остаются около случайных 50–51%. Среди отдельных признаков наиболее полезны HNR и темп речи, а совместное добавление четырёх акустических групп даёт лучший результат.

Ограничения. Это небольшая двоичная выборка одного языка и одной клинической группы, а сегменты одного диктора сильно связаны между собой. Признаки выбраны по литературе, но не оптимизировались и не сравнивались с более широким набором клинических дескрипторов. Прирост Qwen2-Audio над сильным wav2vec-базисом составляет лишь 2,7 п.п., поэтому вывод о преимуществе больших моделей пока локален.

Фишка из статьи. Самая показательная абляция — не лидерство Qwen2-Audio, а разница между нулевым и обученным режимами. Знаний большой аудиоязыковой модели недостаточно для клинического решения без размеченной адаптации; явные акустические числа дают умеренный, но стабильный последний шаг и снижают разброс.

МодельРежимТочность по дикторам
Phi-4-multimodalБез обученияоколо 50%
Phi-4-multimodalДообучениеоколо 79%
Phi-4-multimodalДообучение + акустические признаки83,0±2,2%
Qwen2-AudioДообучениеоколо 84%
Qwen2-AudioДообучение + акустические признаки85,0±0,8%
wav2vec 2.0Специализированный базис82,3±3,1%

Как это читать: основной скачок создаёт размеченное дообучение, а не подсказка признаками. Низкоуровневые дескрипторы особенно полезны как небольшое структурированное дополнение, а не как замена акустическому представлению.

Оригинальная статья на arXiv