Распознавание речи Whisper Fairness
Распознавание нарушенной речи

NA-FOMAML: Whisper-распознавание CLP-речи с нормальной опорой

CLP Macro WER 24.58%

Статья интересна как попытка адаптировать Whisper к речи людей с расщелиной губы и неба, где акустика и артикуляция сильно зависят от степени нарушения. Обычное дообучение легко переобучается на малые клинические данные, поэтому авторы используют normal-anchored FOMAML: внутренняя адаптация идет на нормальной речи, а внешний шаг оптимизируется по группам CLP-разной тяжести. Главный ход не в новой архитектуре распознавания, а в том, как задается мета-обучающая траектория для устойчивости между severity-группами.

Метод. Внутренний цикл получает нормальную речь как стабильную опору с более регулярной артикуляцией. Во внешнем цикле модель видит разные смеси normal, mild, moderate и severe CLP-речи, чтобы после адаптации сохранять полезные представления для патологической речи. Авторы проверяют два набора: NMCPC-CLP и AIISH; отдельно сравнивают полное дообучение энкодера Whisper и частичное дообучение слоев. Метрики включают WER по normal, mild, moderate, severe, общий macro WER и CLP macro WER без нормальной группы.

Результаты. На NMCPC лучшая полная настройка - inner Normal, outer Normal+Mild+Moderate: WER 4.40%, 5.53%, 16.14% и 52.07% для normal, mild, moderate и severe соответственно; CLP macro WER 24.58%. На AIISH лучший полный вариант использует Normal+Mild+Moderate+Severe во внешнем цикле: WER 2.48%, 19.66%, 14.05% и 57.50%, CLP macro WER 30.40%. Частичное дообучение показывает, что на NMCPC слои 0-11 дают лучший CLP macro WER 24.58%, а на AIISH полный encoder 0-11 тоже лучший, но тяжелая severe-группа остается проблемной.

Ограничения. Данные небольшие и клинически специфичные: NMCPC и AIISH различаются языком, возрастом, составом говорящих и severity-разметкой. Даже лучший режим оставляет severe WER очень высоким: 52.07% на NMCPC и 57.50% на AIISH. Метод не решает фонемные ошибки сам по себе; авторы прямо указывают на фрикативы, аффрикаты, назальные, liquids, plosives и vowels как проблемные категории. Нет проверки на большом внешнем клиническом корпусе и на реальном сценарии помощи логопеду.

Фишка из статьи. Самая полезная часть - сравнение, где видно, что добавление severe-речи во внешний цикл не всегда помогает. Для NMCPC включение severe ухудшает severe WER меньше, но портит общую балансировку; для AIISH полный severity-набор наоборот оказывается лучшим. Это показывает, что severity-aware обучение нельзя свести к правилу "добавить все тяжелые примеры".

Датасет и режимNormalMildModerateSevereCLP macro
NMCPC, outer No+Mi4.008.3022.4424.0231.18
NMCPC, outer No+Mi+Mo4.405.5316.1452.0724.58
NMCPC, outer No+Mi+Mo+Se6.007.1118.9021.4226.99
AIISH, outer No+Mi+Mo2.4823.0819.8366.6736.53
AIISH, outer No+Mi+Mo+Se2.4819.6614.0557.5030.40

Как это читать: на NMCPC лучший CLP macro получается без severe в outer loop, хотя severe WER при этом 52.07%. На AIISH лучший режим уже включает severe. Практический вывод - нужно подбирать sampling и weighting по клиническому распределению, а не переносить схему severity-групп между датасетами как универсальную.

Оригинальная статья на arXiv