NA-FOMAML: Whisper-распознавание CLP-речи с нормальной опорой
Статья интересна как попытка адаптировать Whisper к речи людей с расщелиной губы и неба, где акустика и артикуляция сильно зависят от степени нарушения. Обычное дообучение легко переобучается на малые клинические данные, поэтому авторы используют normal-anchored FOMAML: внутренняя адаптация идет на нормальной речи, а внешний шаг оптимизируется по группам CLP-разной тяжести. Главный ход не в новой архитектуре распознавания, а в том, как задается мета-обучающая траектория для устойчивости между severity-группами.
Метод. Внутренний цикл получает нормальную речь как стабильную опору с более регулярной артикуляцией. Во внешнем цикле модель видит разные смеси normal, mild, moderate и severe CLP-речи, чтобы после адаптации сохранять полезные представления для патологической речи. Авторы проверяют два набора: NMCPC-CLP и AIISH; отдельно сравнивают полное дообучение энкодера Whisper и частичное дообучение слоев. Метрики включают WER по normal, mild, moderate, severe, общий macro WER и CLP macro WER без нормальной группы.
Результаты. На NMCPC лучшая полная настройка - inner Normal, outer Normal+Mild+Moderate: WER 4.40%, 5.53%, 16.14% и 52.07% для normal, mild, moderate и severe соответственно; CLP macro WER 24.58%. На AIISH лучший полный вариант использует Normal+Mild+Moderate+Severe во внешнем цикле: WER 2.48%, 19.66%, 14.05% и 57.50%, CLP macro WER 30.40%. Частичное дообучение показывает, что на NMCPC слои 0-11 дают лучший CLP macro WER 24.58%, а на AIISH полный encoder 0-11 тоже лучший, но тяжелая severe-группа остается проблемной.
Ограничения. Данные небольшие и клинически специфичные: NMCPC и AIISH различаются языком, возрастом, составом говорящих и severity-разметкой. Даже лучший режим оставляет severe WER очень высоким: 52.07% на NMCPC и 57.50% на AIISH. Метод не решает фонемные ошибки сам по себе; авторы прямо указывают на фрикативы, аффрикаты, назальные, liquids, plosives и vowels как проблемные категории. Нет проверки на большом внешнем клиническом корпусе и на реальном сценарии помощи логопеду.
Фишка из статьи. Самая полезная часть - сравнение, где видно, что добавление severe-речи во внешний цикл не всегда помогает. Для NMCPC включение severe ухудшает severe WER меньше, но портит общую балансировку; для AIISH полный severity-набор наоборот оказывается лучшим. Это показывает, что severity-aware обучение нельзя свести к правилу "добавить все тяжелые примеры".
| Датасет и режим | Normal | Mild | Moderate | Severe | CLP macro |
|---|---|---|---|---|---|
| NMCPC, outer No+Mi | 4.00 | 8.30 | 22.44 | 24.02 | 31.18 |
| NMCPC, outer No+Mi+Mo | 4.40 | 5.53 | 16.14 | 52.07 | 24.58 |
| NMCPC, outer No+Mi+Mo+Se | 6.00 | 7.11 | 18.90 | 21.42 | 26.99 |
| AIISH, outer No+Mi+Mo | 2.48 | 23.08 | 19.83 | 66.67 | 36.53 |
| AIISH, outer No+Mi+Mo+Se | 2.48 | 19.66 | 14.05 | 57.50 | 30.40 |
Как это читать: на NMCPC лучший CLP macro получается без severe в outer loop, хотя severe WER при этом 52.07%. На AIISH лучший режим уже включает severe. Практический вывод - нужно подбирать sampling и weighting по клиническому распределению, а не переносить схему severity-групп между датасетами как универсальную.