myMediWhisper: бирманская медицинская речь и адаптация Whisper
Работа интересна как практический пример распознавания медицинской речи для низкоресурсного языка, где готовый Whisper почти не помогает без адаптации. Авторы собирают бирманский корпус клинических диалогов и сравнивают PEFT с полным дообучением Whisper. Главный вывод инженерный: даже десятки часов доменной речи резко меняют качество, но агрессивное добавление шума не обязательно улучшает чистый тест.
Метод. Корпус myMediWhisper содержит 21 724 фразы от 9 дикторов, всего 55.82 часа; обучение использует 52.95 часа, тест - 2.87 часа. Для устойчивости авторы синтезируют комнатную акустику через Pyroomacoustics и применяют сдвиг времени, изменение высоты тона, гауссов шум и SpecAugment, расширяя обучающую часть до 198.63 часа. Сравниваются zero-shot модели, исходный Whisper, параметр-эффективная донастройка и полное дообучение.
Результаты. Лучший результат дает полное дообучение Whisper Medium: WER 23.44% на чистом тесте. Whisper Base после полного дообучения получает WER 31.83%, Small - 25.81%, а PEFT-версии остаются хуже: Medium PEFT дает WER 43.52%, Large-v2 PEFT - 41.57%. Zero-shot специализированная модель chuuhtetnaing/whisper-large-v3-myanmar получает WER 32.03%, то есть уступает полностью дообученному Medium, но превосходит PEFT для больших Whisper. По скорости Tiny и Base быстрее, но качество заметно ниже.
Ограничения. Корпус мал по числу дикторов и, вероятно, слабо покрывает диалектное разнообразие. Шум и реверберация в основном синтетические, поэтому улучшение в реальной клинике может отличаться. Добавленная аугментация даже ухудшает чистый WER для многих моделей, так что ее нельзя считать бесплатным способом улучшить все режимы.
Фишка из статьи. Самый содержательный результат - конфликт между чистым качеством и устойчивостью. Аугментация ухудшает чистый тест, но на симулированной комнатной акустике частично помогает женским голосам.
| Модель | Чистый WER | Комментарий |
|---|---|---|
| Whisper Medium, полное дообучение | 23.44% | лучший чистый результат |
| Whisper Medium + аугментация | 24.73% | хуже на чистом тесте, устойчивее в шуме |
| Whisper Medium PEFT | 43.52% | меньше обучаемых параметров, но большой разрыв |
| chuuhtetnaing Whisper large-v3 Myanmar | 32.03% | сильный zero-shot внешний baseline |
Как это читать: для медицинского распознавания речи в низкоресурсном языке важнее доменная разметка и полное обучение, чем просто большая модель. Аугментацию надо подбирать под целевую акустику, а не автоматически включать ради увеличения корпуса.