Распознавание речи Медицина Whisper
arXiv eess.AS

myMediWhisper: бирманская медицинская речь и адаптация Whisper

arXiv:2608.11036

Работа интересна как практический пример распознавания медицинской речи для низкоресурсного языка, где готовый Whisper почти не помогает без адаптации. Авторы собирают бирманский корпус клинических диалогов и сравнивают PEFT с полным дообучением Whisper. Главный вывод инженерный: даже десятки часов доменной речи резко меняют качество, но агрессивное добавление шума не обязательно улучшает чистый тест.

Метод. Корпус myMediWhisper содержит 21 724 фразы от 9 дикторов, всего 55.82 часа; обучение использует 52.95 часа, тест - 2.87 часа. Для устойчивости авторы синтезируют комнатную акустику через Pyroomacoustics и применяют сдвиг времени, изменение высоты тона, гауссов шум и SpecAugment, расширяя обучающую часть до 198.63 часа. Сравниваются zero-shot модели, исходный Whisper, параметр-эффективная донастройка и полное дообучение.

Результаты. Лучший результат дает полное дообучение Whisper Medium: WER 23.44% на чистом тесте. Whisper Base после полного дообучения получает WER 31.83%, Small - 25.81%, а PEFT-версии остаются хуже: Medium PEFT дает WER 43.52%, Large-v2 PEFT - 41.57%. Zero-shot специализированная модель chuuhtetnaing/whisper-large-v3-myanmar получает WER 32.03%, то есть уступает полностью дообученному Medium, но превосходит PEFT для больших Whisper. По скорости Tiny и Base быстрее, но качество заметно ниже.

Ограничения. Корпус мал по числу дикторов и, вероятно, слабо покрывает диалектное разнообразие. Шум и реверберация в основном синтетические, поэтому улучшение в реальной клинике может отличаться. Добавленная аугментация даже ухудшает чистый WER для многих моделей, так что ее нельзя считать бесплатным способом улучшить все режимы.

Фишка из статьи. Самый содержательный результат - конфликт между чистым качеством и устойчивостью. Аугментация ухудшает чистый тест, но на симулированной комнатной акустике частично помогает женским голосам.

МодельЧистый WERКомментарий
Whisper Medium, полное дообучение23.44%лучший чистый результат
Whisper Medium + аугментация24.73%хуже на чистом тесте, устойчивее в шуме
Whisper Medium PEFT43.52%меньше обучаемых параметров, но большой разрыв
chuuhtetnaing Whisper large-v3 Myanmar32.03%сильный zero-shot внешний baseline

Как это читать: для медицинского распознавания речи в низкоресурсном языке важнее доменная разметка и полное обучение, чем просто большая модель. Аугментацию надо подбирать под целевую акустику, а не автоматически включать ради увеличения корпуса.

Оригинальная статья на arXiv