Медицинское распознавание Многоязычность Анализ слоёв
arXiv cs.CL

Understanding Multilingual Medical ASR Adaptation Through Layer-Wise Analysis

arXiv:2608.18825

Работа сравнивает несколько способов приспособить Whisper к английской и немецкой медицинской речи, а затем смотрит, что меняется внутри кодировщика по слоям. Практический вывод не сводится к «больше модель — меньше WER»: Whisper-Medium лучше в основном многоязычном опыте, а предварительная английская настройка не помогает немецкому так хорошо, как прямое совместное обучение. Анализ представлений добавляет важную деталь: после настройки ошибки уменьшаются, но становятся хуже предсказуемы простым линейным классификатором по состояниям кодировщика.

Метод. Английский корпус содержит около 8,5 часа: 997 обучающих фраз от 23 говорящих и 104 испытательные фразы от трёх других. Немецкая часть PoCaP значительно меньше — 86 обучающих фраз одного врача и 38 испытательных фраз из другой процедуры. Авторы сравнивают нулевой режим, отдельную настройку по языкам, продолжение EN→EN+DE и прямую настройку EN+DE для Whisper Base, Small, Medium и Large-v3. Для Whisper-Small дополнительно извлекаются 13 уровней кодировщика; их геометрия сравнивается косинусной мерой и Linear CKA, а замороженные признаки проверяются линейными классификаторами области, языка и высокой ошибки.

Результаты. На английском Whisper-Medium снизил WER с 16,77% без настройки до 7,72%. При прямом обучении EN+DE та же модель получила 7,81% на английском, 46,72% на немецком и 26,30% в объединённой оценке — лучший общий результат. Двухэтапный Medium дал близкие 7,99% на английском, но 57,49% на немецком и 31,52% вместе. Лучшие немецкие 44,96% у отдельно настроенного Large-v3 нельзя считать устойчивым обобщением: обучение опирается всего на 86 фраз одного говорящего. В Whisper-Small основная перестройка происходит после английской медицинской настройки; последующее добавление немецкого почти сохраняет геометрию, Linear CKA 0,988–1,000. При этом английские и немецкие центры близки по косинусу, 0,980–0,994, но их внутренняя геометрия резко различается, CKA 0,040–0,107.

Ограничения. Немецкий опыт слишком мал и смешивает язык с говорящим, помещением и процедурой; даже английская испытательная часть содержит лишь 104 фразы. Линейные пробы используют 100–138 записей, а для высокой и низкой ошибки остаётся по 33 примера на класс. Послойно разобран только Whisper-Small и только траектория EN→EN+DE, поэтому выводы нельзя автоматически переносить на лучший прямой Medium. Клиническая пригодность по этим данным не доказана: WER на немецком всё ещё около 47%.

Фишка из статьи. Улучшение распознавания сопровождается ослаблением простого сигнала «эта фраза будет распознана плохо». Классификатор на замороженных состояниях всё хуже разделяет верхнюю и нижнюю трети фраз по WER, хотя сам декодер делает меньше ошибок на тех же 100 записях.

Состояние Whisper-SmallЛучший слойF1 пробы ошибкиWER декодера, %
Без настройкиL20,721 ± 0,02819,87
После английской настройкиL60,619 ± 0,03913,61
После EN→EN+DEL110,556 ± 0,03312,48

Как это читать: падение F1 не означает, что кодировщик стал хуже. Скорее, настройка убирает легко отделимые случаи отказа, а оставшиеся ошибки перестают линейно выделяться в одном слое. Это предупреждение для систем оценки уверенности: признак трудности, найденный до настройки, может исчезнуть именно тогда, когда средний WER улучшится.

Оригинальная статья на arXiv