дизартрическая речь адаптация к пациенту LoRA
arXiv cs.CL

Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases

arXiv:2609.02735

Статья разбирает практическую адаптацию распознавания к одному человеку с тяжёлой постинсультной дизартрией и задаёт полезный инженерный вопрос: какую разновидность параметрически экономной донастройки выбрать при десятках минут речи. Результат намеренно не эффектный: обычная LoRA почти не уступает более сложной DoRA, а четырёхбитная QLoRA на моделях такого размера оказывается и хуже, и не экономнее по пиковой памяти.

Метод. Используются 409 венгерских высказываний одного мужчины, 107 из них отложены для проверки. Сравниваются Whisper и Qwen, LoRA, DoRA, NF4-QLoRA, полная донастройка и разные наборы целевых слоёв. Отдельный опыт сокращает доступную речь от 30 минут до 3–5 минут, чтобы оценить реальную цену персонального сбора данных.

Результаты. LoRA и DoRA статистически не различаются: для Whisper CER равен 13,86% и 13,90% (p=0,79), для Qwen — 28,10% и 28,33% (p=0,55). NF4-QLoRA ухудшает CER до 14,56% и 30,09%, не снижая пик памяти у моделей 1,5–1,7 млрд параметров. Для Whisper полная донастройка даёт CER 11,43%, а LoRA по вниманию и полносвязным слоям — 12,09% при хранении около 3,7% параметров основы. Уже 3–5 минут речи дают почти половину полного выигрыша от 30 минут.

Ограничения. Это один говорящий, один язык и одна степень нарушения, поэтому вывод нельзя считать клинической нормой. Обучение всегда длится пять эпох, декодирование жадное, а устойчивость к новым сессиям записи не проверена. Польза персонализации убедительна для этого случая, но межпациентный перенос не исследован.

Фишка из статьи. В Whisper решающим оказывается подключение внимания кодировщика; дальнейшее добавление полносвязных слоёв уже даёт меньшую прибавку.

Целевые части WhisperОбучаемые параметрыРазмер, МБCER, %WER, %
Только внимание декодера10,5 млн4224,2144,81
+ внимание кодировщика15,7 млн6314,0529,50
+ полносвязные слои28,8 млн11512,0927,38
Полная донастройкавсе11,43

Как это читать: первые дополнительные 21 МБ адаптера снижают CER более чем на десять процентных пунктов, а следующие 52 МБ — менее чем на два. При ограниченной памяти разумный рубеж здесь проходит после внимания кодировщика.

Оригинальная статья на arXiv