распознавание речи контекстная адаптация поиск примеров
arXiv cs.CL

Контекстная адаптация моделей кодировщик-декодировщик в распознавании речи

arXiv:2609.33865

Работа проверяет, могут ли современные модели распознавания речи адаптироваться к говорящему без обновления весов, получив несколько размеченных примеров в контексте. Наиболее полезны лексически похожие записи того же говорящего, найденные по первичной расшифровке.

Метод. Для обычных моделей кодировщик-декодировщик несколько звуковых примеров объединяются перед целевой записью; мультимодальные модели дополнительно получают чередующиеся звук и текст. Сравниваются случайный поиск, лексическое сходство по первому проходу и недостижимый оракул по эталонной расшифровке.

Результаты. На L2-Arctic практический поиск снижает WER Whisper с 7,8 до 6,0%, Canary с 6,8 до 5,5%, Qwen2.5-Omni с 5,5 до 4,5%. Такой второй проход закрывает 25-60% разрыва до оракула. Большая часть пользы появляется уже от первых двух примеров.

Ограничения. Демонстрации имеют эталонные расшифровки, а их поиск требует первого прохода. Длина контекста ограничивает число примеров; на AMI чередующийся формат заставляет Phi-4 копировать демонстрации вместо распознавания цели.

Фишка из статьи. Разрыв между практическим и оракульным поиском измеряет цену ошибок первого прохода. Он устойчиво остаётся заметным у всех шести моделей, поэтому улучшение поиска примеров может дать больше, чем увеличение числа демонстраций.

Модель, L2-ArcticБез примеров WER ↓СлучайныеЛексические по первому проходуОракул
Whisper7,86,76,05,1
Canary6,86,15,55,0
Qwen3-ASR6,05,65,04,5
Qwen2.5-Omni5,55,14,54,1

Как это читать: контекстная адаптация работает в разных архитектурах, но качество определяется тем, какие примеры удалось найти. Оракульный столбец показывает ещё доступный резерв и одновременно зависимость от хорошей первичной расшифровки.

Оригинальная статья на arXiv