Контекстная адаптация моделей кодировщик-декодировщик в распознавании речи
Работа проверяет, могут ли современные модели распознавания речи адаптироваться к говорящему без обновления весов, получив несколько размеченных примеров в контексте. Наиболее полезны лексически похожие записи того же говорящего, найденные по первичной расшифровке.
Метод. Для обычных моделей кодировщик-декодировщик несколько звуковых примеров объединяются перед целевой записью; мультимодальные модели дополнительно получают чередующиеся звук и текст. Сравниваются случайный поиск, лексическое сходство по первому проходу и недостижимый оракул по эталонной расшифровке.
Результаты. На L2-Arctic практический поиск снижает WER Whisper с 7,8 до 6,0%, Canary с 6,8 до 5,5%, Qwen2.5-Omni с 5,5 до 4,5%. Такой второй проход закрывает 25-60% разрыва до оракула. Большая часть пользы появляется уже от первых двух примеров.
Ограничения. Демонстрации имеют эталонные расшифровки, а их поиск требует первого прохода. Длина контекста ограничивает число примеров; на AMI чередующийся формат заставляет Phi-4 копировать демонстрации вместо распознавания цели.
Фишка из статьи. Разрыв между практическим и оракульным поиском измеряет цену ошибок первого прохода. Он устойчиво остаётся заметным у всех шести моделей, поэтому улучшение поиска примеров может дать больше, чем увеличение числа демонстраций.
| Модель, L2-Arctic | Без примеров WER ↓ | Случайные | Лексические по первому проходу | Оракул |
|---|---|---|---|---|
| Whisper | 7,8 | 6,7 | 6,0 | 5,1 |
| Canary | 6,8 | 6,1 | 5,5 | 5,0 |
| Qwen3-ASR | 6,0 | 5,6 | 5,0 | 4,5 |
| Qwen2.5-Omni | 5,5 | 5,1 | 4,5 | 4,1 |
Как это читать: контекстная адаптация работает в разных архитектурах, но качество определяется тем, какие примеры удалось найти. Оракульный столбец показывает ещё доступный резерв и одновременно зависимость от хорошей первичной расшифровки.