распознавание речи переключение языков устная история
arXiv eess.AS

Automatic Speech Recognition for Multilingual Oral History Research

arXiv:2609.04232

Работа проверяет Whisper не на чистом корпусе, а на устных историях новозеландской кантонской общины, где английский, кантонский, тайшаньский и маори сменяют друг друга внутри разговора. Главный практический вывод двойственный: черновая расшифровка резко экономит время, но низкий WER скрывает потерю именно тех языковых различий, ради которых создаётся архив.

Метод. Авторы записали 12 часов 42 минуты интервью с пожилыми носителями и сравнили восемь вариантов Whisper при принудительно заданном английском языке и при автоматическом выборе языка. Эталоном служит вручную размеченный фрагмент длиной 9 минут 33 секунды с 1198 словами одного мужчины и интервьюера; китайские фрагменты записаны традиционными иероглифами, а маори — с диакритикой.

Результаты. Лучший формальный результат даёт Whisper Large-v3 без заданного языка: WER 12,10%, CER 8,73%, MER 11,89% и WIP 84,39%. Обработка всего корпуса заняла пять часов чистого вычисления, менее 1% оценённого времени ручной расшифровки без учёта последующей правки. Однако шесть из восьми конфигураций объявили основным языком маори, а все модели смешивали кантонское и тайшаньское произношение, иногда выдавая английские галлюцинации.

Ограничения. Численная оценка построена на одном 9,5-минутном фрагменте одного говорящего, поэтому разброс по людям, диалектам и условиям записи неизвестен. Авторы не измеряют время обязательной редакторской проверки и не дообучают модель. Для языковой документации такая проверка критична: ошибка в редком фрагменте важнее средней ошибки по преимущественно английскому тексту.

Фишка из статьи. Автоматический выбор языка радикально помогает Large-v3, но тот же режим создаёт ложное ощущение надёжности: средняя ошибка падает, хотя различие двух наследуемых китайских разновидностей не восстанавливается.

WhisperРежим языкаWER, %CER, %WIP, %
Large-v2английский17,7810,3475,55
Large-v3английский30,0519,2161,43
Large-v2автоматический21,5413,6669,30
Large-v3автоматический12,108,7384,39

Как это читать: Large-v3 меняется с худшего крупного варианта на лучший только после снятия языкового ограничения. Но качественный разбор показывает, что модель передаёт кантонские и тайшаньские слова похожей латиницей и не сохраняет их идентичность; для архива WER здесь нельзя считать достаточным показателем.

Оригинальная статья на arXiv