Automatic Speech Recognition for Multilingual Oral History Research
Работа проверяет Whisper не на чистом корпусе, а на устных историях новозеландской кантонской общины, где английский, кантонский, тайшаньский и маори сменяют друг друга внутри разговора. Главный практический вывод двойственный: черновая расшифровка резко экономит время, но низкий WER скрывает потерю именно тех языковых различий, ради которых создаётся архив.
Метод. Авторы записали 12 часов 42 минуты интервью с пожилыми носителями и сравнили восемь вариантов Whisper при принудительно заданном английском языке и при автоматическом выборе языка. Эталоном служит вручную размеченный фрагмент длиной 9 минут 33 секунды с 1198 словами одного мужчины и интервьюера; китайские фрагменты записаны традиционными иероглифами, а маори — с диакритикой.
Результаты. Лучший формальный результат даёт Whisper Large-v3 без заданного языка: WER 12,10%, CER 8,73%, MER 11,89% и WIP 84,39%. Обработка всего корпуса заняла пять часов чистого вычисления, менее 1% оценённого времени ручной расшифровки без учёта последующей правки. Однако шесть из восьми конфигураций объявили основным языком маори, а все модели смешивали кантонское и тайшаньское произношение, иногда выдавая английские галлюцинации.
Ограничения. Численная оценка построена на одном 9,5-минутном фрагменте одного говорящего, поэтому разброс по людям, диалектам и условиям записи неизвестен. Авторы не измеряют время обязательной редакторской проверки и не дообучают модель. Для языковой документации такая проверка критична: ошибка в редком фрагменте важнее средней ошибки по преимущественно английскому тексту.
Фишка из статьи. Автоматический выбор языка радикально помогает Large-v3, но тот же режим создаёт ложное ощущение надёжности: средняя ошибка падает, хотя различие двух наследуемых китайских разновидностей не восстанавливается.
| Whisper | Режим языка | WER, % | CER, % | WIP, % |
|---|---|---|---|---|
| Large-v2 | английский | 17,78 | 10,34 | 75,55 |
| Large-v3 | английский | 30,05 | 19,21 | 61,43 |
| Large-v2 | автоматический | 21,54 | 13,66 | 69,30 |
| Large-v3 | автоматический | 12,10 | 8,73 | 84,39 |
Как это читать: Large-v3 меняется с худшего крупного варианта на лучший только после снятия языкового ограничения. Но качественный разбор показывает, что модель передаёт кантонские и тайшаньские слова похожей латиницей и не сохраняет их идентичность; для архива WER здесь нельзя считать достаточным показателем.