Распознавание речи Low-resource w2v-BERT
Распознавание речи

DONDO: открытые w2v-BERT модели для 27 африканских языков

WER 10-13%

DONDO - прикладная работа про распознавание речи для африканских языков, где главная ценность не в новой архитектуре, а в открытом наборе базовых моделей. Автор выпускает 21 monolingual и 5 multilingual w2v-BERT моделей для 27 языковых разновидностей из Ганы, Сьерра-Леоне, Нигерии, Сенегала, Кении и Зимбабве. Главный ход - взять license-clear read speech, сгруппировать близкие языки регионально и аккуратно anneal learning rate, чтобы multilingual-модель не раздавила малые языки.

Метод. Все модели дообучают w2v-BERT 2.0 с CTC-головой. Для multilingual-вариантов используется мягкая языковая подсказка: one-hot идентификатор языка превращается в несколько prefix-frames и добавляется перед акустическими признаками. Обучение идет ступенчато: сначала грубая адаптация с LR 5e-5, затем annealing с LR 5e-6, а для East/Southern Africa добавлен третий шаг 5e-7.

Результаты. После annealing средний WER региональных моделей обычно оказывается в диапазоне 10-13%. Southern Ghana падает с 14.7% после Step 1 до 11.4% после Step 2, Northern Ghana - с 13.8% до 10.3%, West Africa lingua-franca - с 18.3% до 11.1%, East/Southern Africa - с 21.7% до 12.5% после трех шагов. Отдельные языки выигрывают особенно сильно: Fante улучшается с monolingual WER 30.1% до 13.4%, Meru - с 26.5% до 16.9%.

Ограничения. Данные в основном состоят из прочитанных религиозных текстов, поэтому словарь, стиль и просодия не покрывают разговорную, медицинскую, радиовещательную или code-switched речь. WER считается на in-domain тестах и не должен читаться как гарантия качества в продукте. Prefix-frame conditioning требует, чтобы пользователь заранее указал язык; автоматическое определение языка оставлено на будущее.

Фишка из статьи. Самая практичная часть - простая schedule-абляция. Первый шаг адаптации часто ухудшает отдельные языки, а второй шаг с меньшим learning rate возвращает качество почти к monolingual уровню.

Региональная модельStep 1 WERStep 2 WERStep 3 WER
Southern Ghana14.7%11.4%-
Northern Ghana13.8%10.3%-
Sierra Leone6.06%--
West Africa lingua-franca18.3%11.1%-
East/Southern Africa21.7%13.3%12.5%

Как это читать: multilingual-модель нельзя просто грубо дообучить и остановиться. Основной выигрыш дает annealing: он снижает средний WER на 3-8 пунктов и делает один checkpoint применимым для целого региона.

Оригинальная статья на arXiv