Многоязычное ASR HuBERT Central Asian
Многоязычное распознавание

GigaAM Multilingual: распознавание для недопредставленных языков

Avg WER 10.2%

GigaAM Multilingual - работа про многоязычное распознавание речи, где основной вопрос не «можно ли обучить еще одну большую модель», а как не дать русскому и английскому подавить казахский, кыргызский и узбекский при огромном дисбалансе данных. Авторы берут 600M Conformer-энкодер с HuBERT-подобной предобучающей задачей и явно управляют смесью языковых кластеров. Интерес в практическом рецепте: балансировка на предобучении и доменно-осознанная выборка на дообучении дают выигрыш именно на длинном хвосте, не превращая модель в узкий региональный распознаватель.

Метод. Энкодер обучается на 2 млн часов аудио с дискретными акустическими единицами от teacher-модели, 24 слоями Conformer, скрытой размерностью 1024 и частотой 25 Hz. Для казахского и кыргызского добавляется синтетическая речь: тексты берутся из mC4, озвучиваются внутренней многоголосной TTS-системой, затем фильтруются предварительным распознавателем по CER. На дообучении используется общий символьный словарь для английского, русского, казахского, кыргызского и узбекского; кроме языковой балансировки авторы отдельно регулируют доли доменов, чтобы синтетика не вытесняла спонтанную речь.

Результаты. На публичных и внутренних тестах GigaAM Multilingual сильно выигрывает у Whisper large-v3 на целевых языках: например, на внутреннем наборе WER для казахского 15.8% против 65.2%, для кыргызского 9.8% против 102.2%, для узбекского 12.7% против 120.6%. В контролируемой абляции энкодеров с одинаковым CTC-дообучением GigaAM 600M получает средний WER 10.2%, тогда как Whisper Large v3 CTC - 14.1%, а Omnilingual SSL 1B CTC - 16.6%. Даже 240M версия GigaAM дает 12.2% среднего WER и обходит обе более крупные открытые базы почти на всех языках, кроме английского.

Ограничения. Часть силы модели идет не только от архитектуры, но и от большой внутренней смеси данных, краудсорсинга, синтетики и слабой разметки, поэтому воспроизвести рецепт один к одному трудно. Внутренние in-the-wild тесты полезны, но не полностью внешне проверяемы. Whisper для кыргызского запускался без языкового токена, что делает сравнение честным для сценария поддержки языка, но может быть не лучшим возможным режимом для всех моделей.

Фишка из статьи. Самая инженерная абляция - не размер модели, а веса языковых кластеров на предобучении. Небольшое смещение массы в сторону центральноазиатского кластера дает выигрыш на кыргызском, казахском и узбекском при умеренной цене для английского.

Смесь кластеровРусскийАнглийскийКыргызскийКазахскийУзбекский
E0: естественная4.614.49.412.310.5
E1: мягкий сдвиг4.614.69.111.910.2
E2: сильнее в C34.715.48.511.49.7
E3: более ровно4.914.68.711.69.8

Как это читать: низкоресурсные языки выигрывают не от полного выравнивания всего корпуса, а от аккуратного изменения sampling weights. E2 - хороший компромисс: английский ухудшается на 1.0 WER п.п. относительно E0, зато кыргызский улучшается на 0.9 п.п., казахский на 0.9 п.п., узбекский на 0.8 п.п.

Оригинальная статья на arXiv