Распознавание речи MoE LoRA
Мультиязычное распознавание

MoLGE: языковые группы вместо отдельных экспертов для ASR

495 languages

MoLGE решает типичную проблему массового мультиязычного распознавания речи: отдельный эксперт на каждый язык плохо масштабируется, а единая плотная модель усредняет слишком разные языки. Авторы группируют близкие языки и дают каждой группе своего LoRA-эксперта, оставляя нижние акустические слои общими. Идея практичная: вместо сотен языковых веток модель учится маршрутизировать речь в 16 языковых групп.

Метод. Архитектура строится поверх самоконтролируемого речевого представления. В нижних слоях используется общий LoRA-адаптер для акустики, в верхних - смесь языковых экспертов, а отдельный shared expert должен ловить надъязыковые факторы вроде диктора и канала. Маршрутизатор основан на Attentive Statistical Pooling; группы можно задавать через language ID, географию, генетическую классификацию языков или embeddings.

Результаты. Обучение собрано на FLEURS, CommonVoice и Omnilingual ASR: 13 758 часов, 495 языков. На LAMA-UT средний CER у плотной модели 25.15, у случайной смеси экспертов 24.31, у MoLGE 22.27; точность маршрутизации при этом 93.96%. На OmniASR плотная модель дает CER 29.30, случайная смесь 25.81, MoLGE 23.73 при точности маршрутизации 94.44%. Улучшение особенно важно для малоресурсных языков: авторы показывают более пологую зависимость ошибки от объема данных.

Ограничения. Основная метрика - CER, а не WER, поэтому сравнение с прикладными системами распознавания требует осторожности. Группировка языков зависит от внешней разметки и качества language ID; корпуса сильно неоднородны по доменам, письменности и качеству транскрипции. Потоковый режим, задержка и стоимость обслуживания маршрутизатора отдельно не разобраны.

Фишка из статьи. Хорошая деталь - абляция архитектуры: общий эксперт и иерархическая адаптация не декоративны. Если убрать общий эксперт, ошибка растет умеренно; если убрать языковую иерархию в верхних слоях, качество резко падает.

ВариантCERТочность маршрутизации
MoLGE23.7394.44%
Без shared expert24.7092.77%
Без MoLE-адаптации23.8573.12%
Без LoRA-иерархии27.24-

Как это читать: выигрыш дает не только наличие экспертов, а разделение ролей между общими акустическими слоями и языковой специализацией наверху. Без этой иерархии CER становится хуже даже плотной настройки в некоторых режимах.

Оригинальная статья на arXiv