MoLGE: языковые группы вместо отдельных экспертов для ASR
MoLGE решает типичную проблему массового мультиязычного распознавания речи: отдельный эксперт на каждый язык плохо масштабируется, а единая плотная модель усредняет слишком разные языки. Авторы группируют близкие языки и дают каждой группе своего LoRA-эксперта, оставляя нижние акустические слои общими. Идея практичная: вместо сотен языковых веток модель учится маршрутизировать речь в 16 языковых групп.
Метод. Архитектура строится поверх самоконтролируемого речевого представления. В нижних слоях используется общий LoRA-адаптер для акустики, в верхних - смесь языковых экспертов, а отдельный shared expert должен ловить надъязыковые факторы вроде диктора и канала. Маршрутизатор основан на Attentive Statistical Pooling; группы можно задавать через language ID, географию, генетическую классификацию языков или embeddings.
Результаты. Обучение собрано на FLEURS, CommonVoice и Omnilingual ASR: 13 758 часов, 495 языков. На LAMA-UT средний CER у плотной модели 25.15, у случайной смеси экспертов 24.31, у MoLGE 22.27; точность маршрутизации при этом 93.96%. На OmniASR плотная модель дает CER 29.30, случайная смесь 25.81, MoLGE 23.73 при точности маршрутизации 94.44%. Улучшение особенно важно для малоресурсных языков: авторы показывают более пологую зависимость ошибки от объема данных.
Ограничения. Основная метрика - CER, а не WER, поэтому сравнение с прикладными системами распознавания требует осторожности. Группировка языков зависит от внешней разметки и качества language ID; корпуса сильно неоднородны по доменам, письменности и качеству транскрипции. Потоковый режим, задержка и стоимость обслуживания маршрутизатора отдельно не разобраны.
Фишка из статьи. Хорошая деталь - абляция архитектуры: общий эксперт и иерархическая адаптация не декоративны. Если убрать общий эксперт, ошибка растет умеренно; если убрать языковую иерархию в верхних слоях, качество резко падает.
| Вариант | CER | Точность маршрутизации |
|---|---|---|
| MoLGE | 23.73 | 94.44% |
| Без shared expert | 24.70 | 92.77% |
| Без MoLE-адаптации | 23.85 | 73.12% |
| Без LoRA-иерархии | 27.24 | - |
Как это читать: выигрыш дает не только наличие экспертов, а разделение ролей между общими акустическими слоями и языковой специализацией наверху. Без этой иерархии CER становится хуже даже плотной настройки в некоторых режимах.