Перевод речи Multilingual MoSE
arXiv cs.CL

MSRT-4B: ресурсно-адаптивный перевод речи между 45 языками

arXiv:2608.04586

Эта работа про прямой перевод речи в текст между многими языками, где обычная мультиязычная модель начинает терять качество из-за слишком разных объемов речевых данных. Главный ход MSRT-4B: не пытаться втиснуть все языки в один общий речевой кодировщик, а разделить кодирование речи по ресурсности языков и затем аккуратно состыковать эти представления с языковой моделью. Это интересно для практических систем перевода речи: авторы проверяют не одну пару языков, а сетку 45×44 направлений.

Метод. В модели используется ресурсно-адаптивная смесь речевых кодировщиков MoSE: языки группируются по доступности речевых данных, а маршрутизация выбирает специализированный кодировщик для соответствующей группы. Дальше речевое представление переводится в пространство текстовой языковой модели; легкая LoRA-настройка декодера помогает согласовать акустические признаки с текстовым генератором. По сравнению с одним универсальным кодировщиком это более явное решение проблемы, когда богатые языки задают модельное пространство, а малоресурсные остаются на периферии.

Результаты. На FLEURS для 11×44 и 44×11 направлений MSRT-4B получает средний результат 23.8 spBLEU и 83.3 COMET. По COMET это выше MCAT-27B (80.9), Gemini-3.5-Flash-Lite (80.0), каскада Whisper+NLLB-200-3.3B (78.4), Qwen3-Omni (77.5) и SeamlessM4T-V2-Large (72.5). В полной сетке 45×44 модель достигает COMET не ниже 80 в 1552 из 1980 направлений; для MCAT-27B таких направлений 1232, для каскада Whisper+NLLB - 1038. На English→44 средний COMET равен 87.9.

Ограничения. Основная проверка завязана на автоматические метрики spBLEU и COMET, поэтому качество живого синхронного перевода и восприятие пользователями остаются за рамками статьи. Даже при среднем COMET 83.3 слабые направления вроде Khmer или Myanmar заметно проседают. Модель на 4B параметров и обучение с несколькими речевыми кодировщиками также не выглядят дешевым вариантом для встраиваемого или потокового сценария.

Фишка из статьи. Самая полезная часть не средняя таблица, а абляция MoSE: она показывает, что специализация речевых кодировщиков действительно несет нагрузку, а не просто добавляет параметры.

ВариантСредний COMET на 6 трудных источникахКак интерпретировать
MSRT-4B, 2 эксперта75.1Основная конфигурация
3 эксперта75.3Почти то же качество, значит двух групп достаточно для текущих 45 языков
1 эксперт70.0Потеря 5.1 COMET: общий кодировщик хуже выдерживает разноуровневые языки
Без LoRA73.1Легкая адаптация декодера дает еще около 2 COMET

Как это читать: вклад MoSE особенно важен для низкоресурсных языков, где авторы отдельно показывают прирост COMET на 3.0 пункта; для средне- и высокоресурсных групп прирост меньше, 2.2 и 1.4, но он не исчезает.

Оригинальная статья на arXiv