MSRT-4B: ресурсно-адаптивный перевод речи между 45 языками
Эта работа про прямой перевод речи в текст между многими языками, где обычная мультиязычная модель начинает терять качество из-за слишком разных объемов речевых данных. Главный ход MSRT-4B: не пытаться втиснуть все языки в один общий речевой кодировщик, а разделить кодирование речи по ресурсности языков и затем аккуратно состыковать эти представления с языковой моделью. Это интересно для практических систем перевода речи: авторы проверяют не одну пару языков, а сетку 45×44 направлений.
Метод. В модели используется ресурсно-адаптивная смесь речевых кодировщиков MoSE: языки группируются по доступности речевых данных, а маршрутизация выбирает специализированный кодировщик для соответствующей группы. Дальше речевое представление переводится в пространство текстовой языковой модели; легкая LoRA-настройка декодера помогает согласовать акустические признаки с текстовым генератором. По сравнению с одним универсальным кодировщиком это более явное решение проблемы, когда богатые языки задают модельное пространство, а малоресурсные остаются на периферии.
Результаты. На FLEURS для 11×44 и 44×11 направлений MSRT-4B получает средний результат 23.8 spBLEU и 83.3 COMET. По COMET это выше MCAT-27B (80.9), Gemini-3.5-Flash-Lite (80.0), каскада Whisper+NLLB-200-3.3B (78.4), Qwen3-Omni (77.5) и SeamlessM4T-V2-Large (72.5). В полной сетке 45×44 модель достигает COMET не ниже 80 в 1552 из 1980 направлений; для MCAT-27B таких направлений 1232, для каскада Whisper+NLLB - 1038. На English→44 средний COMET равен 87.9.
Ограничения. Основная проверка завязана на автоматические метрики spBLEU и COMET, поэтому качество живого синхронного перевода и восприятие пользователями остаются за рамками статьи. Даже при среднем COMET 83.3 слабые направления вроде Khmer или Myanmar заметно проседают. Модель на 4B параметров и обучение с несколькими речевыми кодировщиками также не выглядят дешевым вариантом для встраиваемого или потокового сценария.
Фишка из статьи. Самая полезная часть не средняя таблица, а абляция MoSE: она показывает, что специализация речевых кодировщиков действительно несет нагрузку, а не просто добавляет параметры.
| Вариант | Средний COMET на 6 трудных источниках | Как интерпретировать |
|---|---|---|
| MSRT-4B, 2 эксперта | 75.1 | Основная конфигурация |
| 3 эксперта | 75.3 | Почти то же качество, значит двух групп достаточно для текущих 45 языков |
| 1 эксперт | 70.0 | Потеря 5.1 COMET: общий кодировщик хуже выдерживает разноуровневые языки |
| Без LoRA | 73.1 | Легкая адаптация декодера дает еще около 2 COMET |
Как это читать: вклад MoSE особенно важен для низкоресурсных языков, где авторы отдельно показывают прирост COMET на 3.0 пункта; для средне- и высокоресурсных групп прирост меньше, 2.2 и 1.4, но он не исчезает.