Распознавание речи LLM Low-resource
Мультиязычное распознавание

MEUSLI: открытый мультиязычный мост между Whisper и LLM

28 languages

MEUSLI решает практическую задачу: как соединить сильный речевой кодировщик с открытой языковой моделью так, чтобы получить распознавание речи не только для английского. Авторы обучают легкий мультиязычный проектор между Whisper-large-v3-turbo и несколькими открытыми европейскими LLM, сохраняя кодировщик и языковую модель замороженными. Работа интересна тем, что она не строит закрытую end-to-end систему, а показывает, сколько можно получить из относительно малого обучаемого слоя и аккуратного мультиязычного набора.

Архитектура проста: входной звук переводится в mel-спектрограмму со 128 частотными корзинами, frozen Whisper-large-v3-turbo выдает речевые признаки, они прореживаются по времени с коэффициентом k=5 и проходят через линейный проектор с одним скрытым слоем ReLU. У проектора 17.31 млн обучаемых параметров; дополнительно к LLM применяют LoRA rank 8, alpha 32, что добавляет 1.38 млн параметров. Обучение идет на Common Voice 17.0, FLEURS и VoxPopuli: всего 7622 часа по 28 европейским языкам, с ограничением 100 тыс. аудиофайлов на язык и датасет.

На высокоресурсных языках система часто приближается к Whisper, а на низкоресурсных языках заметна польза языковой модели. Например, на Common Voice для Basque WER у Whisper 42.74%, а у связки с Apertus-8B 12.14%; для Serbian - 99.34% против 35.29%; для Breton - 154.33% против 73.40%. В отдельном эксперименте добавления новых языков pretrained MEUSLI после дообучения дает 16.3% WER для украинского при 30 часах данных против 20.4% у монолингвального проектора, а для албанского при 46 минутах данных хотя бы сходится до 75.6% WER, тогда как проектор с нуля уходит в 389% WER.

Главное ограничение - область действия. Это в основном европейские языки и открытые корпуса, а часть downstream-экспериментов использует SIB-Fleurs, который пересекается с FLEURS-предобучением. Низкоресурсные языки все еще имеют высокие ошибки, а наивное дообучение на новый язык вызывает катастрофическое забывание. Поэтому MEUSLI лучше рассматривать как открытую основу для дальнейшей адаптации, а не как уже равномерно сильный распознаватель для всех языков.

Фишка из статьи. Самая показательная таблица - не средний WER по 28 языкам, а отрицательный результат с забыванием при добавлении украинского и его почти полное исправление через replay.

ЯзыкBase MEUSLINaive MEUSLI -> UK+ replay
Spanish4.0990.344.82
Polish8.68100.610.95
Czech11.32108.015.21
Ukrainian-16.3417.56
Average8.0154.2210.65

Как это читать: мультиязычный проектор действительно быстро учит новый язык, но без буфера старых языков ломает уже выученное пространство. Replay по 1000 примеров на язык почти возвращает старые WER и сохраняет украинский около 17.6%, то есть ключевая инженерная проблема здесь - не только качество распознавания, но и управляемое расширение языкового набора.

Оригинальная статья на arXiv