MEUSLI: открытый мультиязычный мост между Whisper и LLM
MEUSLI решает практическую задачу: как соединить сильный речевой кодировщик с открытой языковой моделью так, чтобы получить распознавание речи не только для английского. Авторы обучают легкий мультиязычный проектор между Whisper-large-v3-turbo и несколькими открытыми европейскими LLM, сохраняя кодировщик и языковую модель замороженными. Работа интересна тем, что она не строит закрытую end-to-end систему, а показывает, сколько можно получить из относительно малого обучаемого слоя и аккуратного мультиязычного набора.
Архитектура проста: входной звук переводится в mel-спектрограмму со 128 частотными корзинами, frozen Whisper-large-v3-turbo выдает речевые признаки, они прореживаются по времени с коэффициентом k=5 и проходят через линейный проектор с одним скрытым слоем ReLU. У проектора 17.31 млн обучаемых параметров; дополнительно к LLM применяют LoRA rank 8, alpha 32, что добавляет 1.38 млн параметров. Обучение идет на Common Voice 17.0, FLEURS и VoxPopuli: всего 7622 часа по 28 европейским языкам, с ограничением 100 тыс. аудиофайлов на язык и датасет.
На высокоресурсных языках система часто приближается к Whisper, а на низкоресурсных языках заметна польза языковой модели. Например, на Common Voice для Basque WER у Whisper 42.74%, а у связки с Apertus-8B 12.14%; для Serbian - 99.34% против 35.29%; для Breton - 154.33% против 73.40%. В отдельном эксперименте добавления новых языков pretrained MEUSLI после дообучения дает 16.3% WER для украинского при 30 часах данных против 20.4% у монолингвального проектора, а для албанского при 46 минутах данных хотя бы сходится до 75.6% WER, тогда как проектор с нуля уходит в 389% WER.
Главное ограничение - область действия. Это в основном европейские языки и открытые корпуса, а часть downstream-экспериментов использует SIB-Fleurs, который пересекается с FLEURS-предобучением. Низкоресурсные языки все еще имеют высокие ошибки, а наивное дообучение на новый язык вызывает катастрофическое забывание. Поэтому MEUSLI лучше рассматривать как открытую основу для дальнейшей адаптации, а не как уже равномерно сильный распознаватель для всех языков.
Фишка из статьи. Самая показательная таблица - не средний WER по 28 языкам, а отрицательный результат с забыванием при добавлении украинского и его почти полное исправление через replay.
| Язык | Base MEUSLI | Naive MEUSLI -> UK | + replay |
|---|---|---|---|
| Spanish | 4.09 | 90.34 | 4.82 |
| Polish | 8.68 | 100.6 | 10.95 |
| Czech | 11.32 | 108.0 | 15.21 |
| Ukrainian | - | 16.34 | 17.56 |
| Average | 8.01 | 54.22 | 10.65 |
Как это читать: мультиязычный проектор действительно быстро учит новый язык, но без буфера старых языков ломает уже выученное пространство. Replay по 1000 примеров на язык почти возвращает старые WER и сохраняет украинский около 17.6%, то есть ключевая инженерная проблема здесь - не только качество распознавания, но и управляемое расширение языкового набора.