LS-MOPD: языковая дистилляция для многоязычного распознавания речи
Статья разбирает практическую проблему многоязычного распознавания речи на базе речевых LLM: языки с разной фонетикой и письменностью конфликтуют при совместной донастройке. Авторы не вводят отдельный дорогой роутер на выводе, а обучают специализированных учителей по языковым группам и затем дистиллируют их в одного студента. Главный вопрос - может ли студент стать лучше эмпирического "лучшего учителя" для каждого языка.
Метод. LS-MOPD сначала обучает language-specialized teachers через on-policy reinforcement learning: для китайского используется CER, для английского WER. Затем rollout студента маршрутизируется к top-K учителям соответствующей языковой категории, и их токеновые распределения агрегируются в дистилляционную цель. Авторы отдельно сравнивают static acoustic prefix, где учителя и студент разделяют замороженный encoder-adaptor, и dynamic prefix, где учителя сильнее, но их акустические представления хуже совпадают со студентом.
Результаты. В offline режиме static LS-MOPD с тремя учителями получает средний WER/CER 4.45 против 4.65 у generalist teacher и 4.59 у best-teacher oracle. В streaming режиме static вариант с тремя учителями дает 5.18 против 5.43 у generalist teacher и 5.37 у oracle. Dynamic prefix дает близкие значения, но не всегда лучше: offline variant с двумя учителями достигает 4.46, а streaming с тремя - 5.30. Важный вывод авторов: более сильный отдельный учитель не гарантирует лучшей дистилляции, если его акустический prefix плохо согласован со студентом.
Ограничения. Эксперименты завязаны на один backbone: speech encoder-adaptor и Qwen3-1.7B decoder. Языковая схема покрывает ограниченный набор категорий, включая китайский, диалекты, кантонский и английский; перенос на десятки языков и code-switching не доказан. Также статья почти не раскрывает задержку и стоимость полного цикла обучения учителей, хотя streaming-качество заявлено как практический мотив.
Фишка из статьи. Неочевидный результат - static prefix может быть полезнее dynamic, хотя dynamic-учителя сами по себе способны быть сильнее. Причина в согласовании акустических префиксов: студенту проще учиться у учителя, который видит похожее представление.
| Режим | Метод | Средний WER/CER | Комментарий |
|---|---|---|---|
| Offline static | RL generalist | 4.65 | один общий учитель |
| Offline static | Best-teacher oracle | 4.59 | лучший RL-учитель по категории |
| Offline static | LS-MOPD, 3 teachers | 4.45 | студент выше oracle |
| Streaming static | RL generalist | 5.43 | потоковый encoder |
| Streaming static | LS-MOPD, 3 teachers | 5.18 | лучший средний результат в таблице |
Как это читать: выигрыш не сводится к выбору одного лучшего учителя. Несколько слабее выглядящих учителей могут давать комплементарный сигнал, если их распределения токенов поданы студенту в согласованном акустическом пространстве.