On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin
Адаптация распознавателя к диалектам часто улучшает редкие варианты речи ценой стандартного языка. Эта работа показывает более аккуратный финальный этап: ученик декодирует собственные префиксы, а замороженный учитель, видящий эталонную расшифровку, дает мягкие цели и не позволяет модели слишком далеко уйти от сильного мандаринского распознавания.
Метод. Qwen3-ASR-1.7B проходит три стадии. Сначала продолжается предобучение на примерно 100 тысячах часов мандаринской и диалектной речи, затем меняется доля выборки в пользу диалектов, а на финальных 5 тысячах сложных часов применяется on-policy self-distillation. В отличие от обычной перекрестной энтропии, ученик учится на состояниях, возникших после собственных ошибок, а учитель задает распределение следующего токена с эталонным текстом как привилегированным контекстом.
Результаты. От исходной Qwen3-ASR до полного конвейера средняя CER мандаринского снижается с 3,46% до 3,27%, пяти публичных диалектных тестов - с 15,37% до 12,79%, внутреннего набора - с 21,01% до 12,42%. Относительно контрольной точки после обычного дообучения OPSD улучшает все восемь мандаринских и все пять публичных диалектных тестов. Например, WenetSpeech-Wu снижается с 25,74% у исходной модели до 16,26%.
Ограничения. Работа охватывает только китайские диалекты, одну основу Qwen3-ASR и один опубликованный запуск. Около 34,1 тысячи часов и внутренний диалектный тест закрыты, поэтому весь результат не воспроизводится на открытых данных. Диалектная речь оценивается каноническими китайскими иероглифами, а не фонетической орфографией. OPSD не лучшая на каждом тесте: SpeechIO-1 имеет 0,86% против 0,71% после одного лишь продолженного предобучения.
Фишка из статьи. Сопоставление с обычным дополнительным дообучением использует те же 5 тысяч часов и тот же график. Поэтому ухудшение мандаринского нельзя объяснить данными или бюджетом - разница именно в функции потерь.
| Финальный этап | Мандаринская CER | Диалектная CER | Внутренняя CER | Общая CER |
|---|---|---|---|---|
| Контрольная точка SFT | 3,40% | 13,16% | 13,30% | 10,72% |
| Еще один этап SFT | 4,43% | 12,89% | 12,95% | 10,74% |
| OPSD | 3,27% | 12,79% | 12,42% | 10,12% |
Как это читать: обычное дообучение чуть помогает диалектам, но увеличивает мандаринскую CER более чем на один абсолютный пункт. OPSD одновременно улучшает обе стороны и дает более убедительный баланс, чем еще одна эпоха перекрестной энтропии.