Распознавание речи Китайские диалекты Дистилляция
arXiv eess.AS

On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

arXiv:2608.11898

Адаптация распознавателя к диалектам часто улучшает редкие варианты речи ценой стандартного языка. Эта работа показывает более аккуратный финальный этап: ученик декодирует собственные префиксы, а замороженный учитель, видящий эталонную расшифровку, дает мягкие цели и не позволяет модели слишком далеко уйти от сильного мандаринского распознавания.

Метод. Qwen3-ASR-1.7B проходит три стадии. Сначала продолжается предобучение на примерно 100 тысячах часов мандаринской и диалектной речи, затем меняется доля выборки в пользу диалектов, а на финальных 5 тысячах сложных часов применяется on-policy self-distillation. В отличие от обычной перекрестной энтропии, ученик учится на состояниях, возникших после собственных ошибок, а учитель задает распределение следующего токена с эталонным текстом как привилегированным контекстом.

Результаты. От исходной Qwen3-ASR до полного конвейера средняя CER мандаринского снижается с 3,46% до 3,27%, пяти публичных диалектных тестов - с 15,37% до 12,79%, внутреннего набора - с 21,01% до 12,42%. Относительно контрольной точки после обычного дообучения OPSD улучшает все восемь мандаринских и все пять публичных диалектных тестов. Например, WenetSpeech-Wu снижается с 25,74% у исходной модели до 16,26%.

Ограничения. Работа охватывает только китайские диалекты, одну основу Qwen3-ASR и один опубликованный запуск. Около 34,1 тысячи часов и внутренний диалектный тест закрыты, поэтому весь результат не воспроизводится на открытых данных. Диалектная речь оценивается каноническими китайскими иероглифами, а не фонетической орфографией. OPSD не лучшая на каждом тесте: SpeechIO-1 имеет 0,86% против 0,71% после одного лишь продолженного предобучения.

Фишка из статьи. Сопоставление с обычным дополнительным дообучением использует те же 5 тысяч часов и тот же график. Поэтому ухудшение мандаринского нельзя объяснить данными или бюджетом - разница именно в функции потерь.

Финальный этапМандаринская CERДиалектная CERВнутренняя CERОбщая CER
Контрольная точка SFT3,40%13,16%13,30%10,72%
Еще один этап SFT4,43%12,89%12,95%10,74%
OPSD3,27%12,79%12,42%10,12%

Как это читать: обычное дообучение чуть помогает диалектам, но увеличивает мандаринскую CER более чем на один абсолютный пункт. OPSD одновременно улучшает обе стороны и дает более убедительный баланс, чем еще одна эпоха перекрестной энтропии.

Оригинальная статья на arXiv