Bengali Tokenizer Moonshine
Распознавание речи

Пересадка токенизатора для компактного распознавания Bengali

RTF 0.0053

Статья разбирает конкретный отказ компактной модели распознавания речи на Bengali: проблема не только в акустике, а в англоцентричном byte-level токенизаторе Moonshine. Он дробит слова Bengali на длинные цепочки, из-за чего авторегрессионный декодер копит ошибки и разваливается на выводе. Решение простое по идее и полезное для других письменностей: сначала адаптировать акустическую часть, затем заменить словарь декодера на BanglaBERT WordPiece и отдельно стабилизировать новые эмбеддинги.

Метод. Pipeline состоит из трех фаз. Сначала Moonshine-Base на 61.5M параметров дообучается на Bengali 21 эпоху, чтобы акустические представления подстроились под язык. Затем исходный словарь декодера заменяется на BUET BanglaBERT WordPiece, матрица эмбеддингов изменяется под новый размер, а специальные токены явно сопоставляются с BOS/EOS. После этого идет восстановительное обучение: 7 эпох с ScheduleFree AdamW и learning rate 2e-4 для быстрой привязки новых текстовых эмбеддингов к акустике, затем стабилизация при 2e-5. Обучение выполнено на RTX 4070 с 12.9 GB VRAM, оценка использует beam search ширины 4.

Результаты. Токенизаторная fertility падает с 9.16 до 1.30 токена на слово, то есть авторегрессионная последовательность сокращается на 85.8%. На 5% held-out части Lipi-Ghor, 5,931 utterances из 882-часового корпуса, модель получает WER 21.54% и CER 10.79%. Это близко к fine-tuned Faster Whisper Medium с 769M параметров, у которого WER 21.28% и CER 11.18%, и лучше fast-conformer baseline 24.67% / 15.56%. По скорости на скрытом 22-часовом тесте модель идет с RTF 0.0053, быстрее Whisper-Medium CTranslate2 на dual T4 с RTF 0.0190 и Conformer с RTF 0.0120.

Ограничения. Работа сфокусирована на одном языке и одном основном корпусе, поэтому универсальность рецепта для других письменностей пока является гипотезой. Базовая Moonshine с оригинальным токенизатором описана как фактически разваливающаяся, но детальная таблица WER до и после всех фаз ограничена. Валидация во время обучения использует случайную 64-сэмпловую подвыборку, что может быть шумным сигналом для ранней остановки. Кроме того, WER почти не превосходит крупный fine-tuned Faster Whisper Medium; главный выигрыш здесь в CER, размере и скорости.

Фишка из статьи. Сильная сторона статьи - количественная связь между токенизацией и скоростью/устойчивостью. Это не абстрактное "лучший словарь", а конкретное сокращение длины авторегрессионной цепочки, которое переводит модель из почти непригодного режима в рабочий.

МодельПараметрыWERCERRTF
Whisper large-v3 zero-shot1.55B84.5372.92-
Meta MMS 1B zero-shot1B43.0621.16-
Fast Conformer fine-tuned120M24.6715.560.0120
Faster Whisper Medium fine-tuned769M21.2811.180.0190
Moonshine-Base + Bengali tokenizer61.5M21.5410.790.0053

Как это читать: пересадка токенизатора почти не делает маленькую модель лучшей по WER, чем крупный Whisper, но дает сопоставимое качество при на порядок меньшем числе параметров и заметно лучшем времени вывода. Для edge-распознавания это более важный компромисс, чем абсолютное первое место по WER.

Оригинальная статья на arXiv