Пересадка токенизатора для компактного распознавания Bengali
Статья разбирает конкретный отказ компактной модели распознавания речи на Bengali: проблема не только в акустике, а в англоцентричном byte-level токенизаторе Moonshine. Он дробит слова Bengali на длинные цепочки, из-за чего авторегрессионный декодер копит ошибки и разваливается на выводе. Решение простое по идее и полезное для других письменностей: сначала адаптировать акустическую часть, затем заменить словарь декодера на BanglaBERT WordPiece и отдельно стабилизировать новые эмбеддинги.
Метод. Pipeline состоит из трех фаз. Сначала Moonshine-Base на 61.5M параметров дообучается на Bengali 21 эпоху, чтобы акустические представления подстроились под язык. Затем исходный словарь декодера заменяется на BUET BanglaBERT WordPiece, матрица эмбеддингов изменяется под новый размер, а специальные токены явно сопоставляются с BOS/EOS. После этого идет восстановительное обучение: 7 эпох с ScheduleFree AdamW и learning rate 2e-4 для быстрой привязки новых текстовых эмбеддингов к акустике, затем стабилизация при 2e-5. Обучение выполнено на RTX 4070 с 12.9 GB VRAM, оценка использует beam search ширины 4.
Результаты. Токенизаторная fertility падает с 9.16 до 1.30 токена на слово, то есть авторегрессионная последовательность сокращается на 85.8%. На 5% held-out части Lipi-Ghor, 5,931 utterances из 882-часового корпуса, модель получает WER 21.54% и CER 10.79%. Это близко к fine-tuned Faster Whisper Medium с 769M параметров, у которого WER 21.28% и CER 11.18%, и лучше fast-conformer baseline 24.67% / 15.56%. По скорости на скрытом 22-часовом тесте модель идет с RTF 0.0053, быстрее Whisper-Medium CTranslate2 на dual T4 с RTF 0.0190 и Conformer с RTF 0.0120.
Ограничения. Работа сфокусирована на одном языке и одном основном корпусе, поэтому универсальность рецепта для других письменностей пока является гипотезой. Базовая Moonshine с оригинальным токенизатором описана как фактически разваливающаяся, но детальная таблица WER до и после всех фаз ограничена. Валидация во время обучения использует случайную 64-сэмпловую подвыборку, что может быть шумным сигналом для ранней остановки. Кроме того, WER почти не превосходит крупный fine-tuned Faster Whisper Medium; главный выигрыш здесь в CER, размере и скорости.
Фишка из статьи. Сильная сторона статьи - количественная связь между токенизацией и скоростью/устойчивостью. Это не абстрактное "лучший словарь", а конкретное сокращение длины авторегрессионной цепочки, которое переводит модель из почти непригодного режима в рабочий.
| Модель | Параметры | WER | CER | RTF |
|---|---|---|---|---|
| Whisper large-v3 zero-shot | 1.55B | 84.53 | 72.92 | - |
| Meta MMS 1B zero-shot | 1B | 43.06 | 21.16 | - |
| Fast Conformer fine-tuned | 120M | 24.67 | 15.56 | 0.0120 |
| Faster Whisper Medium fine-tuned | 769M | 21.28 | 11.18 | 0.0190 |
| Moonshine-Base + Bengali tokenizer | 61.5M | 21.54 | 10.79 | 0.0053 |
Как это читать: пересадка токенизатора почти не делает маленькую модель лучшей по WER, чем крупный Whisper, но дает сопоставимое качество при на порядок меньшем числе параметров и заметно лучшем времени вывода. Для edge-распознавания это более важный компромисс, чем абсолютное первое место по WER.