Компактный Hindi-синтез речи через ступенчатое сжатие teacher-модели
Статья полезна как инженерный рецепт для компактного синтеза речи на языке с ограниченным объемом данных. Авторы не пытаются обучить маленькую flow-matching модель с нуля на 17.6 часа Hindi-аудио, потому что это ломается, а постепенно вырезают глубину из большого учителя IndicF5. Главный результат не в рекордном MOS, а в понятной лестнице сжатия и явном capacity cliff.
Метод. Учитель IndicF5 имеет 337M параметров и 22 transformer-блока. Студент сохраняет ширину, размер текстовых признаков, число attention heads и входы/выходы mel/text, поэтому почти все не-блочные тензоры копируются один к одному. Дальше глубина уменьшается ступенями 22 -> 16 -> 12 -> 8 -> 6, после каждой ступени модель заново дообучается на teacher-generated корпусе и проходит gate по WER, измеренному внешним Hindi-распознавателем.
Результаты. В ступенчатой проверке 249M и 190M студенты дают WER 0.00 на свежем unseen-предложении, 131M остается рабочим с WER 0.06-0.12, а 102M уходит в cliff: 0.41-0.59 WER на длинной фразе даже после 150 эпох. На независимом FLEURS-бенчмарке из 50 unseen Hindi-предложений 190M студент имеет WER 0.170, CER 0.077, speaker similarity 0.750, UTMOS 3.65 и RTF 3.13 на Apple M4. Учитель лучше по разборчивости и похожести голоса (WER 0.098, SIM 0.784, UTMOS 3.79), но медленнее: RTF 5.56. MMS-TTS-hin быстрее (RTF 0.31), но не клонирует голос и имеет SIM 0.278.
Ограничения. Качество оценивается автоматическим распознавателем и UTMOS, без полноценного прослушивания людьми. Независимый тест всего 50 предложений на Hindi, обучающие данные синтетически сгенерированы учителем, а выводы о real-time завязаны на конкретное железо и реализацию. 190M модель еще заметно уступает учителю по WER на более длинных FLEURS-фразах.
Фишка из статьи. Лестница глубины показывает, где именно начинается разрушение, и это полезнее общей фразы «модель стала компактнее». 102M вариант выглядит заманчиво по размеру, но по длинным фразам уже не выдерживает.
| Глубина | Параметры | Fresh-sentence WER | Known-sentence WER | Вывод |
|---|---|---|---|---|
| 16 | 249M | 0.00 | 0.18 | лучшее качество среди студентов |
| 12 | 190M | 0.00-0.06 | 0.24-0.29 | рекомендуемый компактный вариант |
| 8 | 131M | 0.06-0.12 | 0.24-0.35 | минимальный устойчивый размер |
| 6 | 102M | 0.41-0.59 на длинной фразе | 0.29-0.41 | capacity cliff |
Как это читать: постепенное сжатие работает до 131M, но дальнейшее уменьшение глубины уже не лечится дополнительными эпохами. Для deployment лучше выбрать 190M или 131M, а не механически гнаться за 102M.