SemBridge: смысловые якоря для синтеза речи в непрерывных латентах
SemBridge работает с важным компромиссом в синтезе речи: непрерывные скрытые представления сохраняют акустические детали лучше дискретных токенов, но хуже задают явную языковую структуру. Авторы добавляют смысловые токены только на этапе обучения, чтобы языковая модель училась видеть содержание речи, а на выводе оставляют полностью непрерывную генерацию. Это интересный вариант между кодековой дискретизацией и непрерывным авторегрессионным синтезом.
Метод. Система состоит из непрерывного авторегрессионного блока, замороженного Semantic-Aligned Acoustic VAE и обучающих смысловых голов. SA-VAE кодирует 44.1 кГц звук в 64-мерные непрерывные кадры с частотой 25 Гц, а замороженный смысловой токенизатор работает на 12.5 Гц со словарем 16 384. Смысловые метки напрямую надзирают за состояниями языковой модели через Anchor@k, но эти головы и проекция удаляются при выводе.
Результаты. На Seed-TTS-Eval SemBridge дает CER 0.95 для китайского, WER 1.81 для английского и CER 9.79 на китайском hard subset; на CV3-EVAL - CER 3.34, WER 4.22, CER 10.58 и WER 6.35 для English-hard. В контролируемой абляции без выравнивания и якорения ошибки составляют 1.58/2.43/16.87 для ZH/EN/ZH-Hard, а полный вариант снижает их до 1.01/1.87/11.87. В singing voice synthesis якорение снижает Mandarin CER с 9.18 до 8.32 и English WER с 16.29 до 14.77 при почти неизменном сходстве диктора.
Ограничения. Система обучается на больших корпусах: SA-VAE на 25 тыс. часов, основной SemBridge - на 100-120 тыс. часов, так что это не легкая лабораторная модель. Метрики качества в основном автоматические, а сравнение с внешними системами не полностью контролирует данные и обучение. Кроме того, слишком сильное смысловое якорение ухудшает качество и сходство голоса, то есть метод требует аккуратной настройки веса.
Фишка из статьи. Самая полезная абляция показывает, что смысловое якорение должно быть регуляризатором, а не главным источником потерь. При весе 0.1 содержание улучшается, но при 0.5 и 1.0 модель начинает хуже сохранять голос и качество.
| Вариант Anchor@32 | ZH CER | EN WER | ZH-Hard CER | SIM для EN |
|---|---|---|---|---|
| Нет якоря | 1.51 | 2.30 | 15.94 | 0.678 |
| lambda=0.05 | 1.13 | 2.32 | 13.86 | 0.683 |
| lambda=0.1 | 1.01 | 1.87 | 11.87 | 0.687 |
| lambda=0.5 | 1.61 | 3.64 | 16.25 | 0.623 |
| lambda=1.0 | 1.64 | 5.11 | 24.31 | 0.591 |
Как это читать: CER/WER измеряют сохранение текста, SIM - сходство диктора. Малый смысловой надзор помогает языковой структуре, но большой вес начинает вытеснять непрерывную акустическую цель, и модель теряет и содержание, и голос.