Синтез речи Continuous latents SVS
arXiv eess.AS

SemBridge: смысловые якоря для синтеза речи в непрерывных латентах

arXiv:2608.07462

SemBridge работает с важным компромиссом в синтезе речи: непрерывные скрытые представления сохраняют акустические детали лучше дискретных токенов, но хуже задают явную языковую структуру. Авторы добавляют смысловые токены только на этапе обучения, чтобы языковая модель училась видеть содержание речи, а на выводе оставляют полностью непрерывную генерацию. Это интересный вариант между кодековой дискретизацией и непрерывным авторегрессионным синтезом.

Метод. Система состоит из непрерывного авторегрессионного блока, замороженного Semantic-Aligned Acoustic VAE и обучающих смысловых голов. SA-VAE кодирует 44.1 кГц звук в 64-мерные непрерывные кадры с частотой 25 Гц, а замороженный смысловой токенизатор работает на 12.5 Гц со словарем 16 384. Смысловые метки напрямую надзирают за состояниями языковой модели через Anchor@k, но эти головы и проекция удаляются при выводе.

Результаты. На Seed-TTS-Eval SemBridge дает CER 0.95 для китайского, WER 1.81 для английского и CER 9.79 на китайском hard subset; на CV3-EVAL - CER 3.34, WER 4.22, CER 10.58 и WER 6.35 для English-hard. В контролируемой абляции без выравнивания и якорения ошибки составляют 1.58/2.43/16.87 для ZH/EN/ZH-Hard, а полный вариант снижает их до 1.01/1.87/11.87. В singing voice synthesis якорение снижает Mandarin CER с 9.18 до 8.32 и English WER с 16.29 до 14.77 при почти неизменном сходстве диктора.

Ограничения. Система обучается на больших корпусах: SA-VAE на 25 тыс. часов, основной SemBridge - на 100-120 тыс. часов, так что это не легкая лабораторная модель. Метрики качества в основном автоматические, а сравнение с внешними системами не полностью контролирует данные и обучение. Кроме того, слишком сильное смысловое якорение ухудшает качество и сходство голоса, то есть метод требует аккуратной настройки веса.

Фишка из статьи. Самая полезная абляция показывает, что смысловое якорение должно быть регуляризатором, а не главным источником потерь. При весе 0.1 содержание улучшается, но при 0.5 и 1.0 модель начинает хуже сохранять голос и качество.

Вариант Anchor@32ZH CEREN WERZH-Hard CERSIM для EN
Нет якоря1.512.3015.940.678
lambda=0.051.132.3213.860.683
lambda=0.11.011.8711.870.687
lambda=0.51.613.6416.250.623
lambda=1.01.645.1124.310.591

Как это читать: CER/WER измеряют сохранение текста, SIM - сходство диктора. Малый смысловой надзор помогает языковой структуре, но большой вес начинает вытеснять непрерывную акустическую цель, и модель теряет и содержание, и голос.

Оригинальная статья на arXiv