Синтез речи Multi-speaker Audio generation
Генерация речи и аудио

SwanTale: единая генерация многоголосой речи и аудиосцен

Scene MOS 4.22

SwanTale - большой технический отчет про генерацию речи и аудиосцен для сценариев вроде дубляжа, аудиодрам и коротких видео. Интересно, что авторы не ограничиваются zero-shot voice cloning: они поддерживают instruct режим, где голос, окружение, стиль и содержание задаются подробной текстовой инструкцией, а также reuse созданных голосов. Центральный компонент - SwanVAE, 25-Гц continuous acoustic representation для речи, singing voice, general audio и music.

Метод. SwanVAE кодирует 48 кГц аудио в 96-мерные continuous latents на 25 Hz, номинально 38.40 kbps при 16-bit convention. Для обучения используются waveform objectives и weak alignment objectives, чтобы latent mean был удобен для последующей diffusion generation. Сверху SwanTale строит unified backbone с routing/MoE, caption encoder, reward-conditioned quality control и GRPO. Данные фильтруются через ASR-based pronunciation checks, DNSMOS/quality эвристики и SwanVerifier для speaker attributes.

Результаты. На реконструкции речи SwanVAE дает PESQ 4.1683 и MCD 0.9638, лучше DAC 4.1178/1.1963 и VoxCPM2 AudioVAE V2 3.9987/1.2222; STOI 0.9680 почти на уровне лучших baseline. В zero-shot monologue SwanTale получает Timbre 0.95, Reverb 1.83, Sound Fidelity 3.95, Content Error 0.086, Richness 3.90 и Hierarchy 3.70; по content error и sound fidelity его обгоняют некоторые TTS baseline, но выразительность выше. В SwanBench-Scene overall Mean MOS равен 4.22 против 4.09 у Qwen3-TTS-12Hz-1.7B-VD и 3.86 у Seedance 2.0.

Ограничения. Это система с большим объемом собственной инфраструктуры, датасетов и фильтров; воспроизвести training recipe сложно. В monologue content error 0.086 хуже FishSpeech 0.066 и GLM-TTS 0.074, а в dialogue хуже SoulX-Podcast 0.101 против 0.120. InstructTTSEval показывает слабость RP: SwanTale получает 64.1 в Chinese RP и 63.6 в English RP, уступая MOSS-VoiceGenerator и VoxCPM2 по части role-play. Оценка SwanBench-Caption использует gemini-3.5-flash как судью, что добавляет зависимость от внешнего LLM evaluator.

Фишка из статьи. Самый показательный блок - SwanBench-Caption ablation: MoE и размер caption encoder влияют не только на instruction accuracy, но и на акустическое качество. То есть для генерации аудиосцен текстовый caption encoder оказывается частью акустической стабильности, а не просто "пониманием prompt".

Настройка SwanBench-CaptionInstruction AccuracyAcoustic QualityOverall Expressiveness
SwanTale без MoE3.024.093.56
SwanTale3.394.313.82
SwanTale с 32B caption encoder3.704.343.98

Как это читать: переход от без-MoE к базовой SwanTale дает +0.37 по instruction accuracy и +0.22 по acoustic quality; увеличение caption encoder до 32B добавляет еще +0.31 по instruction accuracy. Для сложного аудиоинструкта слабое место может быть не vocoder, а текстово-сценовая маршрутизация.

Оригинальная статья на arXiv