SwanTale: единая генерация многоголосой речи и аудиосцен
SwanTale - большой технический отчет про генерацию речи и аудиосцен для сценариев вроде дубляжа, аудиодрам и коротких видео. Интересно, что авторы не ограничиваются zero-shot voice cloning: они поддерживают instruct режим, где голос, окружение, стиль и содержание задаются подробной текстовой инструкцией, а также reuse созданных голосов. Центральный компонент - SwanVAE, 25-Гц continuous acoustic representation для речи, singing voice, general audio и music.
Метод. SwanVAE кодирует 48 кГц аудио в 96-мерные continuous latents на 25 Hz, номинально 38.40 kbps при 16-bit convention. Для обучения используются waveform objectives и weak alignment objectives, чтобы latent mean был удобен для последующей diffusion generation. Сверху SwanTale строит unified backbone с routing/MoE, caption encoder, reward-conditioned quality control и GRPO. Данные фильтруются через ASR-based pronunciation checks, DNSMOS/quality эвристики и SwanVerifier для speaker attributes.
Результаты. На реконструкции речи SwanVAE дает PESQ 4.1683 и MCD 0.9638, лучше DAC 4.1178/1.1963 и VoxCPM2 AudioVAE V2 3.9987/1.2222; STOI 0.9680 почти на уровне лучших baseline. В zero-shot monologue SwanTale получает Timbre 0.95, Reverb 1.83, Sound Fidelity 3.95, Content Error 0.086, Richness 3.90 и Hierarchy 3.70; по content error и sound fidelity его обгоняют некоторые TTS baseline, но выразительность выше. В SwanBench-Scene overall Mean MOS равен 4.22 против 4.09 у Qwen3-TTS-12Hz-1.7B-VD и 3.86 у Seedance 2.0.
Ограничения. Это система с большим объемом собственной инфраструктуры, датасетов и фильтров; воспроизвести training recipe сложно. В monologue content error 0.086 хуже FishSpeech 0.066 и GLM-TTS 0.074, а в dialogue хуже SoulX-Podcast 0.101 против 0.120. InstructTTSEval показывает слабость RP: SwanTale получает 64.1 в Chinese RP и 63.6 в English RP, уступая MOSS-VoiceGenerator и VoxCPM2 по части role-play. Оценка SwanBench-Caption использует gemini-3.5-flash как судью, что добавляет зависимость от внешнего LLM evaluator.
Фишка из статьи. Самый показательный блок - SwanBench-Caption ablation: MoE и размер caption encoder влияют не только на instruction accuracy, но и на акустическое качество. То есть для генерации аудиосцен текстовый caption encoder оказывается частью акустической стабильности, а не просто "пониманием prompt".
| Настройка SwanBench-Caption | Instruction Accuracy | Acoustic Quality | Overall Expressiveness |
|---|---|---|---|
| SwanTale без MoE | 3.02 | 4.09 | 3.56 |
| SwanTale | 3.39 | 4.31 | 3.82 |
| SwanTale с 32B caption encoder | 3.70 | 4.34 | 3.98 |
Как это читать: переход от без-MoE к базовой SwanTale дает +0.37 по instruction accuracy и +0.22 по acoustic quality; увеличение caption encoder до 32B добавляет еще +0.31 по instruction accuracy. Для сложного аудиоинструкта слабое место может быть не vocoder, а текстово-сценовая маршрутизация.