DAIEN-TTS: zero-shot синтез речи с шумом и реверберацией
Эта статья важна для синтеза речи вне чистых демонстрационных условий: авторы хотят клонировать голос одного человека, но перенести на него акустическую среду другого фрагмента. Обычные zero-shot системы либо требуют чистый голосовой пример, либо смешивают голос и окружение так, что ими нельзя управлять раздельно. DAIEN-TTS делает среду отдельным условием: речь, фоновый шум и реверберация разложены и подаются в генератор как разные управляющие компоненты.
Метод. Система построена поверх F5-TTS с flow-matching Diffusion Transformer. Модуль speech-environment separation извлекает из environmental prompt три части: речевой компонент, шум и реверберацию. Во время обучения чистая речь смешивается с шумами AudioSet/FreeSound и импульсными характеристиками помещений из DNS Challenge RIR; дополнительно используется cross-speaker conditioning, чтобы ветка окружения не протекала в идентичность говорящего. На выводе triple classifier-free guidance отдельно регулирует речь, шум и реверберацию, а SNR adaptation подгоняет уровень шума под environment prompt.
Результаты. На симулированных noisy-reverberant prompt DAIEN-TTS-NR получает CLAP similarity 0.770 и FAD 2.11 против 0.685 и 8.56 у F5-TTS, а субъективные MOS/SSMOS/ESMOS равны 3.38/3.53/3.55. При этом WER выше, чем у F5-TTS, но авторы отдельно показывают, что сам ground truth в шуме и реверберации уже имеет WER 15.41%, так что WER здесь нельзя читать как чистую меру качества синтеза. На реальных prompt после дообучения DAIEN-TTS-FT достигает SECS 0.486, CLAP 0.634, FAD 3.62 и ESMOS 3.62.
Ограничения. Реальная часть эксперимента зависит от TITW-подобных записей, где фон чаще определяется шумом, а не реверберацией; поэтому добавление явной реверберационной ветки не всегда дает выигрыш без дообучения. Разделение среды само по себе может ошибаться, а качество транскрипций реальных speaker prompt получено через распознавание речи и вносит шум в WER. Задержка и вычислительная стоимость не являются центральной частью оценки.
Фишка из статьи. Хорошая инженерная деталь - sweep управляющих коэффициентов TCFG. Он показывает, что шум и реверберация действительно регулируются независимо, но слишком агрессивная среда быстро ломает разборчивость.
| TCFG | Что меняют | WER | SECS | CLAP | FAD |
|---|---|---|---|---|---|
| 1:0:6 | без noise guidance | 8.32% | 0.387 | 0.751 | 2.36 |
| 1:3:6 | основной режим | 13.05% | 0.361 | 0.770 | 2.11 |
| 1:9:6 | слишком сильный шум | 63.83% | 0.209 | 0.674 | 4.43 |
| 1:3:0 | без reverb guidance | 5.87% | 0.403 | 0.722 | 10.38 |
| 1:3:9 | сильная реверберация | 25.64% | 0.334 | 0.769 | 1.48 |
Как это читать: FAD резко улучшается при усилении реверберации, но WER растет. Для приложений вроде генерации данных для робастного распознавания можно выбрать более грязный звук; для ассистента или озвучки нужен более мягкий режим.