Синтез речи Реверберация Шум
Синтез речи в среде

DAIEN-TTS: zero-shot синтез речи с шумом и реверберацией

ESMOS 3.62

Эта статья важна для синтеза речи вне чистых демонстрационных условий: авторы хотят клонировать голос одного человека, но перенести на него акустическую среду другого фрагмента. Обычные zero-shot системы либо требуют чистый голосовой пример, либо смешивают голос и окружение так, что ими нельзя управлять раздельно. DAIEN-TTS делает среду отдельным условием: речь, фоновый шум и реверберация разложены и подаются в генератор как разные управляющие компоненты.

Метод. Система построена поверх F5-TTS с flow-matching Diffusion Transformer. Модуль speech-environment separation извлекает из environmental prompt три части: речевой компонент, шум и реверберацию. Во время обучения чистая речь смешивается с шумами AudioSet/FreeSound и импульсными характеристиками помещений из DNS Challenge RIR; дополнительно используется cross-speaker conditioning, чтобы ветка окружения не протекала в идентичность говорящего. На выводе triple classifier-free guidance отдельно регулирует речь, шум и реверберацию, а SNR adaptation подгоняет уровень шума под environment prompt.

Результаты. На симулированных noisy-reverberant prompt DAIEN-TTS-NR получает CLAP similarity 0.770 и FAD 2.11 против 0.685 и 8.56 у F5-TTS, а субъективные MOS/SSMOS/ESMOS равны 3.38/3.53/3.55. При этом WER выше, чем у F5-TTS, но авторы отдельно показывают, что сам ground truth в шуме и реверберации уже имеет WER 15.41%, так что WER здесь нельзя читать как чистую меру качества синтеза. На реальных prompt после дообучения DAIEN-TTS-FT достигает SECS 0.486, CLAP 0.634, FAD 3.62 и ESMOS 3.62.

Ограничения. Реальная часть эксперимента зависит от TITW-подобных записей, где фон чаще определяется шумом, а не реверберацией; поэтому добавление явной реверберационной ветки не всегда дает выигрыш без дообучения. Разделение среды само по себе может ошибаться, а качество транскрипций реальных speaker prompt получено через распознавание речи и вносит шум в WER. Задержка и вычислительная стоимость не являются центральной частью оценки.

Фишка из статьи. Хорошая инженерная деталь - sweep управляющих коэффициентов TCFG. Он показывает, что шум и реверберация действительно регулируются независимо, но слишком агрессивная среда быстро ломает разборчивость.

TCFGЧто меняютWERSECSCLAPFAD
1:0:6без noise guidance8.32%0.3870.7512.36
1:3:6основной режим13.05%0.3610.7702.11
1:9:6слишком сильный шум63.83%0.2090.6744.43
1:3:0без reverb guidance5.87%0.4030.72210.38
1:3:9сильная реверберация25.64%0.3340.7691.48

Как это читать: FAD резко улучшается при усилении реверберации, но WER растет. Для приложений вроде генерации данных для робастного распознавания можно выбрать более грязный звук; для ассистента или озвучки нужен более мягкий режим.

Оригинальная статья на arXiv