синтез речи малошаговая генерация согласование распределений
arXiv cs.SD

DriftTTS: малошаговый синтез речи без дистилляции через согласование распределений

arXiv:2610.03390

DriftTTS сокращает генерацию мел-спектрограммы до четырёх шагов без учителя-генератора, состязательного обучения и обычной дистилляции. Основной ход — учить не прямое восстановление цели, а направление изменения распределения в пространстве сырых мел-признаков и признаков замороженного MelMAE, причём модель обучается на собственных промежуточных состояниях.

Метод. Декодер выполняет развёртку фиксированной глубины K и на каждом шаге оценивает дрейф к распределению настоящих мел-спектрограмм. Составная функция потерь объединяет исходное пространство и представление MelMAE, предварительно обученного на том же наборе LJSpeech. Такой режим должен устранить несоответствие между чистыми обучающими целями и ошибочными промежуточными состояниями во время вывода.

Результаты. При NFE=4 DriftTTS достигает MCD 3,87 дБ, WER 3,7% и MOS 4,18±0,16; у Matcha-TTS при тех же четырёх шагах — 3,85 дБ, 3,4% и 3,96±0,18, а у настоящей речи MOS 4,22±0,17. Акустический декодер работает за 7,08 мс против 11,22 мс у Matcha-TTS на RTX PRO 6000, то есть в 1,58 раза быстрее. Слепая парная оценка включает 15 слушателей, 20 фраз и 300 оценок на систему.

Ограничения. Проверка проведена только на LJSpeech с одним англоязычным женским голосом, а MelMAE предварительно обучен на том же обучающем разбиении. Весь тракт всё ещё зависит от HiFi-GAN-вокодера. Нет данных о многих дикторах, других языках и устойчивости к длинным или стилистически сложным фразам вне этого корпуса.

Фишка из статьи. WER почти не замечает, зачем нужны дополнительные шаги: между одним и четырьмя шагами он меняется лишь с 3,6% до 3,7%, тогда как слушательская естественность вырастает на 1,18 балла. Абляция также показывает, что функция дрейфа важнее одного только пространства MelMAE.

КонфигурацияMCD, дБWERUTMOSMOS
DriftTTS, 1 шаг вывода4,893,6%3,163,00
DriftTTS, 4 шага вывода3,873,7%4,254,18
Matcha-TTS, 4 шага3,853,4%4,363,96
Drift: только сырые мел-признаки4,07———
Прямая L2-регрессия с MelMAE4,31———

Как это читать: разборчивость насыщается раньше естественности, поэтому WER здесь нельзя использовать как замену прослушиванию. Составная функция дрейфа уменьшает и среднюю, и худшую спектральную ошибку.

Оригинальная статья на arXiv