Waveform diffusion Аудиокодек Синтез речи
Генерация речи

ReGen: генерация представлений для быстрых waveform diffusion моделей

RTF 0.08

ReGen атакует проблему сжатых аудиопредставлений в генеративных моделях: если просто выравнивать внутренние слои diffusion Transformer с SSL- или mel-признаками, модель может потерять генеративную емкость. Авторы предлагают не только выравнивать, а совместно генерировать представления и саму волну, двигаясь от семантики к акустике внутри одной иерархической DiT-модели. Для синтеза речи это интересно тем, что ReGenVoice работает в латентном пространстве всего на 6.25 Hz и все равно показывает сильные WER, сходство голоса и RTF.

Метод. ReGen заменяет обычное representation alignment на representation generation: модель оценивает несколько векторных полей для SSL-представлений, mel-спектрограммы и waveform-данных. Иерархические подсказки подаются в разные уровни DiT, чтобы семантика и акустика не смешивались слишком рано. Дополнительно вводится generalized flow matching: к обычному притягивающему члену добавляется отталкивающий член в пространстве скоростей, чтобы разные стохастические траектории не схлопывались в один детерминированный поток. Эксперименты включают ReGenTokenizer на 25 Hz и 400 bps, ReGenVAE на 12.5 Hz с 32-мерным латентом и ReGenVoice как модель синтеза речи.

Результаты. На LibriSpeech-реконструкции ReGenVAE-LibriTTS дает WER 2.05, STOI 0.94, PESQ-WB 2.90, speaker similarity 0.84 и UTMOS 4.21; версия на Emilia имеет WER 2.11, STOI 0.95, PESQ-WB 2.99 и speaker similarity 0.89. В zero-shot синтезе на Seed-en ReGenVoice 0.5B с 0.5k часов обучения получает WER 1.46 и SIM 0.64, а версия на 40k часов - WER 1.62 и SIM 0.70. По субъективной оценке ReGenVoice при 25 NFE дает MOS 4.029, SMOS 3.762 и RTF 0.08, то есть работает заметно быстрее реального времени.

Ограничения. Метод сложный и вычислительно дорогой: кодековые модели обучаются на восьми H100, а ReGenVoice - на четырех H100, по 1M шагов. Для хорошего качества и быстрой выборки используется adversarial post-training; без него часть результатов заметно хуже. Основные проверки проведены на английских наборах LibriSpeech, LibriTTS и Seed-en, поэтому перенос на другие языки и разговорные домены пока не доказан. Кроме того, высокая похожесть синтетической речи на голос говорящего поднимает обычные риски злоупотреблений.

Фишка из статьи. Таблица по числу шагов выборки показывает реальный компромисс скорость/качество. Уже 8 шагов дают приемлемую разборчивость, а после 25 шагов WER почти не улучшается, поэтому авторы выбирают 25 NFE как рабочую точку.

NFEWERSIMUTMOS
44.200.673.05
81.930.693.67
101.850.703.74
161.770.703.79
251.620.703.81
321.670.703.82

Как это читать: после 25 шагов качество выходит на плато, а 32 шага уже не дают явного выигрыша по WER. Для продакшена важнее не максимум UTMOS, а точка, где латентная diffusion-модель сохраняет разборчивость и сходство голоса при малой задержке.

Оригинальная статья на arXiv