ReGen: генерация представлений для быстрых waveform diffusion моделей
ReGen атакует проблему сжатых аудиопредставлений в генеративных моделях: если просто выравнивать внутренние слои diffusion Transformer с SSL- или mel-признаками, модель может потерять генеративную емкость. Авторы предлагают не только выравнивать, а совместно генерировать представления и саму волну, двигаясь от семантики к акустике внутри одной иерархической DiT-модели. Для синтеза речи это интересно тем, что ReGenVoice работает в латентном пространстве всего на 6.25 Hz и все равно показывает сильные WER, сходство голоса и RTF.
Метод. ReGen заменяет обычное representation alignment на representation generation: модель оценивает несколько векторных полей для SSL-представлений, mel-спектрограммы и waveform-данных. Иерархические подсказки подаются в разные уровни DiT, чтобы семантика и акустика не смешивались слишком рано. Дополнительно вводится generalized flow matching: к обычному притягивающему члену добавляется отталкивающий член в пространстве скоростей, чтобы разные стохастические траектории не схлопывались в один детерминированный поток. Эксперименты включают ReGenTokenizer на 25 Hz и 400 bps, ReGenVAE на 12.5 Hz с 32-мерным латентом и ReGenVoice как модель синтеза речи.
Результаты. На LibriSpeech-реконструкции ReGenVAE-LibriTTS дает WER 2.05, STOI 0.94, PESQ-WB 2.90, speaker similarity 0.84 и UTMOS 4.21; версия на Emilia имеет WER 2.11, STOI 0.95, PESQ-WB 2.99 и speaker similarity 0.89. В zero-shot синтезе на Seed-en ReGenVoice 0.5B с 0.5k часов обучения получает WER 1.46 и SIM 0.64, а версия на 40k часов - WER 1.62 и SIM 0.70. По субъективной оценке ReGenVoice при 25 NFE дает MOS 4.029, SMOS 3.762 и RTF 0.08, то есть работает заметно быстрее реального времени.
Ограничения. Метод сложный и вычислительно дорогой: кодековые модели обучаются на восьми H100, а ReGenVoice - на четырех H100, по 1M шагов. Для хорошего качества и быстрой выборки используется adversarial post-training; без него часть результатов заметно хуже. Основные проверки проведены на английских наборах LibriSpeech, LibriTTS и Seed-en, поэтому перенос на другие языки и разговорные домены пока не доказан. Кроме того, высокая похожесть синтетической речи на голос говорящего поднимает обычные риски злоупотреблений.
Фишка из статьи. Таблица по числу шагов выборки показывает реальный компромисс скорость/качество. Уже 8 шагов дают приемлемую разборчивость, а после 25 шагов WER почти не улучшается, поэтому авторы выбирают 25 NFE как рабочую точку.
| NFE | WER | SIM | UTMOS |
|---|---|---|---|
| 4 | 4.20 | 0.67 | 3.05 |
| 8 | 1.93 | 0.69 | 3.67 |
| 10 | 1.85 | 0.70 | 3.74 |
| 16 | 1.77 | 0.70 | 3.79 |
| 25 | 1.62 | 0.70 | 3.81 |
| 32 | 1.67 | 0.70 | 3.82 |
Как это читать: после 25 шагов качество выходит на плато, а 32 шага уже не дают явного выигрыша по WER. Для продакшена важнее не максимум UTMOS, а точка, где латентная diffusion-модель сохраняет разборчивость и сходство голоса при малой задержке.