SIEDD: дискретная диффузия для восстановления и редактирования речи
SIEDD решает задачу локального восстановления и редактирования речи: нужно заменить или дорисовать фрагмент, не пересинтезируя всю фразу и не теряя диктора, темп, фон и акустический контекст. Главный ход статьи - использовать дискретную диффузию поверх иерархических кодековых токенов, а не авторегрессионную генерацию слева направо. Это хорошо подходит для редактирования, где модель должна одновременно учитывать контекст до и после исправляемого участка.
Метод. Архитектура HiCoDD учитывает порядок RVQ-кодбуков: нижние кодбуки считаются уже зафиксированным грубым акустическим контекстом, а диффузия применяется к текущему уточняющему кодбуку. Модель получает фонемное представление целевого текста, чистые токены вне редактируемого окна и сгенерированные нижние кодбуки внутри окна. Для вставок и замен отдельный предсказатель длительности оценивает, сколько EnCodec-кадров нужно выделить новому текстовому фрагменту.
Результаты. На RealEdit в задаче речевого редактирования SIEDD получает WER 0.121, сходство диктора 0.98, MCD 270.0 и UTMOS 3.44. VoiceCraft дает WER 0.124, SIM 0.97 и MCD 392.25, SSR-Speech - WER 0.146, SIM 0.97 и MCD 308.3. В восстановлении пропусков эффект особенно заметен на коротких масках: для одного пропуска 250 мс MCD снижается до 21.1 против 91.3 у SSR-Speech и 191.5 у VoiceCraft. Обучение основного варианта заняло 550 000 шагов на двух RTX A6000 примерно за неделю.
Ограничения. Работа проверяется на RealEdit и связанных с ним сценариях, поэтому перенос на телефонный звук, шумные встречи и многоязычные правки нужно отдельно проверять. UTMOS у SIEDD не выше, чем у всех альтернатив: TTS-базовая система получает 4.11, потому что генерирует речь заново, а не сохраняет окружение. Метод также зависит от качества токенизатора и принудительного фонемного/длительного согласования.
Фишка из статьи. Абляция показывает, что выигрыш дает не просто «диффузия вместо авторегрессии», а уважение к иерархии кодбуков. Когда все кодбуки диффундируются совместно, WER хуже; когда убирают предсказатель длительности или локальное CFG, качество тоже падает.
| Вариант | Кодек | WER ниже лучше | SIM выше лучше |
|---|---|---|---|
| Один кодбук | WavTokenizer 24 кГц | 0.186 | 0.95 |
| Много кодбуков, без CFG | EnCodec 16 кГц | 0.139 | 0.97 |
| Много кодбуков, совместно | EnCodec 16 кГц | 0.152 | 0.97 |
| Без предсказателя длительности | EnCodec 16 кГц | 0.136 | 0.97 |
| SIEDD | EnCodec 16 кГц | 0.121 | 0.98 |
Как это читать: RVQ-кодбук нижнего уровня задает грубую структуру речи, а верхние кодбуки уточняют детали. Если не фиксировать этот порядок, модель может «уточнять» еще неустойчивую основу, поэтому иерархическое условие дает более надежное редактирование.