Редактирование речи Codec tokens Diffusion
arXiv cs.SD

SIEDD: дискретная диффузия для восстановления и редактирования речи

arXiv:2608.06424

SIEDD решает задачу локального восстановления и редактирования речи: нужно заменить или дорисовать фрагмент, не пересинтезируя всю фразу и не теряя диктора, темп, фон и акустический контекст. Главный ход статьи - использовать дискретную диффузию поверх иерархических кодековых токенов, а не авторегрессионную генерацию слева направо. Это хорошо подходит для редактирования, где модель должна одновременно учитывать контекст до и после исправляемого участка.

Метод. Архитектура HiCoDD учитывает порядок RVQ-кодбуков: нижние кодбуки считаются уже зафиксированным грубым акустическим контекстом, а диффузия применяется к текущему уточняющему кодбуку. Модель получает фонемное представление целевого текста, чистые токены вне редактируемого окна и сгенерированные нижние кодбуки внутри окна. Для вставок и замен отдельный предсказатель длительности оценивает, сколько EnCodec-кадров нужно выделить новому текстовому фрагменту.

Результаты. На RealEdit в задаче речевого редактирования SIEDD получает WER 0.121, сходство диктора 0.98, MCD 270.0 и UTMOS 3.44. VoiceCraft дает WER 0.124, SIM 0.97 и MCD 392.25, SSR-Speech - WER 0.146, SIM 0.97 и MCD 308.3. В восстановлении пропусков эффект особенно заметен на коротких масках: для одного пропуска 250 мс MCD снижается до 21.1 против 91.3 у SSR-Speech и 191.5 у VoiceCraft. Обучение основного варианта заняло 550 000 шагов на двух RTX A6000 примерно за неделю.

Ограничения. Работа проверяется на RealEdit и связанных с ним сценариях, поэтому перенос на телефонный звук, шумные встречи и многоязычные правки нужно отдельно проверять. UTMOS у SIEDD не выше, чем у всех альтернатив: TTS-базовая система получает 4.11, потому что генерирует речь заново, а не сохраняет окружение. Метод также зависит от качества токенизатора и принудительного фонемного/длительного согласования.

Фишка из статьи. Абляция показывает, что выигрыш дает не просто «диффузия вместо авторегрессии», а уважение к иерархии кодбуков. Когда все кодбуки диффундируются совместно, WER хуже; когда убирают предсказатель длительности или локальное CFG, качество тоже падает.

ВариантКодекWER ниже лучшеSIM выше лучше
Один кодбукWavTokenizer 24 кГц0.1860.95
Много кодбуков, без CFGEnCodec 16 кГц0.1390.97
Много кодбуков, совместноEnCodec 16 кГц0.1520.97
Без предсказателя длительностиEnCodec 16 кГц0.1360.97
SIEDDEnCodec 16 кГц0.1210.98

Как это читать: RVQ-кодбук нижнего уровня задает грубую структуру речи, а верхние кодбуки уточняют детали. Если не фиксировать этот порядок, модель может «уточнять» еще неустойчивую основу, поэтому иерархическое условие дает более надежное редактирование.

Оригинальная статья на arXiv