Редактирование речи Синтез речи Локальное сохранение
Редактирование речи

dots.tts.edit: структурное редактирование речи без таймкодов

doteBench

Статья интересна тем, что переносит редактирование речи из режима свободной просьбы в режим проверяемого структурного контракта. Пользователь задает не только новую фразу, но и точную область действия через XML-подобные теги: заменить слово, изменить эмоцию, поднять тон, вставить или сократить паузу. Главный ход - сделать редактирование локальным и измеримым, чтобы модель не пересинтезировала все высказывание там, где нужно поменять только один участок.

Метод. Авторы строят doteBench: 569 текстовых правок, 312 эмоциональных, 360 просодических, 300 правок пауз и 240 составных случаев. Инструкция автоматически превращается в целевой текст, а модель получает исходный звук, исходную и целевую транскрипции, структурную инструкцию и вектор говорящего CAM++. Генератор основан на непрерывной авторегрессионной схеме: языковая модель планирует последовательность, семантический энкодер и flow-matching голова предсказывают латентные аудио-патчи, а AudioVAE декодирует их обратно в звук. По сравнению с обычным zero-shot синтезом здесь важен не только новый текст, но и маска сохранения неизмененных слов.

Результаты. На сложном текстовом редактировании dots.tts.edit дает 13.70% WER/CER в редактируемой области и 1.51% WER/CER вне нее. Это не рекорд по всем осям, но хороший баланс: модель сохраняет соседние слова точнее большинства открытых речевых моделей и удерживает похожесть голоса SpkSim 0.757. На составных правках она достигает 60.87% компонентного успеха и 30.00% полного успеха за один проход, тогда как последовательный набор специализированных пайплайнов дает 67.57% и 34.17%, но требует нескольких отдельных вызовов.

Ограничения. Работа помечена как work in progress. Часть оценки опирается на автоматических судей, например распознавание эмоции через Gemini, а качество звука по UTMOS местами ниже, чем у полного пересинтеза. Составные правки остаются трудными: 30% полного успеха означает, что надежного редактора для сложных инструкций еще нет. Кроме того, набор данных построен через синтетические и пайплайновые процедуры, поэтому перенос на реальные студийные правки требует отдельной проверки.

Фишка из статьи. Самый полезный контрольный эксперимент сравнивает специализированный редактор с простым полным пересинтезом той же фразы. Редактор выигрывает именно там, где нужна локальность, но уступает по похожести голоса и предсказанной аудиооценке.

РежимTarget WER/CEREdit WER/CERNon-edit WER/CERWDTW-DurWDTW-F0SpkSimUTMOS
Редактирование11.15%13.70%1.51%7.89%2.47 st0.7573.129
Полный zero-shot синтез14.72%17.88%2.79%11.38%3.43 st0.7993.327

Как это читать: dedicated editor лучше следует целевым словам и меньше двигает длительность и высоту сохраненных слов, но полный пересинтез пока звучит чуть качественнее и лучше держит голос. Это честный инженерный компромисс, а не безусловная победа нового метода.

Оригинальная статья на arXiv