dots.tts.edit: структурное редактирование речи без таймкодов
Статья интересна тем, что переносит редактирование речи из режима свободной просьбы в режим проверяемого структурного контракта. Пользователь задает не только новую фразу, но и точную область действия через XML-подобные теги: заменить слово, изменить эмоцию, поднять тон, вставить или сократить паузу. Главный ход - сделать редактирование локальным и измеримым, чтобы модель не пересинтезировала все высказывание там, где нужно поменять только один участок.
Метод. Авторы строят doteBench: 569 текстовых правок, 312 эмоциональных, 360 просодических, 300 правок пауз и 240 составных случаев. Инструкция автоматически превращается в целевой текст, а модель получает исходный звук, исходную и целевую транскрипции, структурную инструкцию и вектор говорящего CAM++. Генератор основан на непрерывной авторегрессионной схеме: языковая модель планирует последовательность, семантический энкодер и flow-matching голова предсказывают латентные аудио-патчи, а AudioVAE декодирует их обратно в звук. По сравнению с обычным zero-shot синтезом здесь важен не только новый текст, но и маска сохранения неизмененных слов.
Результаты. На сложном текстовом редактировании dots.tts.edit дает 13.70% WER/CER в редактируемой области и 1.51% WER/CER вне нее. Это не рекорд по всем осям, но хороший баланс: модель сохраняет соседние слова точнее большинства открытых речевых моделей и удерживает похожесть голоса SpkSim 0.757. На составных правках она достигает 60.87% компонентного успеха и 30.00% полного успеха за один проход, тогда как последовательный набор специализированных пайплайнов дает 67.57% и 34.17%, но требует нескольких отдельных вызовов.
Ограничения. Работа помечена как work in progress. Часть оценки опирается на автоматических судей, например распознавание эмоции через Gemini, а качество звука по UTMOS местами ниже, чем у полного пересинтеза. Составные правки остаются трудными: 30% полного успеха означает, что надежного редактора для сложных инструкций еще нет. Кроме того, набор данных построен через синтетические и пайплайновые процедуры, поэтому перенос на реальные студийные правки требует отдельной проверки.
Фишка из статьи. Самый полезный контрольный эксперимент сравнивает специализированный редактор с простым полным пересинтезом той же фразы. Редактор выигрывает именно там, где нужна локальность, но уступает по похожести голоса и предсказанной аудиооценке.
| Режим | Target WER/CER | Edit WER/CER | Non-edit WER/CER | WDTW-Dur | WDTW-F0 | SpkSim | UTMOS |
|---|---|---|---|---|---|---|---|
| Редактирование | 11.15% | 13.70% | 1.51% | 7.89% | 2.47 st | 0.757 | 3.129 |
| Полный zero-shot синтез | 14.72% | 17.88% | 2.79% | 11.38% | 3.43 st | 0.799 | 3.327 |
Как это читать: dedicated editor лучше следует целевым словам и меньше двигает длительность и высоту сохраненных слов, но полный пересинтез пока звучит чуть качественнее и лучше держит голос. Это честный инженерный компромисс, а не безусловная победа нового метода.