Преобразование голоса Аудиовизуальный синтез Потоковая генерация
arXiv cs.CV

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

arXiv:2608.11752

UniSwap одновременно заменяет лицо и тембр в говорящем видео, сохраняя речь, движения, фон и синхронизацию губ. Для речевых технологий работа важна тем, что преобразование голоса больше не является независимым последующим блоком: звук и видео генерируются одним диффузионным преобразователем и одной временной системой координат.

Метод. Обучающие пары создаются без съемки одного высказывания двумя людьми: из реального ролика убирают личность, заменяя лицо позовым суррогатом, а голос - случайным тембром, после чего исходный ролик служит целью восстановления. Замороженная LTX-2.3 получает LoRA в три этапа: двунаправленное обучение по контексту, переход к блочно-причинной генерации с кэшем и самопринудительное DMD-обучение, сокращающее 30 шагов очистки до трех. Feature-RoPE удерживает позиции длинного потока в диапазоне обучения.

Результаты. На 100 десятисекундных роликах UniSwap имеет лучшую синхронизацию среди сопоставленных конвейеров: Sync-C 3,633 и Sync-D 10,304. Сходство лица DINO-S 0,629 практически равно лучшему 0,630, но качество голоса уступает отдельному Seed-VC: SECS 0,730 против 0,829. В минутных роликах DINO-S остается в диапазоне 0,590-0,596. Пользовательское исследование с 30 участниками дает 4,16/5 за сходство внешности и 4,11 за синхронизацию губ.

Ограничения. Система рассчитана на одного говорящего и плохо покрывает перекрытия, заслонения и сложные взаимодействия. Выражением лица нельзя управлять независимо от звука. Проверка проведена на AVSpeech и одной H100. Главная практическая оговорка: это потоковая, но пока не работающая в реальном времени система - 13,6 кадра/с при воспроизведении 25 кадров/с. Технология также несет очевидный риск подмены личности.

Фишка из статьи. Авторы не прячут разницу между потоковостью и реальным временем: кэш позволяет выдавать блоки последовательно, но вычисление все еще отстает от воспроизведения.

МетодШагиВремя выводаКадров/с
Wan-Animate20176,34 с на ролик1,367
SCAIL-28190,98 с на ролик1,262
MoCha301 800,94 с на ролик0,134
UniSwap3 на блок1,76 с на 24 кадра13,6

Как это читать: UniSwap примерно в десять раз быстрее ближайшего базового метода, но 13,6 все еще меньше целевых 25 кадров/с. Таблица подтверждает пригодность блочной выдачи и одновременно показывает, что слово streaming здесь не равно real-time.

Оригинальная статья на arXiv