UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap одновременно заменяет лицо и тембр в говорящем видео, сохраняя речь, движения, фон и синхронизацию губ. Для речевых технологий работа важна тем, что преобразование голоса больше не является независимым последующим блоком: звук и видео генерируются одним диффузионным преобразователем и одной временной системой координат.
Метод. Обучающие пары создаются без съемки одного высказывания двумя людьми: из реального ролика убирают личность, заменяя лицо позовым суррогатом, а голос - случайным тембром, после чего исходный ролик служит целью восстановления. Замороженная LTX-2.3 получает LoRA в три этапа: двунаправленное обучение по контексту, переход к блочно-причинной генерации с кэшем и самопринудительное DMD-обучение, сокращающее 30 шагов очистки до трех. Feature-RoPE удерживает позиции длинного потока в диапазоне обучения.
Результаты. На 100 десятисекундных роликах UniSwap имеет лучшую синхронизацию среди сопоставленных конвейеров: Sync-C 3,633 и Sync-D 10,304. Сходство лица DINO-S 0,629 практически равно лучшему 0,630, но качество голоса уступает отдельному Seed-VC: SECS 0,730 против 0,829. В минутных роликах DINO-S остается в диапазоне 0,590-0,596. Пользовательское исследование с 30 участниками дает 4,16/5 за сходство внешности и 4,11 за синхронизацию губ.
Ограничения. Система рассчитана на одного говорящего и плохо покрывает перекрытия, заслонения и сложные взаимодействия. Выражением лица нельзя управлять независимо от звука. Проверка проведена на AVSpeech и одной H100. Главная практическая оговорка: это потоковая, но пока не работающая в реальном времени система - 13,6 кадра/с при воспроизведении 25 кадров/с. Технология также несет очевидный риск подмены личности.
Фишка из статьи. Авторы не прячут разницу между потоковостью и реальным временем: кэш позволяет выдавать блоки последовательно, но вычисление все еще отстает от воспроизведения.
| Метод | Шаги | Время вывода | Кадров/с |
|---|---|---|---|
| Wan-Animate | 20 | 176,34 с на ролик | 1,367 |
| SCAIL-2 | 8 | 190,98 с на ролик | 1,262 |
| MoCha | 30 | 1 800,94 с на ролик | 0,134 |
| UniSwap | 3 на блок | 1,76 с на 24 кадра | 13,6 |
Как это читать: UniSwap примерно в десять раз быстрее ближайшего базового метода, но 13,6 все еще меньше целевых 25 кадров/с. Таблица подтверждает пригодность блочной выдачи и одновременно показывает, что слово streaming здесь не равно real-time.