Video-to-Audio Diffusion Audio generation
arXiv cs.LG

TD-V2A: временные различия кадров для генерации звука к видео

arXiv:2608.04902

TD-V2A рассматривает генерацию звука к видео через простой вопрос: чем видео отличается от одиночного изображения для аудио-модели. Ответ авторов - временными различиями между кадрами, которые несут ритм, движение и момент возникновения звука. Вместо отдельного аудио-визуального предсказателя или сильной внешней разметки они добавляют эти различия прямо в визуальное условие диффузионной модели.

Метод. Авторы сравнивают два вида временных различий: на уровне кадров и на уровне CLIP-признаков. В основной версии берутся остатки между соседними кадрами, кодируются тем же замороженным CLIP-кодировщиком, что и обычные кадры, и объединяются с визуальным условием. Обучение идет иерархически: сначала текст-звук, затем видео, затем временные различия. На выводе добавляется annealed temporal differences guidance: на ранних шагах диффузии сильнее учитывается динамика, а к концу семантическое условие получает больший вес.

Результаты. На VGGSound test set примерно из 15 тысяч 10-секундных клипов TD-V2A дает FAD 0.53, KL 2.16, Inception Score 16.9, FD 3.79, IBS 33.8 и AA 89.1. Для сравнения, MMAudio имеет FAD 0.81, KL 2.11, IS 11.9, FD 5.65 и IBS 28.0. В субъективной оценке TD-V2A получает OVL 3.68, S-REL 3.85 и T-REL 3.62; FoleyCrafter - 3.17, 3.23 и 3.04, а ground truth - 3.81, 3.92 и 3.72.

Ограничения. Это работа про общее видео-аудио, а не про речь в комнате или фазово-точное улучшение речи. Проверка сосредоточена на VGGSound и 16 кГц 10-секундных клипах, поэтому перенос на длинные сцены, музыку, диалог или пространственный звук не доказан. Также не раскрыта практическая задержка вывода, что важно для интерактивного озвучивания.

Фишка из статьи. Интересна не только добавка временных различий, а annealed guidance: постоянный большой вес динамики улучшает синхронизацию, но портит аудио-качество.

Guidance для временных различийFAD ↓IBS ↑AA ↑
Низкий постоянный вес, 0.50.5733.688.2
Высокий постоянный вес, 1.50.6233.089.1
ATDG, вес убывает по шагам0.5333.889.1

Как это читать: высокая статическая подсказка по движению может сохранить AA, но ухудшает FAD и IBS. Убывающий вес дает тот же AA 89.1 при лучшем FAD 0.53, то есть модель использует движение рано, а финальную звуковую фактуру достраивает мягче.

Оригинальная статья на arXiv