Аудио-видео Streaming Avatar
arXiv cs.CV

Vorch-Streamer: потоковая генерация речи и аватара из текста

arXiv:2608.05663

Vorch-Streamer пытается сделать потоковую генерацию говорящего человека из текста: не сначала сгенерировать весь ролик, а выдавать длинную аудио-визуальную последовательность в реальном времени. Работа интересна для речевых технологий на границе с видео, потому что синхронность речи, мимики и длительной идентичности обычно ломается при переходе от коротких клипов к потоковой генерации. Главный ход - разделить планирование речи и диффузионную генерацию видео, а затем дистиллировать процесс до скорости выше реального времени.

Метод. Система расширяет аудио-видео диффузионную модель LTX2.3 до причинной длинной генерации. Обучение идет в несколько этапов: сначала смешиваются Teacher Forcing и Diffusion Forcing, затем применяется Self Forcing для длинного горизонта и DMD-дистилляция. Отдельный речевой планировщик на базе Fun-CosyVoice предсказывает дискретные токены планирования речи с частотой 25 Гц, то есть один токен примерно на 40 мс.

Результаты. Vorch-Streamer с 22.8 млрд параметров работает на 27.12 FPS, тогда как исходная offline LTX2.3 дает 1.83 FPS. При этом WER генерируемой речи составляет 7.92% против 7.59% у LTX2.3, а синхронизация остается близкой: Sync-C 6.62 против 6.80 и Sync-D 8.95 против 7.96. На последних 10 секундах длинных роликов система удерживает идентичность почти без распада: Human Identity 1.0000 и Drift 0.0221.

Ограничения. Это очень дорогая система: обучение включает 64 H200 GPU, синтетический корпус из 80 тысяч аватарных клипов и крупную модельную цепочку. Результаты относятся к генерации аватаров, а не к обычному улучшению речи или распознаванию. Метрики WER и Sync полезны, но они не заменяют пользовательскую оценку естественности и управляемости длинного диалога.

Фишка из статьи. Самый содержательный эксперимент - абляция речевого планирования. Если давать модели длинный текст напрямую или разбивать его простыми окнами, речь разваливается; дискретный план речи резко снижает WER.

Способ подачи речиWERSync-CSync-D
Полное длинное высказывание184.00%5.589.66
Короткие сегменты текста62.77%6.768.98
Окно текста с RoPE65.46%4.759.19
LLM-план речи7.92%6.628.95

Как это читать: WER выше 100% означает, что система генерирует много лишней или неправильной речи. Здесь главный выигрыш дает не только ускорение диффузии, а промежуточное речевое представление, которое стабилизирует длинный текст перед аудио-визуальной генерацией.

Оригинальная статья на arXiv