Vorch-Streamer: потоковая генерация речи и аватара из текста
Vorch-Streamer пытается сделать потоковую генерацию говорящего человека из текста: не сначала сгенерировать весь ролик, а выдавать длинную аудио-визуальную последовательность в реальном времени. Работа интересна для речевых технологий на границе с видео, потому что синхронность речи, мимики и длительной идентичности обычно ломается при переходе от коротких клипов к потоковой генерации. Главный ход - разделить планирование речи и диффузионную генерацию видео, а затем дистиллировать процесс до скорости выше реального времени.
Метод. Система расширяет аудио-видео диффузионную модель LTX2.3 до причинной длинной генерации. Обучение идет в несколько этапов: сначала смешиваются Teacher Forcing и Diffusion Forcing, затем применяется Self Forcing для длинного горизонта и DMD-дистилляция. Отдельный речевой планировщик на базе Fun-CosyVoice предсказывает дискретные токены планирования речи с частотой 25 Гц, то есть один токен примерно на 40 мс.
Результаты. Vorch-Streamer с 22.8 млрд параметров работает на 27.12 FPS, тогда как исходная offline LTX2.3 дает 1.83 FPS. При этом WER генерируемой речи составляет 7.92% против 7.59% у LTX2.3, а синхронизация остается близкой: Sync-C 6.62 против 6.80 и Sync-D 8.95 против 7.96. На последних 10 секундах длинных роликов система удерживает идентичность почти без распада: Human Identity 1.0000 и Drift 0.0221.
Ограничения. Это очень дорогая система: обучение включает 64 H200 GPU, синтетический корпус из 80 тысяч аватарных клипов и крупную модельную цепочку. Результаты относятся к генерации аватаров, а не к обычному улучшению речи или распознаванию. Метрики WER и Sync полезны, но они не заменяют пользовательскую оценку естественности и управляемости длинного диалога.
Фишка из статьи. Самый содержательный эксперимент - абляция речевого планирования. Если давать модели длинный текст напрямую или разбивать его простыми окнами, речь разваливается; дискретный план речи резко снижает WER.
| Способ подачи речи | WER | Sync-C | Sync-D |
|---|---|---|---|
| Полное длинное высказывание | 184.00% | 5.58 | 9.66 |
| Короткие сегменты текста | 62.77% | 6.76 | 8.98 |
| Окно текста с RoPE | 65.46% | 4.75 | 9.19 |
| LLM-план речи | 7.92% | 6.62 | 8.95 |
Как это читать: WER выше 100% означает, что система генерирует много лишней или неправильной речи. Здесь главный выигрыш дает не только ускорение диффузии, а промежуточное речевое представление, которое стабилизирует длинный текст перед аудио-визуальной генерацией.