Синтез звуковых сцен Потоковая генерация Временное управление
arXiv cs.SD

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

arXiv:2608.12951

VoxAudio решает промежуточную задачу между синтезом речи и генерацией звуковых сцен: модель должна произнести точную фразу, поместить её в заданный временной интервал и сохранить окружающие звуки. Главный ход - причинное согласование потоков с независимым уровнем шума для каждого блока, благодаря чему один и тот же обученный модуль работает с разным размером выдаваемых звуковых фрагментов.

Метод. Звук кодируется в непрерывные признаки по 80 мс, разбивается на причинные блоки со случайными границами и восстанавливается авторегрессионной моделью согласования потоков. При выводе скользящее окно одновременно продвигает несколько блоков с разными стадиями очистки и хранит ключи и значения прошлых блоков. После основного обучения Negative-aware FineTuning объединяет четыре сигнала: смысловое соответствие, WER точной реплики, оценку звуковой эстетики и пересечение заданного и найденного речевых интервалов. Данные включают 879 768 отфильтрованных реальных примеров и синтетические сцены с точной временной разметкой.

Результаты. На VoxBench-10s модель получает WER 3,8% против 26,4% у Dasheng-AudioGen и временное IoU 0,654 против 0,146; MOS качества сопоставимы, а MOS соответствия описанию равны 4,51 против 4,16. На чистом SEED-TTS-Eval WER составляет 1,61% при RTF 0,32: это немного хуже F5-TTS с 1,20%, но намного лучше единой звуковой модели Dasheng с 27,47%. На MECAT VoxAudio снижает WER с 15,1% до 8,5%, однако проигрывает по распределительным показателям звука, например FD-VGG 4,16 против 1,51.

Ограничения. Модель и проверка смещены к английскому языку, а связность сцены заметно падает после 30 секунд. VoxBench частично построен языковой моделью, реальные подписи тоже получены каскадом распознавания и языковых моделей; возможны общие систематические ошибки. WER измеряется Whisper после выделения вокальной дорожки и смешивает ошибки генерации с ошибками разделения и распознавания. Субъективная оценка включает 16 слушателей и по 50 фрагментов на модель, а первая выдача в стандартном потоковом режиме появляется лишь через 1,38 с.

Фишка из статьи. Скорость остаётся почти постоянной с ростом длительности, но содержание деградирует быстро. Это важный отрицательный результат: потоковая вычислительная схема сама по себе не обеспечивает долговременную звуковую связность.

ДлительностьWERВременное IoURTFВремя до первого блока
10 с3,8%0,7140,321,38 с
20 с12,7%0,5360,341,84 с
30 с27,7%0,3250,331,88 с

Как это читать: вычислительная цена на секунду почти не меняется, но к 30 секундам WER возрастает более чем в семь раз, а точность размещения речи падает вдвое. Ограничение находится в долговременном моделировании сцены, а не в пропускной способности генератора.

Оригинальная статья на arXiv