VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching
VoxAudio решает промежуточную задачу между синтезом речи и генерацией звуковых сцен: модель должна произнести точную фразу, поместить её в заданный временной интервал и сохранить окружающие звуки. Главный ход - причинное согласование потоков с независимым уровнем шума для каждого блока, благодаря чему один и тот же обученный модуль работает с разным размером выдаваемых звуковых фрагментов.
Метод. Звук кодируется в непрерывные признаки по 80 мс, разбивается на причинные блоки со случайными границами и восстанавливается авторегрессионной моделью согласования потоков. При выводе скользящее окно одновременно продвигает несколько блоков с разными стадиями очистки и хранит ключи и значения прошлых блоков. После основного обучения Negative-aware FineTuning объединяет четыре сигнала: смысловое соответствие, WER точной реплики, оценку звуковой эстетики и пересечение заданного и найденного речевых интервалов. Данные включают 879 768 отфильтрованных реальных примеров и синтетические сцены с точной временной разметкой.
Результаты. На VoxBench-10s модель получает WER 3,8% против 26,4% у Dasheng-AudioGen и временное IoU 0,654 против 0,146; MOS качества сопоставимы, а MOS соответствия описанию равны 4,51 против 4,16. На чистом SEED-TTS-Eval WER составляет 1,61% при RTF 0,32: это немного хуже F5-TTS с 1,20%, но намного лучше единой звуковой модели Dasheng с 27,47%. На MECAT VoxAudio снижает WER с 15,1% до 8,5%, однако проигрывает по распределительным показателям звука, например FD-VGG 4,16 против 1,51.
Ограничения. Модель и проверка смещены к английскому языку, а связность сцены заметно падает после 30 секунд. VoxBench частично построен языковой моделью, реальные подписи тоже получены каскадом распознавания и языковых моделей; возможны общие систематические ошибки. WER измеряется Whisper после выделения вокальной дорожки и смешивает ошибки генерации с ошибками разделения и распознавания. Субъективная оценка включает 16 слушателей и по 50 фрагментов на модель, а первая выдача в стандартном потоковом режиме появляется лишь через 1,38 с.
Фишка из статьи. Скорость остаётся почти постоянной с ростом длительности, но содержание деградирует быстро. Это важный отрицательный результат: потоковая вычислительная схема сама по себе не обеспечивает долговременную звуковую связность.
| Длительность | WER | Временное IoU | RTF | Время до первого блока |
|---|---|---|---|---|
| 10 с | 3,8% | 0,714 | 0,32 | 1,38 с |
| 20 с | 12,7% | 0,536 | 0,34 | 1,84 с |
| 30 с | 27,7% | 0,325 | 0,33 | 1,88 с |
Как это читать: вычислительная цена на секунду почти не меняется, но к 30 секундам WER возрастает более чем в семь раз, а точность размещения речи падает вдвое. Ограничение находится в долговременном моделировании сцены, а не в пропускной способности генератора.