Audio generation Audio-language Data
Генерация аудио

SoundscapeAgent: управляемая сборка звуковых сцен

MMAU 56.5%

SoundscapeAgent предлагает не еще одну модель text-to-audio, а агентный конвейер сборки звуковой сцены: сначала план, затем подбор или генерация источников, временная раскладка, рендеринг и экспорт метаданных. Это интересно для аудио-языковых моделей, потому что такая сцена остается редактируемой и проверяемой: у каждого события есть роль, время, уровень и stem. Главная идея - заменить single-shot генерацию управляемой композицией.

Пользовательский запрос переводится LLM-агентом в явный scene plan: например, background rain на 0-25 с с уровнем -30 дБ, distant traffic на 10-25 с с -32 дБ и foreground page-turn около 12 с с -22 дБ. Агент выбирает инструменты, берет ассеты из библиотеки или генерирует недостающие, ранжирует кандидаты по CLAP similarity и production complexity, затем рендерит многослойную сцену. На выходе остаются stems, role-specific submixes и структурированная разметка, которую можно использовать как обучающие данные.

В listening study участвовали 22 человека, каждый пример получил 10 независимых оценок alignment по шкале 1-5. По overall alignment SoundscapeAgent набрал 3.63 +/- 0.09, выше TangoFlux 3.41 +/- 0.09, EzAudio 2.98 +/- 0.10 и AudioLDM 2 2.91 +/- 0.09. Самые сильные преимущества - affective/abstract и ambiance-heavy сцены; в event-rich категории агент чуть уступает лучшему baseline. В downstream-проверке на MMAU test-mini real-only обучение дает 51.05% overall accuracy, добавление 100k agentic examples поднимает до 56.50%.

Ограничения прямо следуют из устройства системы. Это не чистая модель, а сложный агентный pipeline с библиотеками, генераторами, ранжированием и рендерингом; качество зависит от ассетов и правил отбора. Speech-задачи в MMAU улучшаются смешанно, потому что библиотека в основном содержит не речевые события. Кроме того, больше синтетики не всегда лучше: 200k agentic examples дают 55.40%, ниже 100k, что указывает на важность качества и баланса данных.

Фишка из статьи. Самый полезный результат - отрицательный для подхода «просто добавить больше синтетики»: оптимум в их настройке оказался на 100k, а не на 200k примерах.

Данные для alignerSoundMusicSpeechHardOverall
Real-only59.04%46.41%47.75%44.49%51.05%
+50k agentic63.06%47.01%49.85%51.27%53.30%
+100k agentic66.67%51.50%51.35%53.39%56.50%
+200k agentic64.56%49.10%52.55%50.42%55.40%

Как это читать: агентная генерация полезна как структурированная разметка для аудио-рассуждения, но объем не заменяет контроль качества. Рост с 51.05% до 56.50% показывает пользу композиционных сцен, а спад на 200k предупреждает о риске накопить синтетический шум.

Оригинальная статья на arXiv