SoundscapeAgent: управляемая сборка звуковых сцен
SoundscapeAgent предлагает не еще одну модель text-to-audio, а агентный конвейер сборки звуковой сцены: сначала план, затем подбор или генерация источников, временная раскладка, рендеринг и экспорт метаданных. Это интересно для аудио-языковых моделей, потому что такая сцена остается редактируемой и проверяемой: у каждого события есть роль, время, уровень и stem. Главная идея - заменить single-shot генерацию управляемой композицией.
Пользовательский запрос переводится LLM-агентом в явный scene plan: например, background rain на 0-25 с с уровнем -30 дБ, distant traffic на 10-25 с с -32 дБ и foreground page-turn около 12 с с -22 дБ. Агент выбирает инструменты, берет ассеты из библиотеки или генерирует недостающие, ранжирует кандидаты по CLAP similarity и production complexity, затем рендерит многослойную сцену. На выходе остаются stems, role-specific submixes и структурированная разметка, которую можно использовать как обучающие данные.
В listening study участвовали 22 человека, каждый пример получил 10 независимых оценок alignment по шкале 1-5. По overall alignment SoundscapeAgent набрал 3.63 +/- 0.09, выше TangoFlux 3.41 +/- 0.09, EzAudio 2.98 +/- 0.10 и AudioLDM 2 2.91 +/- 0.09. Самые сильные преимущества - affective/abstract и ambiance-heavy сцены; в event-rich категории агент чуть уступает лучшему baseline. В downstream-проверке на MMAU test-mini real-only обучение дает 51.05% overall accuracy, добавление 100k agentic examples поднимает до 56.50%.
Ограничения прямо следуют из устройства системы. Это не чистая модель, а сложный агентный pipeline с библиотеками, генераторами, ранжированием и рендерингом; качество зависит от ассетов и правил отбора. Speech-задачи в MMAU улучшаются смешанно, потому что библиотека в основном содержит не речевые события. Кроме того, больше синтетики не всегда лучше: 200k agentic examples дают 55.40%, ниже 100k, что указывает на важность качества и баланса данных.
Фишка из статьи. Самый полезный результат - отрицательный для подхода «просто добавить больше синтетики»: оптимум в их настройке оказался на 100k, а не на 200k примерах.
| Данные для aligner | Sound | Music | Speech | Hard | Overall |
|---|---|---|---|---|---|
| Real-only | 59.04% | 46.41% | 47.75% | 44.49% | 51.05% |
| +50k agentic | 63.06% | 47.01% | 49.85% | 51.27% | 53.30% |
| +100k agentic | 66.67% | 51.50% | 51.35% | 53.39% | 56.50% |
| +200k agentic | 64.56% | 49.10% | 52.55% | 50.42% | 55.40% |
Как это читать: агентная генерация полезна как структурированная разметка для аудио-рассуждения, но объем не заменяет контроль качества. Рост с 51.05% до 56.50% показывает пользу композиционных сцен, а спад на 200k предупреждает о риске накопить синтетический шум.