MMAG: контрольный набор для смешанной генерации речи, музыки и звуков
MMAG предлагает оценивать аудиогенераторы не по одной способности, а по смешанным сценам, где одновременно есть речь, музыка, шумовые события, дикторские признаки и временной контроль. Это ближе к реальным аудиоагентам и видео-аудио системам, чем отдельные тесты на речь или музыку. Главный вклад - не новая модель, а набор и протокол, который показывает, что современные генераторы выигрывают по разным метрикам и не дают одного универсального лидера.
Метод. Авторы строят Multi-control Mixed Audio Generation benchmark из тестовых данных AudioCaps, VGGSound и MECAT, добавляя подробные подписи: транскрипты речи, возраст/пол/акцент/эмоцию диктора, звуковые события, музыкальную информацию и временной порядок. Основной набор содержит около 3980 пар аудио-текст, отдельный набор для клонирования голоса - около 690, а timestamp-набор - около 1800. Для оценки используются акустические расстояния, WER, UTMOSv2, CLAP, LLM-оценка AAJ, сходство диктора и F1 для временных сегментов.
Результаты. На основном наборе LTX-2 имеет низкий WER 0.04 и UTMOSv2 2.90, Ming-Omni-TTS-16.8B дает лучший WER 0.03 и UTMOSv2 3.33, а Dasheng-AudioGen-Fine сильнее по семантическому AAJ 0.80. На voice-cloning subset лучший SPK-SIM у Ming-Omni-TTS-16.8B - 0.78, но его UTMOSv2 2.79 ниже, чем на основном наборе. На timestamp subset AuDirector получает Speech F1 0.72 и Sound F1 0.57, тогда как LTX-2 имеет WER 0.05, но Sound F1 только 0.44.
Ограничения. Набор опирается на автоматические экспертные модели и LLM-оценку, поэтому часть разметки и метрик неизбежно шумная. Основной набор ограничен одиночным английским диктором в ряде сценариев, а голосовые подсказки выбираются из сложных реальных сцен. MMAG хорошо вскрывает слабые места, но не заменяет человеческую оценку для финального качества аудио.
Фишка из статьи. Хороший диагностический блок - caption confusion: модели иногда озвучивают текст из общего описания сцены, а не целевой транскрипт. Это не просто высокий WER, а конкретный тип ошибки смешанной аудиогенерации.
| Модель | Доля ошибок от caption confusion, main | Доля ошибок от caption confusion, timestamp |
|---|---|---|
| AuDirector | 1.88% | 5.43% |
| LTX-2 | 5.12% | 7.41% |
| Ovi | 13.92% | 19.70% |
| Dasheng-AudioGen-Base | 18.21% | 56.48% |
| Dasheng-AudioGen-Fine | 21.88% | 36.04% |
Как это читать: показатель считает, какая часть WER вызвана словами, взятыми из нецелевых частей описания. Timestamp-условие резко усиливает проблему, потому что модели нужно соблюдать и содержание, и временные границы, а не просто сгенерировать правдоподобную аудиосцену.