AudioScape-TTA: детальная оценка генерации звука по тексту
AudioScape-TTA закрывает слабое место генерации звука по тексту: глобальная близость текста и аудио плохо говорит, выполнены ли конкретные требования подсказки. Авторы строят бенчмарк с мелкими семантическими рубриками: какие события должны быть слышны, какие акустические атрибуты должны совпадать, есть ли речь и правильно ли передано ее содержание. Для речевых и аудио-систем это ценно как пример оценки не "похоже в целом", а "выполнены ли условия".
Метод. Каждый звуковой фрагмент размечается набором проверяемых требований, а оценщик отвечает на вопросы по сгенерированному аудио. В бенчмарке 2258 примеров, 25707 семантических рубрик, средняя длительность 9.95 секунды и в среднем 11.39 рубрики на пример. Отдельно выделены речевые случаи: 358 клипов с речевой аннотацией, 83 с целевыми высказываниями, 163 рубрики на содержание речи и 931 рубрика на речевые атрибуты.
Результаты. В сравнении 13 моделей лучшей по общей semantic satisfaction rate оказывается Foley-Omni: Overall SR 79.62%, Event Presence 81.74%, Event Attribute 78.34%. Dasheng AudioGen отдельно выделяется на речевом содержании: Speech Content SCCA@0.60 равен 77.30, тогда как у большинства моделей этот показатель нулевой, потому что они не генерируют явную речь. Авторы также проверяют надежность автоматического оценщика на контрастивном наборе из 452 пунктов: F1 94.88%, accuracy и balanced accuracy 94.91%, false-positive rate 4.42%.
Ограничения. Основной сигнал оценки зависит от аудио-языкового оценщика и от качества рубрик, а не от прямой человеческой разметки каждого сгенерированного клипа. Контрастивная проверка сбалансирована, но она Gemini-verified, а не полностью human-calibrated. Кроме того, метрика хорошо проверяет наличие заданных условий, но не является полноценной мерой лишних звуковых галлюцинаций.
Фишка из статьи. Особенно полезна проверка корреляции с людьми: она показывает, почему CLAP-подобная глобальная близость недостаточна для сложных текстовых подсказок.
| Автоматическая метрика | Человеческий критерий | Spearman rho | p-value |
|---|---|---|---|
| Event SR | Completeness | 0.743 | 0.0072 |
| Attribute SR | Attribute satisfaction | 0.825 | 0.0003 |
| Overall SR | Composite semantics | 0.879 | 0.0015 |
| CLAPMS | Composite semantics | 0.312 | 0.0739 |
Как это читать: глобальное текст-аудио сходство почти не объясняет человеческую оценку выполнения подробных требований, а рубричная проверка намного ближе к тому, что слушатель считает семантически правильным.