BAMM: AI-музыка в реальном телеэфире ломает чистые детекторы
BAMM проверяет детекторы AI-музыки в реальном телеэфире, где музыка короткая, сжата, может идти фоном и смешивается с речью и шумовыми событиями. Это важный сдвиг от лабораторных чистых треков: именно broadcast monitoring нужен для прозрачности и учета использования AI-музыки. Главный результат жесткий: модели с F1 выше 99% на чистой музыке резко проседают на настоящем эфире.
Метод. Авторы собирают Broadcast AI-Music Monitoring dataset: 40 часов реальных ТВ-фрагментов, примерно 20 часов AI-музыки и 20 часов человеческой музыки. Фрагменты ищутся в глобальном архиве более чем 4200 телеканалов за январь 2025 - март 2026 через аудиофингерпринтинг; длительности 5-60 секунд, звук моно 8 кГц, AAC-LC не ниже 40 кбит/с. Сравниваются два CNN одной архитектуры: clean-trained и broadcast-trained.
Результаты. На clean foreground music обе модели почти идеальны: F1 0.992, ROC 0.998/0.996. На synthetic TV broadcast clean-модель падает до F1 0.342, а broadcast-модель до 0.661. На real TV broadcast падение еще сильнее: CNN Clean получает F1 0.186 и ROC 0.707, CNN Broadcast - F1 0.472 и ROC 0.775. Отдельные ROC-кривые показывают, что foreground проще background: для broadcast-модели AUC 0.858 на foreground и 0.745 на background.
Ограничения. Набор сфокусирован на broadcast-условиях и конкретном семействе CNN-детекторов, а model-agnostic обнаружение AI-музыки остается открытым. Разметка AI-класса строится через референсные треки и ансамбль детекторов, что требует осторожности. Также низкобитрейтные proxy-потоки отражают промышленный мониторинг, но не весь спектр телевизионного качества.
Фишка из статьи. Самый полезный вывод - синтетическая имитация эфира все еще оптимистична. Даже broadcast-trained модель, обученная на смешанных условиях, теряет почти 19 пунктов F1 при переходе с synthetic broadcast на real broadcast.
| Сценарий | CNN Clean F1 | CNN Clean ROC | CNN Broadcast F1 | CNN Broadcast ROC |
|---|---|---|---|---|
| Clean Foreground Music | 0.992 | 0.998 | 0.992 | 0.996 |
| Synthetic TV Broadcast | 0.342 | 0.909 | 0.661 | 0.926 |
| Real TV Broadcast | 0.186 | 0.707 | 0.472 | 0.775 |
Как это читать: ROC остается умеренно высоким, но F1 резко падает, потому что рабочий порог плохо отделяет AI от human в реальном эфире. Главная проблема не ложные срабатывания на человеческой музыке, а недообнаружение AI-фрагментов, особенно на фоне.