Звуковые языковые модели Безопасность Автоматическое тестирование
arXiv cs.SD

ARENA: Automated Red-Teaming for Large Audio Language Models

arXiv:2608.15578

Опасный смысл для звуковой языковой модели можно спрятать не в безобидном текстовом запросе, а в речи или окружающем звуке. ARENA автоматизирует поиск именно таких межмодальных отказов: контроллер меняет текст, звуковую сцену и способ её озвучивания по обратной связи, но итоговый успех оценивает отдельный судья, которого поиск не видит. Работа полезна как методика проверки моделей, а не как очередной набор статических атак.

Метод. Контроллер обучают на независимых 2000 спецификациях с речью и окружающими звуками. Он формирует текст, безопасный при отдельной проверке, и звуковую подсказку, которую озвучивает Piper TTS либо синтезирует TangoFlux. Модель-цель сначала должна распознать содержимое звука, затем ответить на совместный запрос. MD-Judge выдаёт награду и структурированную причину неудачи для следующей попытки, а Llama Guard 3 единожды проверяет уже замороженный лучший случай и не участвует в поиске. Это снижает риск подгонки непосредственно под итогового судью.

Результаты. На 520 не пересекающихся с обучением целях AdvBench частота найденных сбоев FDR составляет 87,9% для Audio Flamingo 3, 71,5% для Qwen2-Audio, 68,1% для MiMo-Audio и 75,4% для GPT-Audio. Доля запросов, прошедших входную проверку, остаётся 96,3-100%. Для сравнения, AJailBench даёт FDR 31,2%, 10,8%, 25,3% и 24,6% на тех же четырёх моделях. Перенос между целями заметен, но неполон: случаи, найденные на Audio Flamingo 3, срабатывают на других моделях в 50,4-60,0% запусков.

Ограничения. И речь, и звуковые события синтетические, а опасность ответа определяет автоматический Llama Guard 3 без итоговой человеческой разметки. AdvBench охватывает известный набор текстовых намерений, но не моделирует весь спектр злоупотреблений голосом, музыкой и реальными записями. Высокий FDR зависит от конкретного протокола распознавания звука и судей; он показывает обнаруживаемость отказов, а не вероятность вреда в эксплуатации. Средний бюджет около 9-13 попыток также означает заметную стоимость проверки закрытых моделей.

Фишка из статьи. Поиск не просто перебирает больше формулировок: среднее число попыток различается между моделями, а почти идеальный проход текстового фильтра сохраняется даже при высокой частоте найденных звуковых уязвимостей.

Модель-цельFDRПроход текстового фильтраСреднее число попыток
Audio Flamingo 387,9%100,0%9,2
Qwen2-Audio71,5%96,3%9,1
MiMo-Audio68,1%100,0%12,5
GPT-Audio75,4%98,5%11,4

Как это читать: опасный смысл действительно переносится через звуковой канал при внешне допустимом тексте. Более низкий FDR у MiMo-Audio не означает дешёвую проверку: именно для неё контроллеру требуется больше всего уточнений.

Оригинальная статья на arXiv