ARENA: Automated Red-Teaming for Large Audio Language Models
Опасный смысл для звуковой языковой модели можно спрятать не в безобидном текстовом запросе, а в речи или окружающем звуке. ARENA автоматизирует поиск именно таких межмодальных отказов: контроллер меняет текст, звуковую сцену и способ её озвучивания по обратной связи, но итоговый успех оценивает отдельный судья, которого поиск не видит. Работа полезна как методика проверки моделей, а не как очередной набор статических атак.
Метод. Контроллер обучают на независимых 2000 спецификациях с речью и окружающими звуками. Он формирует текст, безопасный при отдельной проверке, и звуковую подсказку, которую озвучивает Piper TTS либо синтезирует TangoFlux. Модель-цель сначала должна распознать содержимое звука, затем ответить на совместный запрос. MD-Judge выдаёт награду и структурированную причину неудачи для следующей попытки, а Llama Guard 3 единожды проверяет уже замороженный лучший случай и не участвует в поиске. Это снижает риск подгонки непосредственно под итогового судью.
Результаты. На 520 не пересекающихся с обучением целях AdvBench частота найденных сбоев FDR составляет 87,9% для Audio Flamingo 3, 71,5% для Qwen2-Audio, 68,1% для MiMo-Audio и 75,4% для GPT-Audio. Доля запросов, прошедших входную проверку, остаётся 96,3-100%. Для сравнения, AJailBench даёт FDR 31,2%, 10,8%, 25,3% и 24,6% на тех же четырёх моделях. Перенос между целями заметен, но неполон: случаи, найденные на Audio Flamingo 3, срабатывают на других моделях в 50,4-60,0% запусков.
Ограничения. И речь, и звуковые события синтетические, а опасность ответа определяет автоматический Llama Guard 3 без итоговой человеческой разметки. AdvBench охватывает известный набор текстовых намерений, но не моделирует весь спектр злоупотреблений голосом, музыкой и реальными записями. Высокий FDR зависит от конкретного протокола распознавания звука и судей; он показывает обнаруживаемость отказов, а не вероятность вреда в эксплуатации. Средний бюджет около 9-13 попыток также означает заметную стоимость проверки закрытых моделей.
Фишка из статьи. Поиск не просто перебирает больше формулировок: среднее число попыток различается между моделями, а почти идеальный проход текстового фильтра сохраняется даже при высокой частоте найденных звуковых уязвимостей.
| Модель-цель | FDR | Проход текстового фильтра | Среднее число попыток |
|---|---|---|---|
| Audio Flamingo 3 | 87,9% | 100,0% | 9,2 |
| Qwen2-Audio | 71,5% | 96,3% | 9,1 |
| MiMo-Audio | 68,1% | 100,0% | 12,5 |
| GPT-Audio | 75,4% | 98,5% | 11,4 |
Как это читать: опасный смысл действительно переносится через звуковой канал при внешне допустимом тексте. Более низкий FDR у MiMo-Audio не означает дешёвую проверку: именно для неё контроллеру требуется больше всего уточнений.