Безопасность Аудио LLM Устойчивость
arXiv cs.SD

Низкочастотные риски для аудио-языковых моделей

arXiv:2608.09158

Статья проверяет риск для больших аудио-языковых моделей: низкочастотные сигналы, почти не воспринимаемые человеком, могут попасть в микрофонный тракт и изменить ответ модели. Авторы предлагают controlled red-teaming метод ILL и защиту DRG, которая обнаруживает распределительный сдвиг и просит повторную запись. Работа важна как предупреждение: устойчивость аудио-LM нельзя оценивать только на слышимых шумах и обычных adversarial-примерах.

Метод. ILL описан как черноящичный тест, использующий низкочастотный шаблон и расписание активных интервалов; в обзоре важно не воспроизводить рецепт, а отметить проверяемый механизм. DRG работает как guard: детектирует низкочастотный сдвиг и условно запускает requery, после чего ответ строится по повторной записи. Проверяются задачи audio QA, распознавание речи, перевод речи и распознавание эмоций на нескольких моделях.

Результаты. На accuracy-задачах ILL снижает RAVDESS у StepAudio с 75.0% до 8.0%, у Qwen2.5 с 47.0% до 8.0%, у Gemini с 40.0% до 12.0%. На MMAU падения обычно меньше, но стабильны: например Qwen3 74.7% -> 59.3%, Gemini 73.7% -> 58.3%. При этом audible noise ratio для ILL на датасетах около 0.06-0.08%, тогда как у обычных шумовых baseline около 99%. DRG показывает F1 обнаружения до 99.00/97.49/98.48/89.69 по четырем наборам в одной из тренировочных схем и поднимает среднюю accuracy с 28.5% до 46.1% после clean reacquisition.

Ограничения. Авторы не проверяют реальную физическую атаку в публичной среде: они моделируют прием микрофоном на prerecorded benchmark audio. Влияние устройств, громкости, акустики помещения и положения источника остается открытым. Работа имеет dual-use характер, поэтому ее стоит читать как controlled safety evaluation и motivation для защит, а не как инструкцию по эксплуатации уязвимости.

Фишка из статьи. Главное не в том, что ILL всегда сильнее любого слышимого шума, а в сочетании низкой слышимости и устойчивого падения на разных моделях.

СравнениеЧислоЧто означает
StepAudio RAVDESS75.0% -> 8.0%Самое крупное падение, unseen target
Qwen3 MMAU74.7% -> 59.3%Минус 15 п.п. на смешанной аудио-задаче
Gemini RAVDESS40.0% -> 12.0%Падение переносится на закрытую модель
ANR ILL0.06-0.08%Энергия почти не попадает в слышимый диапазон
DRG после clean requery28.5% -> 46.1%Повторная запись частично восстанавливает задачу

Как это читать: для аудио-LM нужен отдельный robustness-протокол по низкочастотным и аппаратно-зависимым входам; обычные шумовые тесты не закрывают этот риск.

Оригинальная статья на arXiv