Never Stop Speaking: DoS-риск для речевых языковых моделей
Статья относится к безопасности речевых языковых моделей: авторы показывают, что небольшой adversarial-аудиосигнал может заставлять модель отвечать чрезмерно долго и тратить больше ресурсов. Это не про распознавание одной команды, а про отказ в обслуживании через генеративное поведение speech-to-text-to-text модели. Техническая ценность работы - в формализации риска и сравнении устойчивости нескольких открытых аудио-языковых моделей.
Метод. Атака оптимизирует аудио так, чтобы сохранить семантику входа, но повысить вероятность продолжительной генерации и затруднить остановку ответа. В статье сравниваются LFM2.5-Audio-1.5B, Fun-Audio-Chat-8B и Qwen2-Audio-7B на 100 чистых аудиофрагментах. Рассматриваются метрики attack success rate, длина ответа, использование памяти и качество ответа; также обсуждаются простые защитные преобразования вроде ресэмплинга, фильтрации и добавления шума.
Результаты. Для Liquid Audio attack success rate растет с 0.00 на чистом входе до 0.87 у предложенного метода, а средняя длина ответа - со 198.34 до 941.88 токена. Для FunAudioChat успех 0.84, длина ответа 920.24 токена против 213.57 на чистом входе. В абляции на FunAudioChat полная система с VAD дает ASR 0.84, длину 950.24 и quality 4.75; удаление EOS-ориентированной части резко снижает успех до 0.12 и длину до 289.43.
Ограничения. Работа dual-use, поэтому практический интерес должен быть в защите и тестировании устойчивости, а не в воспроизведении атаки. Защитные преобразования могут разрушать часть возмущения, но сами ухудшают качество речи или добавляют вычислительную цену. Модели и набор данных ограничены, а настоящие голосовые продукты имеют дополнительные лимиты, фильтры и серверные политики.
Фишка из статьи. Хорошая инженерная деталь - разные компоненты функции потерь отвечают за разные свойства атаки: длину, остановку и сохранение смысла.
| Вариант абляции | Успех атаки | Длина ответа / качество |
|---|---|---|
| Полная система + VAD | 0.84 | 950.24 токена, quality 4.75 |
| Без EOS-компонента | 0.12 | 289.43 токена, quality 4.71 |
| Без length-компонента | 0.79 | 867.65 токена, quality 4.70 |
| Без semantic-компонента | 0.83 | 937.81 токена, quality 3.92 |
Как это читать: опасность не только в том, что ответ становится длинным. Если убрать семантическое ограничение, атака остается сильной, но качество падает; значит, защита должна проверять и ресурсное поведение, и смысловую адекватность ответа.