DRL-CLBA: clean-label backdoor attack для speech classification через DDPG
DRL-CLBA рассматривает более сложный threat model для speech classifiers: clean-label backdoor, где poisoned samples сохраняют исходные labels и поэтому труднее ловятся ручной проверкой разметки. Авторы формулируют оптимизацию poisoned samples как Markov decision process и используют DDPG reinforcement learning, чтобы двигать target samples к trigger-bearing anchors в latent feature space.
Метод. Attack использует deep audio steganography для embedding sample-specific triggers и feature-collision objective: poisoned target sample должен приблизиться к anchor points от trigger-bearing source audio, но сохранить semantic принадлежность своему clean label. Reward содержит feature collision, perturbation constraint и semantic preservation. После poisoning victim model обучается обычным supervised образом, без изменения loss и hyperparameters.
Результаты. Эксперименты покрывают KWS, speaker verification и speech emotion recognition; модели: ERes2Net, KWS-ViT, EAT-S и CAM++. На SCD KWS DRL-CLBA достигает ASR 88.12/85.78/91.02/87.45% при benign accuracy 93.76/93.95/94.89/93.60. В SV на AISHELL3-50 ASR достигает 92.14 для ERes2Net и 90.78 для KWS-ViT; на VoxCeleb1-50 — 89.52 и 88.12. После 40 fine-tuning epochs авторы сообщают, что ASR остается около 60% на ERes2Net и выше 65% на EAT-S при clean accuracy выше 92%.
Ограничения. Это attack paper с synthetic poisoning setup, поэтому практическая опасность зависит от доступа атакующего к training pipeline. Многие defense claims основаны на выбранных defense baselines и конкретных datasets; для production wake-word, speaker ID и emotion systems нужны отдельные threat-model checks. Кроме того, clean-label атаки требуют аккуратного контроля качества poisoned audio.
Фишка из статьи. Абляция reward показывает, что высокий ASR сам по себе не главный показатель: без perturbation constraint ASR остается высоким, но benign accuracy заметно падает, а без semantic preservation падает уже ASR.
| Reward terms | Метрика | ERes2Net | KWS-ViT | EAT-S | CAM++ |
|---|---|---|---|---|---|
| all | ASR | 88.12 | 85.78 | 91.02 | 87.45 |
| all | BA | 93.76 | 93.95 | 94.89 | 93.60 |
| w/o perturbation constraint | ASR | 89.14 | 86.57 | 91.04 | 88.14 |
| w/o perturbation constraint | BA | 90.18 | 89.47 | 91.47 | 90.85 |
| w/o semantic preservation | ASR | 74.78 | 78.87 | 85.41 | 82.14 |
Как это читать: perturbation constraint — это не про максимальный ASR, а про stealth/clean behavior. Если его убрать, атака становится чуть сильнее по ASR, но clean accuracy падает на 3–4 пункта, что повышает шанс обнаружения или деградации сервиса.