Clean-label Backdoor DDPG
Speech robustness

DRL-CLBA: clean-label backdoor attack для speech classification через DDPG

ASR 91.02%

DRL-CLBA рассматривает более сложный threat model для speech classifiers: clean-label backdoor, где poisoned samples сохраняют исходные labels и поэтому труднее ловятся ручной проверкой разметки. Авторы формулируют оптимизацию poisoned samples как Markov decision process и используют DDPG reinforcement learning, чтобы двигать target samples к trigger-bearing anchors в latent feature space.

Метод. Attack использует deep audio steganography для embedding sample-specific triggers и feature-collision objective: poisoned target sample должен приблизиться к anchor points от trigger-bearing source audio, но сохранить semantic принадлежность своему clean label. Reward содержит feature collision, perturbation constraint и semantic preservation. После poisoning victim model обучается обычным supervised образом, без изменения loss и hyperparameters.

Результаты. Эксперименты покрывают KWS, speaker verification и speech emotion recognition; модели: ERes2Net, KWS-ViT, EAT-S и CAM++. На SCD KWS DRL-CLBA достигает ASR 88.12/85.78/91.02/87.45% при benign accuracy 93.76/93.95/94.89/93.60. В SV на AISHELL3-50 ASR достигает 92.14 для ERes2Net и 90.78 для KWS-ViT; на VoxCeleb1-50 — 89.52 и 88.12. После 40 fine-tuning epochs авторы сообщают, что ASR остается около 60% на ERes2Net и выше 65% на EAT-S при clean accuracy выше 92%.

Ограничения. Это attack paper с synthetic poisoning setup, поэтому практическая опасность зависит от доступа атакующего к training pipeline. Многие defense claims основаны на выбранных defense baselines и конкретных datasets; для production wake-word, speaker ID и emotion systems нужны отдельные threat-model checks. Кроме того, clean-label атаки требуют аккуратного контроля качества poisoned audio.

Фишка из статьи. Абляция reward показывает, что высокий ASR сам по себе не главный показатель: без perturbation constraint ASR остается высоким, но benign accuracy заметно падает, а без semantic preservation падает уже ASR.

Reward termsМетрикаERes2NetKWS-ViTEAT-SCAM++
allASR88.1285.7891.0287.45
allBA93.7693.9594.8993.60
w/o perturbation constraintASR89.1486.5791.0488.14
w/o perturbation constraintBA90.1889.4791.4790.85
w/o semantic preservationASR74.7878.8785.4182.14

Как это читать: perturbation constraint — это не про максимальный ASR, а про stealth/clean behavior. Если его убрать, атака становится чуть сильнее по ASR, но clean accuracy падает на 3–4 пункта, что повышает шанс обнаружения или деградации сервиса.

Оригинальная статья на arXiv