ASR Room acoustics Robustness
Room acoustics

Room for Error: комнатная акустика меняет оценку атак на ASR

8M evals

Эта работа важна для ASR robustness, потому что критикует привычную оценку adversarial audio в цифровом домене. Авторы показывают, что атака, источник речи, victim microphone и attacker speaker находятся в разных точках комнаты, поэтому одного SNR недостаточно: stealth у источника и interference у жертвы могут сильно расходиться. Вместо новой атаки статья дает high-throughput симуляционный framework для over-the-air acoustic attacks и проверяет его на Whisper и wav2vec.

Метод

Фреймворк моделирует propagation через room impulse responses и использует image source method как компромисс между wave-based accuracy и скоростью. Вводится Dual-Form SNR: отдельно source-side SNR, связанный с detectability, и victim-side SNR, связанный с атакующим влиянием на ASR. Это важно, потому что perturbation может быть тихой в точке контроля источника, но достаточно сильной в точке микрофона жертвы.

Авторы проводят более 8 million adversarial evaluations и сравнивают naive identity/digital approximations, blind room distribution, approximate и oracle-known settings. Модели включают Whisper Tiny, Whisper Base и wav2vec Base; атаки FGSM и PGD.

Результаты

  • Корреляция SNR-WER в purely digital setup равна r=-0.62, но в acoustic noisy setup падает до r=-0.07; цифровой SNR плохо объясняет физическую ситуацию.
  • Без активного attacker natural acoustic filtering уже дает baseline WER 69.8-86.9% для Whisper-Base в physical validation setup.
  • В симуляции wav2vec Base с PGD и known room достигает относительного WER increase +94.5% против baseline.
  • Whisper Base PGD при oracle-known room дает +30.4%, а transfer Whisper Tiny→Base PGD — +31.7%.
  • Статья показывает SNR decoupling: атака с victim SNR около 20 dB может выглядеть как source SNR около 40 dB в monitor point.

Ограничения

Это в первую очередь evaluation methodology, а не deployable defense и не новая production attack. Image source method хорошо масштабируется и дифференцируем, но не моделирует diffraction и часть сложной геометрии. Физическая валидация важна, но реальные помещения, speaker directivity, microphone AGC, arrays и VAD frontends могут менять итоговые числа.

Фишка из статьи. Главная фишка — разрыв между source SNR и victim SNR. Одна и та же perturbation может быть “тихой” там, где ее контролирует источник, и разрушительной там, где слушает ASR microphone.

Модель/атакаBaseline WERKnown-room WERRelative change
Whisper Tiny / PGD0.2100.265+26.0%
Whisper Base / PGD0.1350.176+30.4%
wav2vec Base / PGD0.1930.375+94.5%
Transfer Tiny→Base / PGD0.1360.179+31.7%

Как это читать: для robustness testing ASR нельзя ограничиваться digital perturbation и одним SNR числом. Если система работает в комнате, метрика атаки должна учитывать геометрию, RIR и разные точки наблюдения.

Оригинальная статья на arXiv