Privacy Распознавание речи DSP
Speech privacy

Privacy речи: цифры переживают часть обфускации

DRER

Эта статья полезно смещает оценку privacy речи от общего WER к конкретной чувствительной сущности - цифрам. Авторы проверяют, насколько три простые DSP-обфускации защищают spoken digits от informed attackers: общего распознавания речи и отдельного digit classifier. Главный вывод неприятный: метод может портить LibriSpeech WER, но все равно оставлять цифры распознаваемыми в более реалистичной задаче.

Метод. Проверяются temporal smoothing with subsampling, resampling и sound shredding. Для атаки используются ASR-модели, дообученные под конкретную обфускацию, и простой DNN на средних и дисперсиях 13 MFCC с тремя fully connected слоями по 128 нейронов, всего 37 770 параметров. Оценка идет на AudioMNIST и Google Speech Commands digits, отдельно для одиночных цифр и 10-значных последовательностей с паузами 100, 200 и 500 мс.

Результаты. На LibriSpeech test-clean исходный WER равен 2.34%, temporal smoothing дает от 5.97% при 125 мс до 102.76% при 500 мс, resampling - 27.55-86.91%, shredding - 102.60-153.85%. Но на цифрах авторы вводят DRER, потому что WER искажает картину вставками. Fuzzy matching снижает DRER в среднем на 11.08% для одиночных цифр и только на 1.37% для concatenated digits, а при smoothing с 500 мс DRER для последовательностей может быть до 62.54% ниже, чем WER на LibriSpeech.

Ограничения. Цифры ограничены классами zero-nine, английскими наборами и oracle boundaries для DNN на последовательностях; реальному атакующему еще надо найти границы цифр через VAD или выравнивание. Обфускации простые и дешевые, поэтому вывод нельзя переносить на сильные neural privacy методы. Тем не менее работа хорошо показывает, что общий WER не является достаточной privacy-метрикой.

Фишка из статьи. Самое важное - разрыв между "сломали read speech" и "защитили цифры". Некоторые настройки делают LibriSpeech почти нечитаемым, но task-specific атака все еще извлекает сущность.

Обфускация на LibriSpeechПараметрWER
нетOriginal2.34%
Temporal smoothing125 / 250 / 500 мс5.97% / 32.90% / 102.76%
Resampling800 / 500 / 320 Гц27.55% / 52.15% / 86.91%
Shredding500 / 200 / 100 мс102.60% / 125.30% / 153.85%

Как это читать: WER выше 100% возможен из-за вставок, но это не гарантирует privacy для чисел. Для узкой сущности нужна отдельная метрика вроде DRER и informed attacker, иначе защита будет казаться сильнее, чем она есть.

Оригинальная статья на arXiv