Акустическая утечка клавиатуры как задача распознавания звуков
Статья относится к аудио-приватности: авторы показывают, что текст можно восстанавливать по звукам клавиатуры без заранее размеченных записей целевого устройства. Для речевых технологий это соседняя, но важная тема: аудиосигнал в звонке или помещении может нести не только речь, но и побочные акустические признаки. Работа ценна как оценка риска и как напоминание, что шумоподавление и аудиофильтрация влияют не только на комфорт, но и на безопасность.
На высоком уровне pipeline превращает поток звука в последовательность событий нажатий, группирует похожие звучания, связывает кластеры с символами через языковую модель и итеративно уточняет соответствия без размеченного target-device набора. Авторы используют character-level BERT и LLM-коррекцию как языковую часть, а акустическая часть опирается на признаки отдельных нажатий и кластеризацию. В обзоре важно не воспроизводить процедуру как инструкцию атаки, а зафиксировать, насколько мало наблюдений оказалось достаточно в их условиях.
В close-proximity сценарии метод достигает 99.00% Levenshtein score уже на 100 наблюдаемых нажатиях и 99.33% на 150; до self-feedback на 100 нажатиях было только 47.00%, то есть уточнение дает +52 percentage points. Для сравнения, HMM-бейзлайн добирается до 97.27% примерно на 1200 нажатиях, dictionary-based метод - до 97.13% на 350. При записи с расстояния около 3 м на том же столе большинство платформ выходят выше 90% при 150-250 нажатиях. Через стену MacBook превышает 95% после 150 нажатий, HP требует 150-200, Dell - около 200-250.
Ограничения делают результат менее универсальным, но не безобидным. Эксперименты используют ограниченный набор символов, контролируемые тексты и предполагают достаточно надежное выделение событий нажатия; высокая скорость печати, перекрытия и сильное подавление шума могут снижать применимость. Для онлайн-встреч результат зависит от платформы и устройства: Zoom на MacBook превышает 90% уже при 150 нажатиях, но для некоторых сочетаний нужно 250 и больше. Авторы также обсуждают смягчения: шумоподавление, акустическое демпфирование и снижение передачи клавиатурных звуков в конференциях.
Фишка из статьи. Самая тревожная деталь - не пиковая точность рядом с клавиатурой, а то, что атака сохраняется в нескольких каналах записи, включая онлайн-встречи.
| Сценарий | Сколько наблюдений | Результат |
|---|---|---|
| Близкая запись смартфоном | 100 нажатий | 99.00% Levenshtein score |
| Близкая запись смартфоном | 150 нажатий | 99.33% Levenshtein score |
| Расстояние около 3 м на столе | 150-250 нажатий | Большинство платформ выше 90% |
| Через стену, contact microphone | 150-250 нажатий | Высокая точность для нескольких ноутбуков |
| Zoom / Teams / Meet | 150-250+ нажатий | Часто выше 90%, но зависит от устройства и suppression |
Как это читать: современные аудиоканалы могут сохранять структурную информацию о побочных событиях даже после обычной обработки. Для защитных систем это аргумент в пользу более агрессивного подавления неречевых transient-звуков в конференциях, особенно когда микрофон открыт во время набора текста.