Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living
Акустические датчики в квартире полезны для распознавания действий, но вместе с ними записывают разговоры. Эта работа ставит перед обработчиком более строгую задачу, чем подавление шума: удалить речь до передачи данных, сохранив звуки быта, по которым определяется активность человека.
Метод. U-Net принимает секундные участки логарифмической мел-спектрограммы размером 96×64 и восстанавливает представление без речи. Обучение полностью синтетическое: LibriSpeech смешивается с событиями ESC-50 или SINS. После «межсетевого экрана» замороженные VGGish-признаки и SVM классифицируют активность, а отдельный детектор речи проверяет остаток голосового сигнала.
Результаты. На ESC-50 смесь со 100% добавленной речью снижает точность событий с 84% до 70%; предложенная обработка возвращает 73% точности и 81% полноты при нулевом срабатывании детектора речи. Denoiser сохраняет 67% точности, но оставляет 6,55% речевых кадров; SepFormer и Conv-TasNet удаляют хуже и одновременно сильнее портят события. На небольших реальных записях точность после обработки равна 76% против 78% у смеси.
Ограничения. Нулевое срабатывание детектора не доказывает неразборчивость: нет проверки распознавателем речи, прослушивания людьми или оценки утечки по вложениям диктора. Основной опыт синтетический, доверительные интервалы не приведены, а в реальном наборе речь занимала лишь 6,8% кадров. Не измерены задержка и быстродействие на граничном устройстве.
Фишка из статьи. Сравнение показывает, что обычные системы разделения источников плохо соответствуют цели «убрать голос, оставить событие».
| Обработка смеси со 100% речи | Точность событий, % | Полнота событий, % | Речь по детектору, % кадров |
|---|---|---|---|
| Без обработки | 70 | 69 | 67,50 |
| Denoiser | 67 | 66 | 6,55 |
| SepFormer | 51 | 51 | 36,34 |
| Conv-TasNet | 52 | 60 | 47,21 |
| Предложенный экран | 73 | 81 | 0 |
Как это читать: здесь хорошая система должна двигаться сразу в двух противоположных направлениях. Предложенный вариант лучше сохраняет полезный класс звука и обнуляет выбранный детектор, но до доказанной речевой приватности ему недостаёт атакующей проверки.