приватность речи акустические события удаление речи
arXiv cs.SD

Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living

arXiv:2609.02376

Акустические датчики в квартире полезны для распознавания действий, но вместе с ними записывают разговоры. Эта работа ставит перед обработчиком более строгую задачу, чем подавление шума: удалить речь до передачи данных, сохранив звуки быта, по которым определяется активность человека.

Метод. U-Net принимает секундные участки логарифмической мел-спектрограммы размером 96×64 и восстанавливает представление без речи. Обучение полностью синтетическое: LibriSpeech смешивается с событиями ESC-50 или SINS. После «межсетевого экрана» замороженные VGGish-признаки и SVM классифицируют активность, а отдельный детектор речи проверяет остаток голосового сигнала.

Результаты. На ESC-50 смесь со 100% добавленной речью снижает точность событий с 84% до 70%; предложенная обработка возвращает 73% точности и 81% полноты при нулевом срабатывании детектора речи. Denoiser сохраняет 67% точности, но оставляет 6,55% речевых кадров; SepFormer и Conv-TasNet удаляют хуже и одновременно сильнее портят события. На небольших реальных записях точность после обработки равна 76% против 78% у смеси.

Ограничения. Нулевое срабатывание детектора не доказывает неразборчивость: нет проверки распознавателем речи, прослушивания людьми или оценки утечки по вложениям диктора. Основной опыт синтетический, доверительные интервалы не приведены, а в реальном наборе речь занимала лишь 6,8% кадров. Не измерены задержка и быстродействие на граничном устройстве.

Фишка из статьи. Сравнение показывает, что обычные системы разделения источников плохо соответствуют цели «убрать голос, оставить событие».

Обработка смеси со 100% речиТочность событий, %Полнота событий, %Речь по детектору, % кадров
Без обработки706967,50
Denoiser67666,55
SepFormer515136,34
Conv-TasNet526047,21
Предложенный экран73810

Как это читать: здесь хорошая система должна двигаться сразу в двух противоположных направлениях. Предложенный вариант лучше сохраняет полезный класс звука и обнуляет выбранный детектор, но до доказанной речевой приватности ему недостаёт атакующей проверки.

Оригинальная статья на arXiv