DSP Денойзинг Частотно-временной анализ
arXiv eess.AS

Bioacoustic denoising: частотно-временное восстановление ультразвуковых вокализаций

arXiv:2608.10054

Это не речевая статья в узком смысле, но она хорошо попадает в соседнюю DSP-зону поиска: частотно-временное восстановление слабых вокализаций из сильного шума. Авторы работают с ультразвуковыми сигналами мышей, где трудно получить чистую ground-truth запись, и синтезируют обучающие пары для U-Net денойзера. Интерес для speech/audio инженера - в связке комплексной маски, STFT, ridge tracking и проверки downstream-классификации.

Метод. Метод генерирует обучающий набор из чистых аналитических шаблонов вокализаций и реального шума, затем обучает U-Net предсказывать комплексную маску в спектральной области. Для оценки авторы смотрят не только SI-SDR, но и качество извлечения фундаментальной частоты через tfridge, harmonic partial tracking и классификацию паттернов BootSnap. В сравнении есть классические частотно-временные обработки: Wiener, CQT и multi-taper reassigned spectrogram.

Результаты. На синтетическом тесте средний SI-SDR на самом низком входном SNR растет с -10.17 до 16.52 дБ, а на высоком SNR - с 14.84 до 29.11 дБ. В задаче ridge tracking предложенный метод дает precision 96% и deviation 0.8±1.5 кГц, против 94% и 2.3±5.8 кГц у базового STFT tfridge. Для гармонических частичных тонов loss weighting меняет баланс: precision 93%, recall 83%, deviation 0.9±0.2 кГц; без weighting precision 97%, но recall только 66%.

Ограничения. Перенос на речь прямым считать нельзя: ультразвуковые вокализации мышей имеют другую структуру, другую полосу частот и другую перцептивную оценку. Данные для обучения синтетические, а прирост downstream-классификации частично связан с переобучением классификатора на денойзированных данных. На редких high-SNR случаях авторы сами отмечают ограничения, потому что модель обучалась не под этот режим.

Фишка из статьи. Самая интересная инженерная деталь - осознанный trade-off между точностью и полнотой для гармоник. Loss weighting ухудшает precision, но резко поднимает recall.

Метод для harmonic partialsPrecision / recallDeviation
Baseline CQT73% / 51%1.0±0.3 кГц
Wiener MTRS-CQT89% / 58%0.8±0.1 кГц
U-Net без loss weighting97% / 66%0.8±0.3 кГц
U-Net с loss weighting93% / 83%0.9±0.2 кГц

Как это читать: если downstream-задаче важнее не пропустить гармонику, небольшая потеря precision может быть оправдана. Это хороший пример того, как частотно-временной критерий нужно подгонять под конечный анализ сигнала, а не только под средний SI-SDR.

Оригинальная статья на arXiv