Bioacoustic denoising: частотно-временное восстановление ультразвуковых вокализаций
Это не речевая статья в узком смысле, но она хорошо попадает в соседнюю DSP-зону поиска: частотно-временное восстановление слабых вокализаций из сильного шума. Авторы работают с ультразвуковыми сигналами мышей, где трудно получить чистую ground-truth запись, и синтезируют обучающие пары для U-Net денойзера. Интерес для speech/audio инженера - в связке комплексной маски, STFT, ridge tracking и проверки downstream-классификации.
Метод. Метод генерирует обучающий набор из чистых аналитических шаблонов вокализаций и реального шума, затем обучает U-Net предсказывать комплексную маску в спектральной области. Для оценки авторы смотрят не только SI-SDR, но и качество извлечения фундаментальной частоты через tfridge, harmonic partial tracking и классификацию паттернов BootSnap. В сравнении есть классические частотно-временные обработки: Wiener, CQT и multi-taper reassigned spectrogram.
Результаты. На синтетическом тесте средний SI-SDR на самом низком входном SNR растет с -10.17 до 16.52 дБ, а на высоком SNR - с 14.84 до 29.11 дБ. В задаче ridge tracking предложенный метод дает precision 96% и deviation 0.8±1.5 кГц, против 94% и 2.3±5.8 кГц у базового STFT tfridge. Для гармонических частичных тонов loss weighting меняет баланс: precision 93%, recall 83%, deviation 0.9±0.2 кГц; без weighting precision 97%, но recall только 66%.
Ограничения. Перенос на речь прямым считать нельзя: ультразвуковые вокализации мышей имеют другую структуру, другую полосу частот и другую перцептивную оценку. Данные для обучения синтетические, а прирост downstream-классификации частично связан с переобучением классификатора на денойзированных данных. На редких high-SNR случаях авторы сами отмечают ограничения, потому что модель обучалась не под этот режим.
Фишка из статьи. Самая интересная инженерная деталь - осознанный trade-off между точностью и полнотой для гармоник. Loss weighting ухудшает precision, но резко поднимает recall.
| Метод для harmonic partials | Precision / recall | Deviation |
|---|---|---|
| Baseline CQT | 73% / 51% | 1.0±0.3 кГц |
| Wiener MTRS-CQT | 89% / 58% | 0.8±0.1 кГц |
| U-Net без loss weighting | 97% / 66% | 0.8±0.3 кГц |
| U-Net с loss weighting | 93% / 83% | 0.9±0.2 кГц |
Как это читать: если downstream-задаче важнее не пропустить гармонику, небольшая потеря precision может быть оправдана. Это хороший пример того, как частотно-временной критерий нужно подгонять под конечный анализ сигнала, а не только под средний SI-SDR.