Robust SSANC: активное шумоподавление hearables при ошибке secondary path
Статья полезна для речевых hearables: пространственно-селективное активное шумоподавление должно глушить шум с одних направлений и сохранять речь с других, но на практике secondary path от динамика до внутреннего микрофона меняется от пользователя к пользователю и от посадки устройства. Обычная оптимизация под один оцененный путь может стать нестабильной или давать большой разброс качества. Авторы предлагают robust soft-constrained SSANC: выбирать один фильтр, минимизируя среднюю стоимость по набору возможных secondary paths.
Метод остается в классической DSP-постановке. Есть K внешних микрофонов, внутренний error microphone, управляющий фильтр w и secondary path g. Целевая функция балансирует снижение шума и искажение желаемой речи через параметр mu: большое mu сильнее защищает речь, малое ведет себя ближе к обычному ANC. Вместо фильтра под один путь авторы строят набор из J=44 secondary paths, полученных через human-to-KEMAR relative frequency responses, и оптимизируют robust filter по усредненной функции стоимости.
Экспериментальная сцена конкретная: реверберационная комната 7 x 6 x 2.7 м, T60 примерно 370 мс, желаемая речь с 0 градусов, две шумовые составляющие, средний leakage SNR во внутренних микрофонах -7.0 дБ. Для mismatched case рассматриваются J(J-1)=1892 сценария несовпадения secondary path. На графиках matched case с oracle path дает лучшую среднюю noise reduction, PESQ improvement и ESTOI improvement, но mismatched case имеет заметно более широкий разброс; для noise reduction 5-95 percentile interval доходит примерно до 6 дБ. Robust case немного уступает oracle по среднему, но сильно сужает разброс, особенно по noise reduction и PESQ improvement. Реализация на dSPACE с KEMAR подтверждает те же тенденции.
Ограничения в том, что работа не дает универсальной таблицы чисел для всех метрик: ключевые результаты показаны кривыми по mu. Сцена, устройство и набор variations фиксированы, поэтому перенос на другие формы ушного устройства, другие комнаты и другие типы речи требует проверки. Это также не speech enhancement в нейросетевом смысле, а активное управление акустическим полем, где качество зависит от измерения путей, задержек и устойчивости фильтра.
Фишка из статьи. Здесь ценен не максимум шумоподавления, а уменьшение риска из-за неверного secondary path: robust filter намеренно жертвует частью oracle-качества ради стабильности на множестве посадок.
| Условие | Что оптимизируется | Что видно в результатах | Конкретные данные |
|---|---|---|---|
| Matched | Фильтр под истинный path | Лучшее среднее качество, узкий разброс | Oracle-сценарий |
| Mismatched | Фильтр под один неверный path | Сильный разброс noise reduction и PESQ | 44 x 43 = 1892 mismatch-сценария |
| Robust | Средняя стоимость по набору paths | Среднее чуть ниже oracle, но разброс заметно уже | J=44 secondary paths, leakage SNR -7.0 дБ |
Как это читать: в hearables важнее не только выиграть лучший случай, но и не провалиться при другой посадке устройства. Работа показывает, что оптимизация по множеству secondary paths делает поведение фильтра более предсказуемым, даже если абсолютный максимум у oracle-решения выше.