Phase Mic array Orientation
Phase-aware audio

Phase spectrogram: ориентация головы говорящего с одного mic array

MAE 11.3°

Эта статья хорошо попадает в phase-aware audio: авторы оценивают ориентацию головы говорящего не по видео, а по многоканальному аудио с одного microphone array. Главная идея — использовать phase spectrogram STFT как богатый признак направленности, вместо того чтобы сводить пространственную информацию к ITD/ILD.

Метод. Модель получает фазовые спектрограммы по каналам массива и обрабатывает их CNN-блоками, рекуррентным слоем и self-attention. Задача — регрессия угла ориентации головы; отдельно проверяются сырые waveform-признаки, классические ITD/ILD и phase-of-STFT. В статье также есть personalization: добавление информации о комнате и/или говорящем, чтобы учесть индивидуальную диаграмму излучения речи и акустику помещения.

Результаты. Phase-of-STFT сильно выигрывает у raw audio и ITD/ILD: в anechoic условии MAE 28.4° против 56.9° у raw audio и 47.7° у ITD/ILD; в clean reverberant условии 19.9° против 44.8° и 52.7°. При шуме 0–10 dB phase-признак дает 29.5°, тогда как raw audio уходит к 75.1°, а ITD/ILD к 82.8°. С personalization MAE снижается с 19.9° без адаптации до 11.3° при speaker+room conditioning. На реальном датасете pretraining на симуляции плюс fine-tuning дает 73.2% accuracy против 65.4% у DoV baseline.

Ограничения. Хорошие результаты зависят от геометрии массива, симуляции и availability personalization-сигналов. Реальный benchmark использует дискретные ориентации, поэтому accuracy не полностью заменяет непрерывную ошибку в градусах. Для движущихся говорящих, сильной реверберации и других массивов потребуется отдельная проверка.

Фишка из статьи. Самый интересный результат — умеренная реверберация не ломает фазовую модель, а наоборот делает phase spectrogram заметно сильнее простых ITD/ILD.

ПризнакAnechoic MAEClean reverb MAESNR 10–20 dBSNR 0–10 dB
Raw audio + CNN56.9°44.8°63.7°75.1°
ITD & ILD47.7°52.7°74.4°82.8°
Phase of STFT28.4°19.9°25.6°29.5°
Phase + speaker+room personalizationне указано11.3°не указаноне указано

Как это читать: фазовая спектрограмма несет не только delay-like информацию, но и устойчивый spatial fingerprint, связанный с излучением речи и комнатой. Это хороший пример того, где phase-aware представление дает практический выигрыш над более “сжатой” DSP-фичей.

Оригинальная статья на arXiv