Phase spectrogram: ориентация головы говорящего с одного mic array
Эта статья хорошо попадает в phase-aware audio: авторы оценивают ориентацию головы говорящего не по видео, а по многоканальному аудио с одного microphone array. Главная идея — использовать phase spectrogram STFT как богатый признак направленности, вместо того чтобы сводить пространственную информацию к ITD/ILD.
Метод. Модель получает фазовые спектрограммы по каналам массива и обрабатывает их CNN-блоками, рекуррентным слоем и self-attention. Задача — регрессия угла ориентации головы; отдельно проверяются сырые waveform-признаки, классические ITD/ILD и phase-of-STFT. В статье также есть personalization: добавление информации о комнате и/или говорящем, чтобы учесть индивидуальную диаграмму излучения речи и акустику помещения.
Результаты. Phase-of-STFT сильно выигрывает у raw audio и ITD/ILD: в anechoic условии MAE 28.4° против 56.9° у raw audio и 47.7° у ITD/ILD; в clean reverberant условии 19.9° против 44.8° и 52.7°. При шуме 0–10 dB phase-признак дает 29.5°, тогда как raw audio уходит к 75.1°, а ITD/ILD к 82.8°. С personalization MAE снижается с 19.9° без адаптации до 11.3° при speaker+room conditioning. На реальном датасете pretraining на симуляции плюс fine-tuning дает 73.2% accuracy против 65.4% у DoV baseline.
Ограничения. Хорошие результаты зависят от геометрии массива, симуляции и availability personalization-сигналов. Реальный benchmark использует дискретные ориентации, поэтому accuracy не полностью заменяет непрерывную ошибку в градусах. Для движущихся говорящих, сильной реверберации и других массивов потребуется отдельная проверка.
Фишка из статьи. Самый интересный результат — умеренная реверберация не ломает фазовую модель, а наоборот делает phase spectrogram заметно сильнее простых ITD/ILD.
| Признак | Anechoic MAE | Clean reverb MAE | SNR 10–20 dB | SNR 0–10 dB |
|---|---|---|---|---|
| Raw audio + CNN | 56.9° | 44.8° | 63.7° | 75.1° |
| ITD & ILD | 47.7° | 52.7° | 74.4° | 82.8° |
| Phase of STFT | 28.4° | 19.9° | 25.6° | 29.5° |
| Phase + speaker+room personalization | не указано | 11.3° | не указано | не указано |
Как это читать: фазовая спектрограмма несет не только delay-like информацию, но и устойчивый spatial fingerprint, связанный с излучением речи и комнатой. Это хороший пример того, где phase-aware представление дает практический выигрыш над более “сжатой” DSP-фичей.