Фаза Spatial audio STFT
Фаза и пространственное аудио

RIPPLE: генерировать многоканальную фазу, а не восстанавливать ее

Delta SA 0.319

RIPPLE разбирает проблему, которую легко не заметить в задачах пространственного аудио и улучшения сигнала: хорошая амплитудная спектрограмма еще не означает физически согласованную многоканальную волну. Авторы показывают, что независимое восстановление фазы по каналам через Griffin-Lim, вокодер или латентный декодер может сохранить малую ошибку формы волны, но разрушить межканальные фазовые соотношения, по которым кодируются направление и поляризация. Главный ход - не считать фазу постобработкой, а генерировать ее отдельным потоком с явной потерей по межканальной фазовой разности.

Метод. Модель работает в два этапа. Сначала поток предсказывает целевую лог-амплитуду, затем из предсказанной амплитуды и исходной фазы строится source-informed prior на базе Griffin-Lim, который используется только как начальная точка. После этого rectified flow уточняет фазу на окружности, а обучение включает не только фазовую ошибку, но и IPD loss, то есть штраф за неправильные межканальные фазовые разности. Поэтому модель оптимизируется именно на связность каналов, а не только на поканальное качество.

Результаты. На Spatial LibriSpeech авторы используют 658.7 часа FOA-речи, более 8000 синтетических комнат, 79 232 обучающих и около 111 тыс. тестовых directional pairs. Полная RIPPLE получает Wave L2 0.019, Phase L2 0.619 и Delta Spatial-Angle 0.319; вариант RIPPLE(GL), где остается восстановление Griffin-Lim без фазового потока, имеет близкую Wave L2 0.022, но Delta Spatial-Angle 1.586, то есть почти теряет направление. В сейсмическом переносе та же идея снижает ошибку S-wave polarization до 33.81 град. против 51.87 град. у RIPPLE(GL) и случайного ожидания 57.3 град.

Ограничения. Это не универсальная система улучшения речи: постановка - source-to-target translation, а не генерация звука с нуля и не реальное шумоподавление. Spatial LibriSpeech использует синтетические комнаты, субъективной оценки пространственного аудио нет, а метрики вроде Delta Spatial-Angle важны для физической связности, но не напрямую заменяют слуховой тест. Тем не менее для phase-aware enhancement статья полезна как сильный аргумент, что многоканальную фазу нельзя оставлять на обычную поканальную реконструкцию.

Фишка из статьи. Самый показательный результат - oracle magnitude не спасает фазу. Даже если Griffin-Lim дать настоящие целевые амплитуды, форма волны получается хорошей, но азимут остается почти на случайном уровне.

ВариантWave L2 ниже лучшеPhase L2 ниже лучшеL1 theta ниже лучшеDelta Spatial-Angle ниже лучше
Griffin-Lim с GT magnitudes0.013-1.567-
RIPPLE(GL)0.0221.0721.5911.586
RIPPLE0.0190.6190.2430.319

Как это читать: Wave L2 почти не отличает хорошую пространственную волну от поканально восстановленной. Ошибка L1 theta около 1.571 соответствует случайному азимуту, поэтому строки Griffin-Lim и RIPPLE(GL) показывают провал именно физической межканальной структуры; RIPPLE исправляет это не за счет амплитуды, а за счет learned phase flow и IPD loss.

Оригинальная статья на arXiv