PG-SELD: физически направляемая локализация и обнаружение звуковых событий
PG-SELD использует редкую для нейросетевой локализации пару: одна и та же звуковая сцена доступна в свободном поле и с реверберацией помещения. Учитель видит физически более простую свободнополевую версию, а ученик по реверберирующему сигналу учится воспроизводить его внутренние признаки, не получая дополнительной нагрузки при применении.
Метод. Для синтетической сцены строятся согласованные сухая и реверберирующая записи. Свободнополевой учитель формирует цель дистилляции, а ученик сочетает обычный критерий SELD с расстоянием между признаками; расписание постепенно усиливает физически направляемую часть. Схема проверена на SELDNet, CNN-Conformer и HTS-AT, затем модели дообучены на 3,8 часа реальных данных STARSS23.
Результаты. У CNN-Conformer итоговая SELD-ошибка уменьшается с 0,384 до 0,361, F20 растёт с 45,4 до 50,5%, а угловая ошибка локализации падает с 17,5° до 15,4°. Для SELDNet ошибка снижается с 0,451 до 0,410, угловая — с 31,4° до 20,0°. У HTS-AT общий показатель улучшается с 0,388 до 0,373, но угловая ошибка ухудшается с 15,8° до 17,0°.
Ограничения. Нужны синтетические парные сцены, которые трудно получить для произвольной реальной акустики. Реальная дообучающая выборка мала, а часть выигрыша зависит от архитектуры; результат HTS-AT показывает, что составная SELD-метрика может улучшаться при ухудшении отдельной локализационной характеристики.
Фишка из статьи. Польза физического учителя уменьшается, когда обычное обучение уже охватывает много помещений. Это важный отрицательный результат: метод сильнее всего помогает при узком акустическом разнообразии, а не гарантирует одинаковую прибавку поверх любого набора данных.
| Вариант CNN-Conformer | SELD-ошибка ↓ | Что добавлено |
|---|---|---|
| Базовый | 0,350 | Обычное обучение |
| PGKD | 0,318 | Дистилляция от свободнополевого учителя |
| PGKD с расписанием | 0,306 | Постепенное усиление дистилляции |
Как это читать: расписание даёт дополнительный выигрыш поверх самой дистилляции, но величина эффекта относится к конкретной валидационной конфигурации и не отменяет архитектурно зависимых компромиссов на реальном тесте.