PI-SCAN: перестановочно-инвариантная частотно-временная сегментация перекрывающихся помех
PI-SCAN решает смежную с разделением аудио задачу: на логарифмической спектрограмме нужно одновременно найти до шести перекрывающихся радиопомех, выделить маску каждой и оценить её параметры. Архитектура интересна как перестановочно-инвариантный шаблон для частотно-временных объектов, но эксперименты также показывают жёсткий конфликт между детекцией и полной характеризацией.
Метод. Спектрограмма мощности комплексного IQ-сигнала преобразуется в шесть неупорядоченных слотов. Для каждого слот предсказывает наличие объекта, тип, центральную частоту, полосу, мощность RSSI, BOC-модуляцию и бинарную маску. Венгерское сопоставление связывает слоты с источниками, а общая многозадачная функция обучает все головы совместно.
Результаты. Полная семизадачная модель получает F1 74,8%, точность типа 97,3%, BOC 98,4% и средние абсолютные ошибки 1,29 МГц по центральной частоте, 2,54 МГц по полосе и 3,19 дБ по RSSI. Удаление RSSI повышает F1 до 83,5% и точность числа источников с 50,6% до 61,7%. Только наличие, тип и маска дают F1 91,1% при точности типа 98,7%.
Ограничения. Данные синтетические: трассировка лучей в одной промышленной среде, 94 конфигурации и шесть классов. Фиксированные шесть слотов задают верхнюю границу числа источников. Вход содержит мощность спектрограммы без явной фазы, а перенос на реальные приборные искажения и другие частотные диапазоны не проверен.
Фишка из статьи. Добавление физически полезной цели RSSI ухудшает не только свою ошибку, но и обнаружение источников через общее представление и назначение слотов. Даже отдельно хорошие альтернативные функции потерь в совместной модели снижают F1 до 65,9%, поэтому многозадачность здесь нельзя настраивать по каждой голове независимо.
| Число перекрывающихся источников | Точность | Полнота | F1 | IoU маски |
|---|---|---|---|---|
| 2 | 0,95 | 0,93 | 93,9% | 0,80 |
| 3 | 0,93 | 0,86 | 89,2% | 0,74 |
| 4 | 0,90 | 0,82 | 85,7% | 0,67 |
| 5 | 0,86 | 0,75 | 80,3% | 0,61 |
| 6 | 0,82 | 0,69 | 74,6% | 0,55 |
Как это читать: при росте плотности модель прежде всего пропускает слабые источники, а не создаёт ложные. Плавное падение полноты и IoU показывает, где фиксированные слоты и общие признаки начинают конкурировать.