SAGE: EEG-наведение для выделения говорящего при переключениях
SAGE занимается сложным вариантом выделения целевого говорящего: слушатель может переключать внимание между двумя голосами внутри одного trial, а EEG-сигнал шумный и запаздывает относительно реального внимания. Обычные EEG-guided TSE системы часто выбирают говорящего жестко и получают артефакты в момент переключения. Авторы предлагают мягкое переключение с учетом неопределенности и компенсацией нейронной задержки.
Метод. Сначала robust separator генерирует два кандидатных речевых потока. Затем EEG attention regulation module оценивает, какой поток сейчас соответствует вниманию слушателя, и выдает smooth gating weights вместо резкого выбора. В модуле есть switch-aware soft gating, latency-compensated alignment с learnable temporal shifts и uncertainty-driven conservative strategy: когда EEG ненадежен, модель переключается осторожнее и подавляет jitter. Потери включают восстановление речи, switch-aware TV regularization и uncertainty-weighted smoothness.
Результаты. Датасет содержит 18 здоровых Mandarin-speaking участников 18-27 лет, 64 EEG электрода, частоту 500 Гц, затем downsampling до 128 Гц и band-pass 0.1-45 Гц. Два пространственных говорящих, мужской и женский, подаются с азимутов +90° и -90° в звукоизолированной комнате при 65 dB SPL. SAGE получает SI-SDR 8.67 dB, STOI 88.24% и average switch latency 2.04 s. Это лучше BASEN 4.02 dB / 74.83% / 2.93 s, NeuroHeed 4.96 / 79.57 / 2.81, NeuroSpex+ 6.21 / 82.84 / 2.56 и M3ANet 7.13 / 84.30 / 2.37.
Ограничения. Сценарий контролируемый: два говорящих, фиксированные азимуты, наушники, звукоизолированная комната и молодые здоровые участники. Нет проверки с большим числом говорящих, реальной комнатной реверберацией, движением головы или портативной EEG. Average switch latency 2.04 s все еще велика для естественного разговора. Разбиение train/validation/test делается внутри данных каждого участника, поэтому межпользовательский перенос надо оценивать отдельно.
Фишка из статьи. Абляция показывает, что latency alignment важнее всего для точности переключения, а uncertainty strategy сильнее влияет на качество извлечения, чем на задержку. Это хорошая инженерная декомпозиция: разные модули чинят разные failure modes.
| Вариант | SI-SDR | STOI | Switch ACC | ASL |
|---|---|---|---|---|
| SAGE full | 8.67 dB | 88.24% | 78.02% | 2.04 s |
| Без soft gating | 8.12 dB | 87.35% | 73.58% | 2.35 s |
| Без latency alignment | 7.86 dB | 86.02% | 71.34% | 2.58 s |
| Без uncertainty strategy | 7.41 dB | 85.18% | 74.26% | меньше влияет на delay |
| Без всех модулей | 6.73 dB | 83.80% | 66.47% | не указано в таблице |
Как это читать: удаление latency alignment хуже всего бьет по ACC и ASL, потому что EEG-решение приходит с физиологическим лагом. Удаление uncertainty strategy сильнее снижает SI-SDR, значит при сомнительном EEG модель начинает чаще пропускать чужой голос или создавать артефакты.