Разделение речи EEG SI-SDR
Выделение целевого говорящего

SAGE: EEG-наведение для выделения говорящего при переключениях

SI-SDR 8.67 dB

SAGE занимается сложным вариантом выделения целевого говорящего: слушатель может переключать внимание между двумя голосами внутри одного trial, а EEG-сигнал шумный и запаздывает относительно реального внимания. Обычные EEG-guided TSE системы часто выбирают говорящего жестко и получают артефакты в момент переключения. Авторы предлагают мягкое переключение с учетом неопределенности и компенсацией нейронной задержки.

Метод. Сначала robust separator генерирует два кандидатных речевых потока. Затем EEG attention regulation module оценивает, какой поток сейчас соответствует вниманию слушателя, и выдает smooth gating weights вместо резкого выбора. В модуле есть switch-aware soft gating, latency-compensated alignment с learnable temporal shifts и uncertainty-driven conservative strategy: когда EEG ненадежен, модель переключается осторожнее и подавляет jitter. Потери включают восстановление речи, switch-aware TV regularization и uncertainty-weighted smoothness.

Результаты. Датасет содержит 18 здоровых Mandarin-speaking участников 18-27 лет, 64 EEG электрода, частоту 500 Гц, затем downsampling до 128 Гц и band-pass 0.1-45 Гц. Два пространственных говорящих, мужской и женский, подаются с азимутов +90° и -90° в звукоизолированной комнате при 65 dB SPL. SAGE получает SI-SDR 8.67 dB, STOI 88.24% и average switch latency 2.04 s. Это лучше BASEN 4.02 dB / 74.83% / 2.93 s, NeuroHeed 4.96 / 79.57 / 2.81, NeuroSpex+ 6.21 / 82.84 / 2.56 и M3ANet 7.13 / 84.30 / 2.37.

Ограничения. Сценарий контролируемый: два говорящих, фиксированные азимуты, наушники, звукоизолированная комната и молодые здоровые участники. Нет проверки с большим числом говорящих, реальной комнатной реверберацией, движением головы или портативной EEG. Average switch latency 2.04 s все еще велика для естественного разговора. Разбиение train/validation/test делается внутри данных каждого участника, поэтому межпользовательский перенос надо оценивать отдельно.

Фишка из статьи. Абляция показывает, что latency alignment важнее всего для точности переключения, а uncertainty strategy сильнее влияет на качество извлечения, чем на задержку. Это хорошая инженерная декомпозиция: разные модули чинят разные failure modes.

ВариантSI-SDRSTOISwitch ACCASL
SAGE full8.67 dB88.24%78.02%2.04 s
Без soft gating8.12 dB87.35%73.58%2.35 s
Без latency alignment7.86 dB86.02%71.34%2.58 s
Без uncertainty strategy7.41 dB85.18%74.26%меньше влияет на delay
Без всех модулей6.73 dB83.80%66.47%не указано в таблице

Как это читать: удаление latency alignment хуже всего бьет по ACC и ASL, потому что EEG-решение приходит с физиологическим лагом. Удаление uncertainty strategy сильнее снижает SI-SDR, значит при сомнительном EEG модель начинает чаще пропускать чужой голос или создавать артефакты.

Оригинальная статья на arXiv