WeSep: модульное извлечение целевого говорящего по подсказкам
WeSep полезна не как очередная модель разделения речи, а как попытка привести target speaker extraction к модульной инженерной схеме. В реальных системах подсказки о целевом говорящем бывают разными: enrollment audio, пространственное направление, губы на видео, ключевые слова, а иногда часть этих подсказок просто отсутствует. Авторы предлагают отделить cue modules от separator backbones и проверяют, как разные подсказки и их сочетания влияют на SI-SDR improvement.
Метод. WeSep формулирует извлечение целевого говорящего как cue-conditioned learning: каждая подсказка кодируется своим frontend, а затем через стандартные interfaces подключается к separator backbone. В экспериментах основной backbone - BSRNN; для пространственных cue используются handcrafted признаки CDF+SDF+IPD+Delta STFT, а для speaker cue - embedding, LExt, USEF и contextual representations. Фреймворк также поддерживает heterogeneous batches, где у разных примеров есть разные subsets подсказок.
Результаты. На Libri2Mix-100 speaker embedding дает 13.17 dB SI-SDRi и accuracy 92.08%, а USEF+Context повышает это до 16.56 dB и 98.05%. В causal режиме с теоретической задержкой 32 ms USEF+Context сохраняет 14.15 dB и 95.93%. Для spatial cues handcrafted CDF+SDF+IPD+Delta STFT с BSRNN дает 14.24 dB, а с NBC2 - 17.49 dB. Совмещение speaker и spatial cues под BSRNN дает 14.67 dB и 99.05%, лучше, чем каждый cue отдельно в той же постановке.
Ограничения. Это больше framework paper, чем демонстрация одной готовой production-модели. Multi-channel spatial эксперименты используют контролируемо сгенерированные смеси с RT60 0.1-0.5 s и SINR от -10 до 10 dB, поэтому перенос на настоящие микрофонные массивы требует проверки. Missing cues моделируются zero-valued placeholders, что удобно для обучения, но не покрывает все типы неверных или конфликтующих подсказок.
Фишка из статьи. Хороший инженерный кусок - эксперимент с отсутствующими подсказками. Модель обучают так, что enrollment cues отсутствуют в 30% примеров, spatial cues тоже в 30%, а обе подсказки одновременно отсутствуют примерно в 9%.
| Доступные подсказки при inference | SI-SDRi | Accuracy, SI-SDRi > 1 dB |
|---|---|---|
| Spatial + Speaker | 13.51 dB | 98.63% |
| Spatial only | 12.61 dB | 95.98% |
| Speaker only | 10.01 dB | 88.73% |
Как это читать: система не рушится, если часть cue недоступна, но качество падает предсказуемо. Пространственная подсказка в этой постановке сильнее speaker-only, а их сочетание дает лучший accuracy, что хорошо согласуется с практикой микрофонных массивов.