Извлечение говорящего Разделение речи Подсказки
Разделение речи

WeSep: модульное извлечение целевого говорящего по подсказкам

SI-SDRi 16.56

WeSep полезна не как очередная модель разделения речи, а как попытка привести target speaker extraction к модульной инженерной схеме. В реальных системах подсказки о целевом говорящем бывают разными: enrollment audio, пространственное направление, губы на видео, ключевые слова, а иногда часть этих подсказок просто отсутствует. Авторы предлагают отделить cue modules от separator backbones и проверяют, как разные подсказки и их сочетания влияют на SI-SDR improvement.

Метод. WeSep формулирует извлечение целевого говорящего как cue-conditioned learning: каждая подсказка кодируется своим frontend, а затем через стандартные interfaces подключается к separator backbone. В экспериментах основной backbone - BSRNN; для пространственных cue используются handcrafted признаки CDF+SDF+IPD+Delta STFT, а для speaker cue - embedding, LExt, USEF и contextual representations. Фреймворк также поддерживает heterogeneous batches, где у разных примеров есть разные subsets подсказок.

Результаты. На Libri2Mix-100 speaker embedding дает 13.17 dB SI-SDRi и accuracy 92.08%, а USEF+Context повышает это до 16.56 dB и 98.05%. В causal режиме с теоретической задержкой 32 ms USEF+Context сохраняет 14.15 dB и 95.93%. Для spatial cues handcrafted CDF+SDF+IPD+Delta STFT с BSRNN дает 14.24 dB, а с NBC2 - 17.49 dB. Совмещение speaker и spatial cues под BSRNN дает 14.67 dB и 99.05%, лучше, чем каждый cue отдельно в той же постановке.

Ограничения. Это больше framework paper, чем демонстрация одной готовой production-модели. Multi-channel spatial эксперименты используют контролируемо сгенерированные смеси с RT60 0.1-0.5 s и SINR от -10 до 10 dB, поэтому перенос на настоящие микрофонные массивы требует проверки. Missing cues моделируются zero-valued placeholders, что удобно для обучения, но не покрывает все типы неверных или конфликтующих подсказок.

Фишка из статьи. Хороший инженерный кусок - эксперимент с отсутствующими подсказками. Модель обучают так, что enrollment cues отсутствуют в 30% примеров, spatial cues тоже в 30%, а обе подсказки одновременно отсутствуют примерно в 9%.

Доступные подсказки при inferenceSI-SDRiAccuracy, SI-SDRi > 1 dB
Spatial + Speaker13.51 dB98.63%
Spatial only12.61 dB95.98%
Speaker only10.01 dB88.73%

Как это читать: система не рушится, если часть cue недоступна, но качество падает предсказуемо. Пространственная подсказка в этой постановке сильнее speaker-only, а их сочетание дает лучший accuracy, что хорошо согласуется с практикой микрофонных массивов.

Оригинальная статья на arXiv