Диаризация WavLM Многоканальная речь
Диаризация

Spatial features лучше beamforming для диаризации встреч

DER 15.3%

Статья сравнивает три способа добавить многоканальную информацию в диаризацию на основе WavLM: поставить beamformer перед single-channel foundation model, сделать multi-channel foundation model или подать явные spatial features как conditioning. Результат полезен для meeting processing: простой beamforming front-end может ухудшить overlap-сегменты, а лучшим оказывается явное объединение спектральных WavLM features и spatial cues через FiLM. Это хороший пример, где «улучшить сигнал» не равно «улучшить задачу».

Метод. База - DiariZen/EEND-VC с WavLM Base+ features. Каскадный вариант использует BeamformIt и затем обычный single-channel diarization pipeline. Multi-channel FM использует расширение WavLM с cross-channel communication blocks. Conditioning-вариант отдельно извлекает spatial embedding из inter-channel phase differences всех пар микрофонов и magnitude reference channel, затем подает его в Conformer через FiLM layers. Обучение идет на AMI, AliMeeting, AISHELL-4 и NOTSOFAR-1, тест также включает unseen DiPCo; во всех multi-channel экспериментах берутся четыре микрофона с максимальным spacing.

Результаты. По macro DER baseline дает 16.3%, добавление BeamformIt ухудшает до 16.5%, multi-channel FM слегка улучшает до 16.1%, а conditioning достигает 15.3%. На unseen DiPCo baseline имеет DER 31.8%, BeamformIt ухудшает до 33.0%, multi-channel FM - 32.5%, conditioning - 30.3%. Самый важный разрез - overlap: BeamformIt улучшает single-speaker регионы с 12.2% до 12.0%, но ухудшает overlapped speech с 23.9% до 25.0%, потому что beamformer схлопывает пространственные признаки, нужные для решения «говорит ли больше одного человека».

Ограничения. Авторы используют oracle clustering для связывания локальных speaker labels с ground truth, чтобы изолировать влияние frame-level EEND; это полезно для анализа, но не равно полной end-to-end диаризации в продукте. Все системы строятся вокруг WavLM Base+ и meeting-style датасетов, а микрофоны выбираются по максимальному spacing. Нет оценки задержки и вычислительной стоимости, хотя multi-channel FM и auxiliary spatial network могут быть существенно дороже каскада.

Фишка из статьи. Негативный результат с beamforming особенно ценен: он показывает, что подавление «лишнего» сигнала может удалить саму информацию о concurrent speakers. Таблица DER по single/overlap делает это измеримым.

СистемаSingle DEROverlap DERTotal DERDiPCo DER
Baseline DiariZen12.2%23.9%16.3%31.8%
+ BeamformIt12.0%25.0%16.5%33.0%
Multi-channel FM12.2%23.5%16.1%32.5%
Spatial conditioning11.0%23.5%15.3%30.3%
Conditioning + BeamformIt11.0%25.0%15.9%32.4%

Как это читать: beamforming помогает там, где говорит один человек, но ломает overlap. Лучший вариант не заменяет сигнал beamformed output, а добавляет spatial features как отдельный канал информации к WavLM-представлениям.

Оригинальная статья на arXiv