Spatial features лучше beamforming для диаризации встреч
Статья сравнивает три способа добавить многоканальную информацию в диаризацию на основе WavLM: поставить beamformer перед single-channel foundation model, сделать multi-channel foundation model или подать явные spatial features как conditioning. Результат полезен для meeting processing: простой beamforming front-end может ухудшить overlap-сегменты, а лучшим оказывается явное объединение спектральных WavLM features и spatial cues через FiLM. Это хороший пример, где «улучшить сигнал» не равно «улучшить задачу».
Метод. База - DiariZen/EEND-VC с WavLM Base+ features. Каскадный вариант использует BeamformIt и затем обычный single-channel diarization pipeline. Multi-channel FM использует расширение WavLM с cross-channel communication blocks. Conditioning-вариант отдельно извлекает spatial embedding из inter-channel phase differences всех пар микрофонов и magnitude reference channel, затем подает его в Conformer через FiLM layers. Обучение идет на AMI, AliMeeting, AISHELL-4 и NOTSOFAR-1, тест также включает unseen DiPCo; во всех multi-channel экспериментах берутся четыре микрофона с максимальным spacing.
Результаты. По macro DER baseline дает 16.3%, добавление BeamformIt ухудшает до 16.5%, multi-channel FM слегка улучшает до 16.1%, а conditioning достигает 15.3%. На unseen DiPCo baseline имеет DER 31.8%, BeamformIt ухудшает до 33.0%, multi-channel FM - 32.5%, conditioning - 30.3%. Самый важный разрез - overlap: BeamformIt улучшает single-speaker регионы с 12.2% до 12.0%, но ухудшает overlapped speech с 23.9% до 25.0%, потому что beamformer схлопывает пространственные признаки, нужные для решения «говорит ли больше одного человека».
Ограничения. Авторы используют oracle clustering для связывания локальных speaker labels с ground truth, чтобы изолировать влияние frame-level EEND; это полезно для анализа, но не равно полной end-to-end диаризации в продукте. Все системы строятся вокруг WavLM Base+ и meeting-style датасетов, а микрофоны выбираются по максимальному spacing. Нет оценки задержки и вычислительной стоимости, хотя multi-channel FM и auxiliary spatial network могут быть существенно дороже каскада.
Фишка из статьи. Негативный результат с beamforming особенно ценен: он показывает, что подавление «лишнего» сигнала может удалить саму информацию о concurrent speakers. Таблица DER по single/overlap делает это измеримым.
| Система | Single DER | Overlap DER | Total DER | DiPCo DER |
|---|---|---|---|---|
| Baseline DiariZen | 12.2% | 23.9% | 16.3% | 31.8% |
| + BeamformIt | 12.0% | 25.0% | 16.5% | 33.0% |
| Multi-channel FM | 12.2% | 23.5% | 16.1% | 32.5% |
| Spatial conditioning | 11.0% | 23.5% | 15.3% | 30.3% |
| Conditioning + BeamformIt | 11.0% | 25.0% | 15.9% | 32.4% |
Как это читать: beamforming помогает там, где говорит один человек, но ломает overlap. Лучший вариант не заменяет сигнал beamformed output, а добавляет spatial features как отдельный канал информации к WavLM-представлениям.