Отслеживание говорящих по онлайновым сегментам при переменном числе участников
Статья решает более сложную задачу, чем обычная офлайновая диаризация: нужно в потоке поддерживать устойчивые дорожки говорящих, хотя участники появляются, исчезают и перекрывают друг друга. Система разделяет короткие сегменты, сшивает их по перекрытию и сверяет личности с долговременной памятью.
Метод. Одно- или семиканальный TF-CrossNet выдаёт до четырёх разделённых потоков, после чего VAD отсекает пустые участки. Локальная перестановка каналов восстанавливается по перекрывающимся фрагментам, а ReDimNet-сходство связывает новые голоса с глобальными дорожками. Архитектура не требует заранее знать число участников и допускает последовательный вывод.
Результаты. На LibriCSS одноканальная система получает DER 4,63%, семиканальная — 3,38% против 4,68% у офлайнового MC-EEND и 18,19% у x-vector со спектральной кластеризацией. Оракул с чистыми разделёнными сигналами даёт 2,98%, то есть основная система близка к пределу выбранной схемы группировки. Семиканальный cpWER равен 5,32% с обычным E2E-ASR и 4,39% с E2E-SSL. На реальных встречах AMI лучший онлайновый DER составляет 18,43%.
Ограничения. Разделитель ограничен четырьмя одновременными голосами, а AMI остаётся существенно труднее LibriCSS из-за шума, реверберации и коротких реплик. Система многокомпонентная и зависит от качества VAD, разделения и эмбеддингов. В статье нет сквозной оценки вычислительной задержки на длительных встречах.
Фишка из статьи. Окно сегмента имеет выраженный оптимум: слишком короткое не даёт контекста для сшивания, а слишком длинное чаще превышает вместимость разделителя.
| Настройка | DER, % | Причина изменения |
|---|---|---|
| Сегмент 2 с | 6,75 | Недостаточно контекста |
| Сегмент 4 с | 3,38 | Лучший баланс |
| Сегмент 8 с | 5,35 | Больше голосов внутри окна |
| Перекрытие 25% | 3,38 | Достаточно для сшивания |
| Перекрытие 50% | 4,41 | Больше операций перегруппировки |
Как это читать: увеличение контекста не монотонно улучшает потоковую диаризацию. Практическая настройка должна учитывать не только точность эмбеддингов, но и вероятность того, что в одном сегменте окажется больше источников, чем умеет разделять модель.