диаризация отслеживание говорящих разделение источников
arXiv eess.AS

Отслеживание говорящих по онлайновым сегментам при переменном числе участников

arXiv:2610.05693

Статья решает более сложную задачу, чем обычная офлайновая диаризация: нужно в потоке поддерживать устойчивые дорожки говорящих, хотя участники появляются, исчезают и перекрывают друг друга. Система разделяет короткие сегменты, сшивает их по перекрытию и сверяет личности с долговременной памятью.

Метод. Одно- или семиканальный TF-CrossNet выдаёт до четырёх разделённых потоков, после чего VAD отсекает пустые участки. Локальная перестановка каналов восстанавливается по перекрывающимся фрагментам, а ReDimNet-сходство связывает новые голоса с глобальными дорожками. Архитектура не требует заранее знать число участников и допускает последовательный вывод.

Результаты. На LibriCSS одноканальная система получает DER 4,63%, семиканальная — 3,38% против 4,68% у офлайнового MC-EEND и 18,19% у x-vector со спектральной кластеризацией. Оракул с чистыми разделёнными сигналами даёт 2,98%, то есть основная система близка к пределу выбранной схемы группировки. Семиканальный cpWER равен 5,32% с обычным E2E-ASR и 4,39% с E2E-SSL. На реальных встречах AMI лучший онлайновый DER составляет 18,43%.

Ограничения. Разделитель ограничен четырьмя одновременными голосами, а AMI остаётся существенно труднее LibriCSS из-за шума, реверберации и коротких реплик. Система многокомпонентная и зависит от качества VAD, разделения и эмбеддингов. В статье нет сквозной оценки вычислительной задержки на длительных встречах.

Фишка из статьи. Окно сегмента имеет выраженный оптимум: слишком короткое не даёт контекста для сшивания, а слишком длинное чаще превышает вместимость разделителя.

НастройкаDER, %Причина изменения
Сегмент 2 с6,75Недостаточно контекста
Сегмент 4 с3,38Лучший баланс
Сегмент 8 с5,35Больше голосов внутри окна
Перекрытие 25%3,38Достаточно для сшивания
Перекрытие 50%4,41Больше операций перегруппировки

Как это читать: увеличение контекста не монотонно улучшает потоковую диаризацию. Практическая настройка должна учитывать не только точность эмбеддингов, но и вероятность того, что в одном сегменте окажется больше источников, чем умеет разделять модель.

Оригинальная статья на arXiv