DiaPer для Nepali-Hindi diarization: Perceiver-attractors лучше масштабируются на 3-4 спикера
Статья сравнивает две end-to-end diarization архитектуры на низкоресурсной Nepali-Hindi речи и показывает важный практический trade-off: простая EEND-EDA еще конкурентна на 2 speakers, но Perceiver-based attractors у DiaPer лучше выдерживают 3, 4 и mixed-speaker сценарии. Для мультиязычной диаризации это полезный результат, потому что ошибки обычно появляются не на чистых двухспикерных тестах, а в переменном числе говорящих и смешанных языковых условиях.
Метод
Авторы обучают DiaPer и EEND-EDA на мультиязычном корпусе: English speech из LibriSpeech, записи из VoxCeleb и отдельно собранные Nepali/Hindi данные. Обе модели тестируются в четырех режимах speaker count: 2spk, 3spk, 4spk и mixed-speaker. DER считается через pyannote DiarizationErrorRate с 0.25 s collar, то есть метрика учитывает missed speech, false alarm и speaker confusion.
Главное архитектурное отличие — как модель строит attractors для говорящих. EEND-EDA использует encoder-decoder attractors, а DiaPer опирается на Perceiver-style attractors, которые лучше работают с переменным числом объектов и более сложными speaker interactions. Поэтому статья фактически проверяет, какой attractor mechanism устойчивее при cross-lingual и low-resource data.
Результаты
- На NeHi 3-speaker DiaPer получает DER 2.02%, тогда как EEND-EDA — 9.68%.
- На NeHi 4-speaker DiaPer дает 4.05% против 16.17% у EEND-EDA.
- На NeHi mixed-speaker DiaPer получает 4.76% против 11.19%.
- На VoxCeleb mixed-speaker DiaPer снижает DER до 2.60% против 8.99%.
- Исключение есть: в простом NeHi 2-speaker режиме EEND-EDA лучше, 1.50% против 3.28% у DiaPer.
Это важное уточнение: DiaPer не “побеждает везде”, а выигрывает там, где число говорящих и языковая вариативность усложняют attractor assignment. В двухспикерном случае более простой механизм EEND-EDA может быть достаточным и даже чуть точнее.
Ограничения
Nepali и Hindi оцениваются как объединенный NeHi test set, поэтому статья не показывает language-specific error analysis. Nepali training data ограничены 18 female speakers, что создает риск speaker-diversity bias. Кроме того, multi-speaker recordings синтетически сгенерированы, а не взяты из живых conversational overlaps; это может недооценивать проблемы turn-taking, room acoustics, far-field speech и реальных перекрытий.
Фишка из статьи. Самая показательная часть — диагональные и mixed-speaker клетки DER: DiaPer резко выигрывает, когда модель обучена и проверяется на более сложном числе говорящих, но не обязан выигрывать в простом 2-speaker режиме.
| Тест | DiaPer DER | EEND-EDA DER | Вывод |
|---|---|---|---|
| NeHi 2spk | 3.28% | 1.50% | Для простой двухспикерной сцены EEND-EDA остается сильным baseline. |
| NeHi 3spk | 2.02% | 9.68% | Perceiver-attractors лучше держат рост числа говорящих. |
| NeHi 4spk | 4.05% | 16.17% | Разрыв становится крупным при сложной speaker assignment задаче. |
| NeHi mixed | 4.76% | 11.19% | Mixed-speaker training/testing — главный аргумент в пользу DiaPer. |
Как это читать: если production diarization живет в звонках и встречах с переменным числом людей, стоит смотреть не только на 2spk DER. Эта статья показывает, что attractor architecture может быть важнее небольшого выигрыша на простом двухспикерном benchmark.