DiaPer EEND Low-resource
Diarization

DiaPer для Nepali-Hindi diarization: Perceiver-attractors лучше масштабируются на 3-4 спикера

DER 4.76%

Статья сравнивает две end-to-end diarization архитектуры на низкоресурсной Nepali-Hindi речи и показывает важный практический trade-off: простая EEND-EDA еще конкурентна на 2 speakers, но Perceiver-based attractors у DiaPer лучше выдерживают 3, 4 и mixed-speaker сценарии. Для мультиязычной диаризации это полезный результат, потому что ошибки обычно появляются не на чистых двухспикерных тестах, а в переменном числе говорящих и смешанных языковых условиях.

Метод

Авторы обучают DiaPer и EEND-EDA на мультиязычном корпусе: English speech из LibriSpeech, записи из VoxCeleb и отдельно собранные Nepali/Hindi данные. Обе модели тестируются в четырех режимах speaker count: 2spk, 3spk, 4spk и mixed-speaker. DER считается через pyannote DiarizationErrorRate с 0.25 s collar, то есть метрика учитывает missed speech, false alarm и speaker confusion.

Главное архитектурное отличие — как модель строит attractors для говорящих. EEND-EDA использует encoder-decoder attractors, а DiaPer опирается на Perceiver-style attractors, которые лучше работают с переменным числом объектов и более сложными speaker interactions. Поэтому статья фактически проверяет, какой attractor mechanism устойчивее при cross-lingual и low-resource data.

Результаты

  • На NeHi 3-speaker DiaPer получает DER 2.02%, тогда как EEND-EDA — 9.68%.
  • На NeHi 4-speaker DiaPer дает 4.05% против 16.17% у EEND-EDA.
  • На NeHi mixed-speaker DiaPer получает 4.76% против 11.19%.
  • На VoxCeleb mixed-speaker DiaPer снижает DER до 2.60% против 8.99%.
  • Исключение есть: в простом NeHi 2-speaker режиме EEND-EDA лучше, 1.50% против 3.28% у DiaPer.

Это важное уточнение: DiaPer не “побеждает везде”, а выигрывает там, где число говорящих и языковая вариативность усложняют attractor assignment. В двухспикерном случае более простой механизм EEND-EDA может быть достаточным и даже чуть точнее.

Ограничения

Nepali и Hindi оцениваются как объединенный NeHi test set, поэтому статья не показывает language-specific error analysis. Nepali training data ограничены 18 female speakers, что создает риск speaker-diversity bias. Кроме того, multi-speaker recordings синтетически сгенерированы, а не взяты из живых conversational overlaps; это может недооценивать проблемы turn-taking, room acoustics, far-field speech и реальных перекрытий.

Фишка из статьи. Самая показательная часть — диагональные и mixed-speaker клетки DER: DiaPer резко выигрывает, когда модель обучена и проверяется на более сложном числе говорящих, но не обязан выигрывать в простом 2-speaker режиме.

ТестDiaPer DEREEND-EDA DERВывод
NeHi 2spk3.28%1.50%Для простой двухспикерной сцены EEND-EDA остается сильным baseline.
NeHi 3spk2.02%9.68%Perceiver-attractors лучше держат рост числа говорящих.
NeHi 4spk4.05%16.17%Разрыв становится крупным при сложной speaker assignment задаче.
NeHi mixed4.76%11.19%Mixed-speaker training/testing — главный аргумент в пользу DiaPer.

Как это читать: если production diarization живет в звонках и встречах с переменным числом людей, стоит смотреть не только на 2spk DER. Эта статья показывает, что attractor architecture может быть важнее небольшого выигрыша на простом двухспикерном benchmark.

Оригинальная статья на arXiv