диаризация разделение источников многоканальный звук
arXiv cs.SD

Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior

arXiv:2608.28661

Диаризация удалённых говорящих особенно ненадёжна при реверберации и перекрывающейся речи, где одной покадровой классификации активности мало. Авторы добавляют в многоканальную модель neural FCASA бета-распределение для склонности каждого источника быть активным: это почти не увеличивает сеть, но заметно снижает ошибки на AMI.

Метод. Neural FCASA совместно оценивает пространственные параметры источников, разделённые сигналы и непрерывные оценки речевой активности. Вместо обычной бинарной перекрёстной энтропии вводится априорное бета-распределение и вариационная нижняя граница правдоподобия; его мода задаёт ожидаемую долю активности, а концентрация регулирует силу априорного знания. Эксперименты используют около 100 часов AMI, восьмимикрофонную решётку, WPE и окна вывода по 10 секунд.

Результаты. При мягких правилах подсчёта DER снижается с 14,48% до 10,11%, JER — с 13,50% до 9,73%. При более строгом полном подсчёте DER меняется с 18,73% до 15,31%, JER — с 27,65% до 21,98%; на участках с перекрытием речи DER уменьшается с 24,11% до 20,41%. К модели на 24 млн параметров добавляется лишь 257 обучаемых параметров.

Ограничения. Проверка проведена только на AMI и одной геометрии микрофонной решётки, с WPE и десятисекундным разбиением. Изолированных эталонных источников в AMI нет, поэтому заявленная часть о разделении источников не подтверждена SI-SDR или сходной мерой. Параметры бета-распределения подобраны заранее, а их оценивание из новой записи оставлено на будущее.

Фишка из статьи. Здесь полезно смотреть не на средний выигрыш, а на его устойчивость к правилам подсчёта. Добавка из 257 параметров помогает и при мягкой оценке границ, и при полном учёте ошибок, и отдельно на перекрывающейся речи.

Режим оценкиDER: основа → бета-приорJER: основа → бета-приор
Мягкий14,48% → 10,11%13,50% → 9,73%
Одинаковые настройки сравнения15,73% → 11,84%23,16% → 16,85%
Полный18,73% → 15,31%27,65% → 21,98%
Только перекрытия речи24,11% → 20,41%26,53% → 21,90%

Как это читать: DER считает ошибки назначения говорящих во времени, JER сильнее наказывает несовпадение временных областей каждого участника. Согласованное улучшение обеих мер показывает, что prior не просто сглаживает границы активности под один протокол подсчёта.

Оригинальная статья на arXiv