Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior
Диаризация удалённых говорящих особенно ненадёжна при реверберации и перекрывающейся речи, где одной покадровой классификации активности мало. Авторы добавляют в многоканальную модель neural FCASA бета-распределение для склонности каждого источника быть активным: это почти не увеличивает сеть, но заметно снижает ошибки на AMI.
Метод. Neural FCASA совместно оценивает пространственные параметры источников, разделённые сигналы и непрерывные оценки речевой активности. Вместо обычной бинарной перекрёстной энтропии вводится априорное бета-распределение и вариационная нижняя граница правдоподобия; его мода задаёт ожидаемую долю активности, а концентрация регулирует силу априорного знания. Эксперименты используют около 100 часов AMI, восьмимикрофонную решётку, WPE и окна вывода по 10 секунд.
Результаты. При мягких правилах подсчёта DER снижается с 14,48% до 10,11%, JER — с 13,50% до 9,73%. При более строгом полном подсчёте DER меняется с 18,73% до 15,31%, JER — с 27,65% до 21,98%; на участках с перекрытием речи DER уменьшается с 24,11% до 20,41%. К модели на 24 млн параметров добавляется лишь 257 обучаемых параметров.
Ограничения. Проверка проведена только на AMI и одной геометрии микрофонной решётки, с WPE и десятисекундным разбиением. Изолированных эталонных источников в AMI нет, поэтому заявленная часть о разделении источников не подтверждена SI-SDR или сходной мерой. Параметры бета-распределения подобраны заранее, а их оценивание из новой записи оставлено на будущее.
Фишка из статьи. Здесь полезно смотреть не на средний выигрыш, а на его устойчивость к правилам подсчёта. Добавка из 257 параметров помогает и при мягкой оценке границ, и при полном учёте ошибок, и отдельно на перекрывающейся речи.
| Режим оценки | DER: основа → бета-приор | JER: основа → бета-приор |
|---|---|---|
| Мягкий | 14,48% → 10,11% | 13,50% → 9,73% |
| Одинаковые настройки сравнения | 15,73% → 11,84% | 23,16% → 16,85% |
| Полный | 18,73% → 15,31% | 27,65% → 21,98% |
| Только перекрытия речи | 24,11% → 20,41% | 26,53% → 21,90% |
Как это читать: DER считает ошибки назначения говорящих во времени, JER сильнее наказывает несовпадение временных областей каждого участника. Согласованное улучшение обеих мер показывает, что prior не просто сглаживает границы активности под один протокол подсчёта.