распознавание говорящего диаризация калибровка
arXiv eess.AS

Калибровка разметки целевых говорящих по галерее эталонов

arXiv:2610.11272

Для присвоения имён сегментам диаризации удобно использовать записи всех зарегистрированных говорящих как внутреннюю опору. Статья показывает, почему обычная T/AS-нормализация на такой галерее ломается из-за сессионных кластеров, и заменяет её аффинно-инвариантной калибровкой без внешней когорты.

Метод. Gallery affinity verification добавляет к исходному косинусному баллу два признака: разброс оценок по галерее и отклонение профиля эталонной записи от профилей остальных участников. Оба терма устойчивы к индивидуальным сдвигам шкалы и не требуют обучаемых параметров.

Результаты. На TST-Bench DIR при FAR 1% растёт с 87,89 до 91,10%, EER падает с 7,03 до 5,98%. На внутреннем корпусе EER уменьшается с 11,07 до 10,00%, а поверх T-нормализации — с 9,54 до 8,08%. Выигрыш сохраняется поверх внешней AS-нормализации.

Ограничения. Профили предполагают фиксированную галерею и становятся полезными только при достаточном числе зарегистрированных говорящих. При N=10 калибровка даже слегка ухудшает средний DIR. Один набор синтетический, второй закрытый, поэтому перенос на другие домены пока трудно проверить.

Фишка из статьи. Эффект меняет знак с размером галереи: девять конкурентов ещё не дают устойчивой статистики, зато при 75–150 говорящих метод прибавляет 3–4 п.п. и уменьшает разброс между случайными подгалереями.

Число говорящих NБазовый DIR@FAR=1%, %С калибровкой, %
1097,0 ± 1,296,2 ± 1,4
3093,7 ± 1,895,6 ± 1,2
7586,3 ± 6,990,5 ± 5,2
15087,991,1

Как это читать: метод рассчитан на большие галереи, где контроль ложных срабатываний особенно труден. Для маленькой адресной книги дополнительная статистика не окупается.

Оригинальная статья на arXiv