Калибровка разметки целевых говорящих по галерее эталонов
Для присвоения имён сегментам диаризации удобно использовать записи всех зарегистрированных говорящих как внутреннюю опору. Статья показывает, почему обычная T/AS-нормализация на такой галерее ломается из-за сессионных кластеров, и заменяет её аффинно-инвариантной калибровкой без внешней когорты.
Метод. Gallery affinity verification добавляет к исходному косинусному баллу два признака: разброс оценок по галерее и отклонение профиля эталонной записи от профилей остальных участников. Оба терма устойчивы к индивидуальным сдвигам шкалы и не требуют обучаемых параметров.
Результаты. На TST-Bench DIR при FAR 1% растёт с 87,89 до 91,10%, EER падает с 7,03 до 5,98%. На внутреннем корпусе EER уменьшается с 11,07 до 10,00%, а поверх T-нормализации — с 9,54 до 8,08%. Выигрыш сохраняется поверх внешней AS-нормализации.
Ограничения. Профили предполагают фиксированную галерею и становятся полезными только при достаточном числе зарегистрированных говорящих. При N=10 калибровка даже слегка ухудшает средний DIR. Один набор синтетический, второй закрытый, поэтому перенос на другие домены пока трудно проверить.
Фишка из статьи. Эффект меняет знак с размером галереи: девять конкурентов ещё не дают устойчивой статистики, зато при 75–150 говорящих метод прибавляет 3–4 п.п. и уменьшает разброс между случайными подгалереями.
| Число говорящих N | Базовый DIR@FAR=1%, % | С калибровкой, % |
|---|---|---|
| 10 | 97,0 ± 1,2 | 96,2 ± 1,4 |
| 30 | 93,7 ± 1,8 | 95,6 ± 1,2 |
| 75 | 86,3 ± 6,9 | 90,5 ± 5,2 |
| 150 | 87,9 | 91,1 |
Как это читать: метод рассчитан на большие галереи, где контроль ложных срабатываний особенно труден. Для маленькой адресной книги дополнительная статистика не окупается.