A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration
Верификация говорящего обычно учитывает качество записи лишь при построении исходного вектора, а затем обращается со всеми пробами одинаково. Здесь ковариация, описывающая неопределённость вектора говорящего, проходит через весь завершающий тракт: сравнение, когортную нормализацию и калибровку.
Метод. Каждая запись представляется средним вектором и ковариацией. Неопределённостная косинусная мера меняет масштаб сходства, UAS-Norm уменьшает вклад ненадёжных когортных примеров и отдельно учитывает качество регистрируемой и проверяемой записей, а UQMF добавляет ковариационные признаки в калибратор. Опыты проведены с ECAPA-TDNN и ResNet на трёх протоколах VoxCeleb1.
Результаты. Для ECAPA исходные EER на Vox1-O/E/H равны 1,069/1,209/2,310%; полный тракт снижает их до 0,750/0,892/1,629% и даёт среднее относительное улучшение EER и minDCF 28,01%. Для ResNet соответствующие EER меняются с 0,867/1,049/1,960% до 0,745/0,793/1,386%, относительное улучшение 27,15%. По сравнению с обычными AS-Norm+QMF полный вариант улучшает все шесть показателей ECAPA, но у ResNet minDCF на Vox1-O слегка растёт с 0,052 до 0,053.
Ограничения. Проверка ограничена семейством VoxCeleb и двумя близкими архитектурами; качество самой ковариации при другом шуме или канале отдельно не изучено. Авторы называют последний этап калибровкой, но сообщают EER и minDCF, а не Cllr, фактический DCF или ошибку надёжности вероятностей. Поэтому данные убедительнее подтверждают разделение классов, чем калиброванность конечной оценки.
Фишка из статьи. Не все три добавки к UAS-Norm одинаково полезны: взвешивание разброса когорты даёт почти незаметный прирост.
| Тракт ECAPA | Среднее относительное улучшение | EER Vox1-H |
|---|---|---|
| Обычные cosine + AS-Norm | 18,34% | 1,809% |
| UAS: вес среднего | 24,59% | 1,677% |
| + вес разброса | 24,83% | 1,675% |
| + качество самой пары | 25,86% | 1,663% |
| + UQMF | 28,01% | 1,629% |
Как это читать: главный вклад нормализации идёт от отбора надёжных когортных примеров и масштаба конкретной пары; второй компонент добавляет лишь 0,24 п.п. относительного улучшения. Это полезнее общего утверждения, что «учёт неопределённости помогает».