верификация говорящего неопределённость калибровка
arXiv cs.SD

A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration

arXiv:2609.01221

Верификация говорящего обычно учитывает качество записи лишь при построении исходного вектора, а затем обращается со всеми пробами одинаково. Здесь ковариация, описывающая неопределённость вектора говорящего, проходит через весь завершающий тракт: сравнение, когортную нормализацию и калибровку.

Метод. Каждая запись представляется средним вектором и ковариацией. Неопределённостная косинусная мера меняет масштаб сходства, UAS-Norm уменьшает вклад ненадёжных когортных примеров и отдельно учитывает качество регистрируемой и проверяемой записей, а UQMF добавляет ковариационные признаки в калибратор. Опыты проведены с ECAPA-TDNN и ResNet на трёх протоколах VoxCeleb1.

Результаты. Для ECAPA исходные EER на Vox1-O/E/H равны 1,069/1,209/2,310%; полный тракт снижает их до 0,750/0,892/1,629% и даёт среднее относительное улучшение EER и minDCF 28,01%. Для ResNet соответствующие EER меняются с 0,867/1,049/1,960% до 0,745/0,793/1,386%, относительное улучшение 27,15%. По сравнению с обычными AS-Norm+QMF полный вариант улучшает все шесть показателей ECAPA, но у ResNet minDCF на Vox1-O слегка растёт с 0,052 до 0,053.

Ограничения. Проверка ограничена семейством VoxCeleb и двумя близкими архитектурами; качество самой ковариации при другом шуме или канале отдельно не изучено. Авторы называют последний этап калибровкой, но сообщают EER и minDCF, а не Cllr, фактический DCF или ошибку надёжности вероятностей. Поэтому данные убедительнее подтверждают разделение классов, чем калиброванность конечной оценки.

Фишка из статьи. Не все три добавки к UAS-Norm одинаково полезны: взвешивание разброса когорты даёт почти незаметный прирост.

Тракт ECAPAСреднее относительное улучшениеEER Vox1-H
Обычные cosine + AS-Norm18,34%1,809%
UAS: вес среднего24,59%1,677%
+ вес разброса24,83%1,675%
+ качество самой пары25,86%1,663%
+ UQMF28,01%1,629%

Как это читать: главный вклад нормализации идёт от отбора надёжных когортных примеров и масштаба конкретной пары; второй компонент добавляет лишь 0,24 п.п. относительного улучшения. Это полезнее общего утверждения, что «учёт неопределённости помогает».

Оригинальная статья на arXiv