Точные реестры говорящих для потоковой диаризации
Статья показывает слепое пятно DER: потоковый диаризатор может неплохо размечать время, но создавать слишком много или слишком мало идентификаторов говорящих. Авторы вводят отдельную оценку реестра и меняют момент регистрации нового говорящего, не перестраивая всю систему.
Метод. Неподтверждённые эмбеддинги собираются в пул кандидатов. Новый идентификатор появляется только после накопления пяти взаимно совместимых наблюдений, а очередь commit-gated assignment временно удерживает метки, пока кандидат не подтверждён или не истёк бюджет задержки.
Результаты. На девяти корпусах макроошибка числа говорящих падает с 225,0% до 20,7%, а DER — с 17,59% до 15,95%. На VoxSRC-23 DER уменьшается с 7,40% до 6,76%, ошибка числа говорящих — с 63,1% до 16,0%. Средняя добавленная задержка составляет 0,109 с.
Ограничения. Трекер выводит одну метку на шаг и не моделирует перекрывающуюся речь, а для встраивания использует окна 1,5 с. На DIHARD III он уступает Streaming Sortformer по DER на 4,6 п.п. Гиперпараметры общие для девяти наборов, но детектор настраивается по семейству протокола.
Фишка из статьи. Задержка распределена крайне неравномерно: 91,4% выходов вообще не ждут, а удерживаемые 8,6% ждут в среднем 1,27 с. Среднее 0,109 с скрывает длинный хвост до 4,16 с.
| Бюджет ожидания, с | Средняя добавленная задержка, с | Speaker confusion, % |
|---|---|---|
| 0,0 | 0,000 | 5,17 |
| 0,5 | 0,027 | 4,91 |
| 1,0 | 0,054 | 4,69 |
| 1,5 | 0,081 | 4,49 |
| 2,0 | 0,109 | 4,31 |
Как это читать: выигрыш насыщается после четырёх шагов по 0,5 с; ещё 0,5 с ожидания уже ничего не дают. Для потокового продукта важны не только DER и средняя задержка, но и квантиль задержки для спорных участков.