Target Speaker Identification: A Low-Latency Streaming Pipeline
Работа собирает из готовых открытых моделей потоковую систему, которая должна сообщать слуховому аппарату, когда говорит заранее зарегистрированный человек. Важный инженерный ход - вынести это решение из звукового тракта: усиление продолжает работать с задержкой в несколько миллисекунд, а более медленная диаризация лишь переключает или направляет его. Получается полезный прототип, но заявленная «малая задержка» на деле равна примерно одной секунде и проверена только на одном ведущем подкаста.
Метод. Diart делит поток по говорящим, после чего Pyannote сравнивает каждый речевой участок с вектором зарегистрированного голоса по косинусному расстоянию. Для выбора компонентов авторы сначала сравнивают автономную диаризацию: Pyannote даёт DER 0,201, LIUM - 0,976. Потоковый Diart после настройки на одном выпуске снижает DER с 0,563 до 0,310. Минимальный фрагмент Diart длится 500 мс; для устойчивой проверки голоса объединяются два фрагмента, поэтому управляющий сигнал запаздывает на одну секунду. Временные маски сравниваются с разметкой с шагом 100 мс.
Результаты. На 17 выпусках This American Life при пороге косинусного расстояния 0,70 медианная точность составляет 0,93, F1 - 0,68, точность положительных решений - 0,91, полнота - 0,56 и специфичность - 0,99. Порог 0,75 повышает полноту до 0,68 и F1 до 0,70, но снижает точность положительных решений до 0,78 и специфичность до 0,96. Это разумный рабочий компромисс: система пропускает примерно треть речи цели, зато редко открывает усиление для чужого голоса. Потоковый DER 0,310 пока заметно хуже автономных 0,201.
Ограничения. Зарегистрирован только один человек, Ira Glass; использованы чистые длинные реплики с малым перекрытием и небольшим фоновым шумом. Настройка диаризации и исходное сравнение сделаны на одном выпуске, каждый выпуск прогнан один раз, статистической проверки нет, а выборки настройки и оценки не полностью разведены. Секундная задержка может быть приемлемой в длинном разговоре, но плохо подходит для коротких реплик и перебиваний. Авторы отмечают ухудшение при шуме, однако подавление шума не входит в испытанную цепочку.
Фишка из статьи. Таблица длительности регистрации содержит странный, но важный отрицательный сигнал. Авторы видят насыщение пользы примерно после минуты голоса, однако все приведённые ROC-AUC ниже 0,5 и не объясняют направление положительного класса или инверсию косинусного расстояния.
| Длительность регистрации | 13 с | 50 с | 57 с | 66 с | 123 с |
|---|---|---|---|---|---|
| Приведённый AUC | 0,324 | 0,423 | 0,449 | 0,451 | 0,446 |
Как это читать: относительный рост до 57-66 секунд действительно указывает на насыщение, но стандартный ROC-AUC ниже 0,5 означает результат хуже случайного при обычном направлении оценки. Вероятное объяснение - расстояние трактуется противоположно вероятности целевого класса, но статья этого не уточняет. Поэтому абсолютные AUC нельзя использовать как подтверждение качества; надёжнее смотреть на явные показатели при порогах 0,70 и 0,75.