диаризация потоковая обработка кодировщик говорящего
arXiv eess.AS

FASTDIAR: покадровый кодировщик говорящего для потоковой диаризации

arXiv:2610.02941

FASTDIAR заменяет повторное кодирование перекрывающихся звуковых окон причинным кодировщиком, который читает поток один раз и выдаёт вектор говорящего каждые 80 мс. Получается CPU-система с фиксированной задержкой 960 мс, не ограниченная заранее четырьмя участниками и особенно сильная на разговорах с небольшим перекрытием речи.

Метод. Архитектура ReDimNet2 переделана из кодировщика высказывания в покадровую сеть с двухсекундным прошлым контекстом и обучена дистилляцией от офлайн-учителя на искусственных смесях. В онлайновой кластеризации только уверенные кадры обновляют центроиды; короткое окно коррекции может уточнить границу до выдачи метки, а объединение кластеров исправляет избыточное дробление.

Результаты. Большая модель имеет 10,4 млн параметров, RTF 0,19 на одном потоке AMD 5995WX и задержку 960 мс. Без учёта перекрытий DER равен 12,35% на VoxConverse и 21,61% на RAMC; после необязательной офлайн-обработки — 11,77% и 20,08%. При переходе через четыре говорящих DER у Streaming Sortformer возрастает в 2,3–4,4 раза, у FASTDIAR — лишь в 1,2–1,5 раза.

Ограничения. Декодер назначает кадру только одного говорящего, поэтому вся перекрывающаяся речь превращается в пропуски: с учётом перекрытий DER на NOTSOFAR достигает 39,63%, на DIHARD3 — 32,57%. Реальные корпуса диаризации в обучении не использованы, а на DIHARD3 система уступает моделям, видевшим домен. Различительная способность в проверке говорящего хуже офлайн-учителя.

Фишка из статьи. Более сильный кодировщик проверки говорящего оказывается худшим потоковым диаризатором. Покадровая модель жертвует EER, но выигрывает в локализации смены говорящего, скорости и конечном DER — хороший пример несовпадения вспомогательной и целевой метрик.

КодировщикRTF на CPUEERVoxConverse DERRAMC DER
Оконный ReDimNet2-B6-S4,60–4,850,44%14,79%27,97%
FASTDIAR Small0,05—16,49%31,59%
FASTDIAR Medium0,09—14,06%24,21%
FASTDIAR Large0,191,51%12,35%21,61%

Как это читать: EER большой модели примерно втрое хуже оконного учителя, зато поток обрабатывается более чем в 25 раз быстрее и итоговая диаризация лучше. Оптимизировать кодировщик только по проверке говорящего здесь было бы ошибкой.

Оригинальная статья на arXiv