FASTDIAR: покадровый кодировщик говорящего для потоковой диаризации
FASTDIAR заменяет повторное кодирование перекрывающихся звуковых окон причинным кодировщиком, который читает поток один раз и выдаёт вектор говорящего каждые 80 мс. Получается CPU-система с фиксированной задержкой 960 мс, не ограниченная заранее четырьмя участниками и особенно сильная на разговорах с небольшим перекрытием речи.
Метод. Архитектура ReDimNet2 переделана из кодировщика высказывания в покадровую сеть с двухсекундным прошлым контекстом и обучена дистилляцией от офлайн-учителя на искусственных смесях. В онлайновой кластеризации только уверенные кадры обновляют центроиды; короткое окно коррекции может уточнить границу до выдачи метки, а объединение кластеров исправляет избыточное дробление.
Результаты. Большая модель имеет 10,4 млн параметров, RTF 0,19 на одном потоке AMD 5995WX и задержку 960 мс. Без учёта перекрытий DER равен 12,35% на VoxConverse и 21,61% на RAMC; после необязательной офлайн-обработки — 11,77% и 20,08%. При переходе через четыре говорящих DER у Streaming Sortformer возрастает в 2,3–4,4 раза, у FASTDIAR — лишь в 1,2–1,5 раза.
Ограничения. Декодер назначает кадру только одного говорящего, поэтому вся перекрывающаяся речь превращается в пропуски: с учётом перекрытий DER на NOTSOFAR достигает 39,63%, на DIHARD3 — 32,57%. Реальные корпуса диаризации в обучении не использованы, а на DIHARD3 система уступает моделям, видевшим домен. Различительная способность в проверке говорящего хуже офлайн-учителя.
Фишка из статьи. Более сильный кодировщик проверки говорящего оказывается худшим потоковым диаризатором. Покадровая модель жертвует EER, но выигрывает в локализации смены говорящего, скорости и конечном DER — хороший пример несовпадения вспомогательной и целевой метрик.
| Кодировщик | RTF на CPU | EER | VoxConverse DER | RAMC DER |
|---|---|---|---|---|
| Оконный ReDimNet2-B6-S | 4,60–4,85 | 0,44% | 14,79% | 27,97% |
| FASTDIAR Small | 0,05 | — | 16,49% | 31,59% |
| FASTDIAR Medium | 0,09 | — | 14,06% | 24,21% |
| FASTDIAR Large | 0,19 | 1,51% | 12,35% | 21,61% |
Как это читать: EER большой модели примерно втрое хуже оконного учителя, зато поток обрабатывается более чем в 25 раз быстрее и итоговая диаризация лучше. Оптимизировать кодировщик только по проверке говорящего здесь было бы ошибкой.