Диаризация Распознавание речи WhisperX
Разговорная речь

Body-worn audio: разные тракты для диаризации и распознавания речи

Speaker Acc 90.27%

Работа предлагает прикладной framework для body-worn camera audio, где шум, движение, перекрытия и резкие смены говорящих одновременно мешают распознаванию речи и диаризации. Интересен не сам набор компонентов, а инженерное разделение трактов: enhanced audio идет в диаризацию, а loudness-normalized audio - в WhisperX. Главный вывод трезвый: "улучшить звук" для человека не значит улучшить все downstream-метрики.

Метод. Диаризационный тракт использует DeepFilterNet, VAD и NeMo MSDD с TitaNet embeddings. Тракт распознавания использует loudness normalization, WhisperX Large-v3, forced alignment и probability-guided speech segmentation. Затем word-level speaker attribution делается детерминированно: каждое распознанное слово назначается сегменту говорящего с максимальным временным перекрытием.

Результаты. На собранном наборе public U.S./U.K. police body-worn recordings система получает VAD F1 0.8068 в диаризационном тракте и 0.8026 в тракте распознавания. DER равен 44.71%, JER - 0.8424, WER WhisperX - 32.44%. При этом финальная word-level Speaker Accuracy достигает 90.27%, Word Attribution Error - 9.73%, Timeline Accuracy - 70.53%. Относительно baseline Timeline Accuracy растет с 0.6646 до 0.7053, а speaker confusion падает с 0.0949 до 0.0771.

Ограничения. Абсолютные ошибки высокие: DER 44.71% и WER 32.44% показывают, что это не решенная задача, а практический baseline для тяжелого полевого звука. Данные собраны из public recordings и имеют ограниченный размер разметки; перенос на другие страны, микрофоны и юридические протоколы нужно проверять отдельно. Еще один риск - oracle-grounded MSDD и hand-built pipeline могут быть хрупкими при смене VAD/ASR-компонентов.

Фишка из статьи. Самая полезная инженерная деталь - "Enhancement Trap": глобальное подавление шума звучит чище, но ухудшает распознавание речи и иногда диаризацию.

КонфигурацияWERDERНаблюдение
Loudness normalization0.29750.4114Лучший баланс распознавания и диаризации
DeepFilterNet global0.36980.4408Чище для слуха, хуже для транскрипции
SpeechBrain enhancement0.45040.5603Сильная деградация обоих трактов
Full DeepFilterNet pipeline0.42150.6267Неподходяще для end-to-end conversational intelligence

Как это читать: DeepFilterNet помогает диаризационному тракту, но если пропустить через него весь pipeline, распознавание страдает. Поэтому разделение акустической подготовки по задачам здесь важнее, чем один общий "denoise everything" шаг.

Оригинальная статья на arXiv