Body-worn audio: разные тракты для диаризации и распознавания речи
Работа предлагает прикладной framework для body-worn camera audio, где шум, движение, перекрытия и резкие смены говорящих одновременно мешают распознаванию речи и диаризации. Интересен не сам набор компонентов, а инженерное разделение трактов: enhanced audio идет в диаризацию, а loudness-normalized audio - в WhisperX. Главный вывод трезвый: "улучшить звук" для человека не значит улучшить все downstream-метрики.
Метод. Диаризационный тракт использует DeepFilterNet, VAD и NeMo MSDD с TitaNet embeddings. Тракт распознавания использует loudness normalization, WhisperX Large-v3, forced alignment и probability-guided speech segmentation. Затем word-level speaker attribution делается детерминированно: каждое распознанное слово назначается сегменту говорящего с максимальным временным перекрытием.
Результаты. На собранном наборе public U.S./U.K. police body-worn recordings система получает VAD F1 0.8068 в диаризационном тракте и 0.8026 в тракте распознавания. DER равен 44.71%, JER - 0.8424, WER WhisperX - 32.44%. При этом финальная word-level Speaker Accuracy достигает 90.27%, Word Attribution Error - 9.73%, Timeline Accuracy - 70.53%. Относительно baseline Timeline Accuracy растет с 0.6646 до 0.7053, а speaker confusion падает с 0.0949 до 0.0771.
Ограничения. Абсолютные ошибки высокие: DER 44.71% и WER 32.44% показывают, что это не решенная задача, а практический baseline для тяжелого полевого звука. Данные собраны из public recordings и имеют ограниченный размер разметки; перенос на другие страны, микрофоны и юридические протоколы нужно проверять отдельно. Еще один риск - oracle-grounded MSDD и hand-built pipeline могут быть хрупкими при смене VAD/ASR-компонентов.
Фишка из статьи. Самая полезная инженерная деталь - "Enhancement Trap": глобальное подавление шума звучит чище, но ухудшает распознавание речи и иногда диаризацию.
| Конфигурация | WER | DER | Наблюдение |
|---|---|---|---|
| Loudness normalization | 0.2975 | 0.4114 | Лучший баланс распознавания и диаризации |
| DeepFilterNet global | 0.3698 | 0.4408 | Чище для слуха, хуже для транскрипции |
| SpeechBrain enhancement | 0.4504 | 0.5603 | Сильная деградация обоих трактов |
| Full DeepFilterNet pipeline | 0.4215 | 0.6267 | Неподходяще для end-to-end conversational intelligence |
Как это читать: DeepFilterNet помогает диаризационному тракту, но если пропустить через него весь pipeline, распознавание страдает. Поэтому разделение акустической подготовки по задачам здесь важнее, чем один общий "denoise everything" шаг.