voxmap-studio: разметка диаризации с учетом реальной стоимости правок
voxmap-studio — open-source инструмент для разметки speaker diarization, но интересен он не только UI. Главная идея статьи: считать стоимость разметки как first-class metric. Инструмент фиксирует typed edit operations и активное время работы, поэтому можно сравнивать не только DER на выходе, но и то, сколько человеческого труда потребовалось, чтобы получить этот DER.
Зачем это нужно
Для диаризации качество модели часто упирается не в архитектуру, а в стоимость хороших labels. Если annotator рисует все speaker turns с нуля, датасет становится дорогим. Если annotator просто принимает автоматический вывод, появляется риск выпустить model output как ground truth. voxmap-studio пытается держать середину: автоматическая разметка и embeddings дают стартовую гипотезу, но экспорт финального RTTM/JSON заблокирован, пока каждый сегмент не подтвержден человеком.
Что умеет инструмент
- React-based canvas и интеграция с pyannote-экосистемой.
- Stride-accelerated diarization engine и работа в режиме “исправить гипотезу”, а не “нарисовать всё вручную”.
- Подсветка сегментов, где embedding больше похож на другой speaker centroid или находится на границе решения.
- Cluster gallery и быстрые клавиатурные операции для массового подтверждения/переназначения turns.
- Phantom attention checks: короткие fake speech turns в silent gaps, которые помогают ловить rubber-stamping.
Первые результаты
Авторы провели маленькое исследование на 9 AMI audio files, по 3 файла на условие. Manual baseline оказался и самым дорогим, и самым слабым: 761 editOps, 115 sec/aud-min, macro DER 0.177. Режим с uncertainty highlighting дал 278 editOps, 101 sec/aud-min и macro DER 0.079. То есть в этом small-sample setup количество правок упало примерно на 63%, а DER — больше чем вдвое.
Третий режим, cluster gallery + recommendations, тоже улучшает manual annotation: 418 editOps и macro DER 0.093. Но лучший результат по стоимости и качеству в таблице дает именно подсветка uncertain segments: она не пытается заменить annotator-а, а направляет внимание туда, где автоматическая диаризация вероятнее всего ошиблась.
Практический вывод
Работа полезна командам, которые собирают собственные diarization-корпуса для встреч, звонков или доменной речи. Она напоминает простую вещь: “какой DER у auto-labeler-а” менее важен, чем “сколько стоит довести его output до надежного ground truth”. Для production dataset loops такая instrumentation может быть важнее очередного небольшого прироста модели.
Фишка из статьи. В VoxMap Studio необычно то, что качество разметки считается вместе с ценой разметки. Система не просто показывает diarization output, а ведет учет edit operations, времени на аудио-минуту и ошибок DER, причем экспорт завязан на подтверждение сегментов человеком и phantom attention checks.
| Условие | Edit ops | Сек / аудио-мин | DER макро | DER микро | Miss | Confusion |
|---|---|---|---|---|---|---|
| C1: ручная разметка | 761 | 115 | 0.177 | 0.176 | 0.123 | 0.030 |
| C2: + uncertainty | 278 | 101 | 0.079 | 0.078 | 0.037 | 0.008 |
| C3: + gallery + recommendations | 418 | 105 | 0.093 | 0.094 | 0.062 | 0.009 |
Как это читать: uncertainty-first сценарий уменьшает число правок с 761 до 278, то есть примерно на 63%, и одновременно снижает DER. Это хороший пример интерфейсной статьи, где главный вклад не новая модель, а то, как модель встроена в рабочий цикл аннотатора.