Разделение речи AVSE Датасет
Аудиовизуальное выделение речи

QIANGDA и VOXBLINK2-AVSE: аудиовизуальное выделение целевого говорящего

12,076 rows

Статья полезна тем, что формулирует аудиовизуальное выделение целевого говорящего как проверку идентичности, а не просто как улучшение звучания смеси. В обычных наборах separator может выдавать акустически доминирующий голос и все равно выглядеть неплохо по части метрик. QIANGDA специально устроен так, чтобы один и тот же двухголосый фрагмент проверялся дважды: нужно извлечь говорящего A по его видео и говорящего B по другому видео.

Метод. QIANGDA содержит реальные Mandarin сцены с двумя говорящими, синхронным multi-view video и отдельными A-only/B-only записями, которые служат in-scene speaker references. Дополнительно авторы курируют VOXBLINK2-AVSE из VoxBlink2: после аудиовизуальной валидации и DNSMOS filtering остается 250828 пар, 28421 identity и 766.17 часа речи. Модель использует замороженные 1280-мерные AV-HuBERT features, input-end visual fusion, FiLM-модуляцию и target-conditioned обучение; идентичность проверяется WeSpeaker ResNet34, а контент - Qwen3-ASR-1.7B CER.

Результаты. QIANGDA включает 77 сцен, 7598 клипов общей длительностью 11.84 часа, 6038 оцениваемых смесей и 12076 target-speaker строк. На полном manifest лучший архивный checkpoint получает CER 0.2261, target similarity 0.6425, interferer similarity 0.3114 и speaker margin 0.3311. В OSD-first strict evaluation он дает 82.22% strict correct, 5.33% wrong speaker и 69.53% both-output strict success.

Ограничения. QIANGDA Mandarin-only и относительно небольшой по часам, хотя хорошо контролируемый по сценам. Поскольку физически изолированных clean sources нет, авторы не используют target SI-SDR как основную метрику и переходят к CER, speaker margin и OSD-first оценке. Самый сильный checkpoint без auxiliary speaker loss помечен как архивный: его launch CLI не полностью сохранен, поэтому причинный эффект этой настройки нельзя считать доказанным без повторного matched retraining.

Фишка из статьи. Особенно интересна строгая OSD-first оценка. Она сначала отсекает остаточное наложение речи, а уже потом решает, правильный ли говорящий извлечен. Это ловит ошибку, которую forced speaker comparison мог бы замаскировать.

КонфигурацияCERTarget simInterferer simMarginResidual overlapStrict correctBoth strict
AVSR + VB2 + FiLM + margin loss0.27930.62330.32970.293619.39%74.33%58.51%
AVSR + VB2 + FiLM, no speaker loss0.22610.64250.31140.331112.45%82.22%69.53%
ResNet visual features0.72060.49280.49280.000084.28%7.86%0.00%

Как это читать: равные target и interferer similarity у ResNet-строки показывают провал идентичности, даже если система что-то отделяет. Для аудиовизуального выделения речи такая диагностика ценнее, чем средний показатель качества смеси.

Оригинальная статья на arXiv