QIANGDA и VOXBLINK2-AVSE: аудиовизуальное выделение целевого говорящего
Статья полезна тем, что формулирует аудиовизуальное выделение целевого говорящего как проверку идентичности, а не просто как улучшение звучания смеси. В обычных наборах separator может выдавать акустически доминирующий голос и все равно выглядеть неплохо по части метрик. QIANGDA специально устроен так, чтобы один и тот же двухголосый фрагмент проверялся дважды: нужно извлечь говорящего A по его видео и говорящего B по другому видео.
Метод. QIANGDA содержит реальные Mandarin сцены с двумя говорящими, синхронным multi-view video и отдельными A-only/B-only записями, которые служат in-scene speaker references. Дополнительно авторы курируют VOXBLINK2-AVSE из VoxBlink2: после аудиовизуальной валидации и DNSMOS filtering остается 250828 пар, 28421 identity и 766.17 часа речи. Модель использует замороженные 1280-мерные AV-HuBERT features, input-end visual fusion, FiLM-модуляцию и target-conditioned обучение; идентичность проверяется WeSpeaker ResNet34, а контент - Qwen3-ASR-1.7B CER.
Результаты. QIANGDA включает 77 сцен, 7598 клипов общей длительностью 11.84 часа, 6038 оцениваемых смесей и 12076 target-speaker строк. На полном manifest лучший архивный checkpoint получает CER 0.2261, target similarity 0.6425, interferer similarity 0.3114 и speaker margin 0.3311. В OSD-first strict evaluation он дает 82.22% strict correct, 5.33% wrong speaker и 69.53% both-output strict success.
Ограничения. QIANGDA Mandarin-only и относительно небольшой по часам, хотя хорошо контролируемый по сценам. Поскольку физически изолированных clean sources нет, авторы не используют target SI-SDR как основную метрику и переходят к CER, speaker margin и OSD-first оценке. Самый сильный checkpoint без auxiliary speaker loss помечен как архивный: его launch CLI не полностью сохранен, поэтому причинный эффект этой настройки нельзя считать доказанным без повторного matched retraining.
Фишка из статьи. Особенно интересна строгая OSD-first оценка. Она сначала отсекает остаточное наложение речи, а уже потом решает, правильный ли говорящий извлечен. Это ловит ошибку, которую forced speaker comparison мог бы замаскировать.
| Конфигурация | CER | Target sim | Interferer sim | Margin | Residual overlap | Strict correct | Both strict |
|---|---|---|---|---|---|---|---|
| AVSR + VB2 + FiLM + margin loss | 0.2793 | 0.6233 | 0.3297 | 0.2936 | 19.39% | 74.33% | 58.51% |
| AVSR + VB2 + FiLM, no speaker loss | 0.2261 | 0.6425 | 0.3114 | 0.3311 | 12.45% | 82.22% | 69.53% |
| ResNet visual features | 0.7206 | 0.4928 | 0.4928 | 0.0000 | 84.28% | 7.86% | 0.00% |
Как это читать: равные target и interferer similarity у ResNet-строки показывают провал идентичности, даже если система что-то отделяет. Для аудиовизуального выделения речи такая диагностика ценнее, чем средний показатель качества смеси.