Дальнее поле Реверберация Метрики качества
Извлечение целевого голоса

Real-TSE: данные важнее новой архитектуры для извлечения голоса

TER 0.37

Это технический отчет MERL для Real-TSE Challenge, но он интересен шире соревнования: авторы показывают, что на реальных дальнепольных, шумных и реверберирующих записях решает не только архитектура, а подготовка данных. Они берут базовую модель извлечения целевого голоса и выигрывают второй трек за счет очистки корпусов, реалистичного curriculum и псевдоцелей из close-talk микрофонов. Отдельная ценность статьи - жесткая проверка метрик DNSMOS и сходства говорящего: их можно сильно накрутить почти без изменения ошибок распознавания и VAD-F1.

Метод. Архитектурно система остается близкой к baseline: BSRNN для извлечения и более сильный EcapaTDNN-1024 для эмбеддинга целевого говорящего. Основная работа в данных. Одноголосые корпуса очищаются ClearerVoice, фильтруются по speaker cosine similarity выше 0.85 и DNSMOS выше 3.0, затем Montreal Forced Aligner помогает не брать неречевые enrollment-фрагменты. Обучение идет в четыре стадии: полностью наложенные смеси, шумные симулированные разговоры, дальнепольные смеси CHiME/AMI/AISHELL и реальные дальнепольные смеси с псевдоцелями. На поздних стадиях используется magnitude MS-STFT loss, потому что фаза псевдоцелей не обязана совпадать с дальнепольной смесью.

Результаты. На dev-наборе TER постепенно снижается с 0.53 после первой стадии до 0.44, 0.39 и 0.37 после четвертой. F1 по речевой активности растет с 0.86 до 0.88, speaker similarity - с 0.48 до 0.55, DNSMOS OVRL - с 2.42 до 2.84. Вариант Pure, обученный без metric-aware losses на последних стадиях, сохраняет тот же TER 0.37 и DNSMOS 2.89, но имеет меньшую speaker similarity 0.47. Это важный результат: прямая оптимизация метрик не обязательно улучшает слышимое качество или основную ошибку извлечения.

Ограничения. Это отчет о соревновании, а не универсальный benchmark архитектур: часть результата зависит от правил Real-TSE, доступных корпусов и качества псевдоцелей. Реальные clean targets отсутствуют, поэтому обучение вынуждено опираться на обработанные close-talk проекции. Нет систематической субъективной оценки, а сами авторы показывают, что неинтрузивные метрики качества и сходства говорящего хрупки. Вывод о данных сильный, но перенос на другие языки, комнаты и микрофонные схемы требует отдельной проверки.

Фишка из статьи. Самый полезный отрицательный результат - атака на метрики. Небольшая покадровая добавка к выходному сигналу за 200 шагов резко поднимает DNSMOS или сходство говорящего, но TER, precision/recall и F1 остаются теми же.

АтакаTERF1SPKDNSMOS OVRL
Нет0.370.880.522.83
DNSMOS0.370.880.524.18
SPK-SIM EN0.370.880.822.80
DNSMOS + SPK-SIM EN0.370.880.824.11
DNSMOS + SPK-SIM EN/CN0.370.880.994.07

Как это читать: leaderboard-метрика может перестать быть мерой качества, если модель или постобработка научились напрямую ее оптимизировать. Для извлечения речи это практический сигнал: TER/F1, субъективное прослушивание и устойчивые метрики должны рассматриваться вместе.

Оригинальная статья на arXiv