Real-TSE: данные важнее новой архитектуры для извлечения голоса
Это технический отчет MERL для Real-TSE Challenge, но он интересен шире соревнования: авторы показывают, что на реальных дальнепольных, шумных и реверберирующих записях решает не только архитектура, а подготовка данных. Они берут базовую модель извлечения целевого голоса и выигрывают второй трек за счет очистки корпусов, реалистичного curriculum и псевдоцелей из close-talk микрофонов. Отдельная ценность статьи - жесткая проверка метрик DNSMOS и сходства говорящего: их можно сильно накрутить почти без изменения ошибок распознавания и VAD-F1.
Метод. Архитектурно система остается близкой к baseline: BSRNN для извлечения и более сильный EcapaTDNN-1024 для эмбеддинга целевого говорящего. Основная работа в данных. Одноголосые корпуса очищаются ClearerVoice, фильтруются по speaker cosine similarity выше 0.85 и DNSMOS выше 3.0, затем Montreal Forced Aligner помогает не брать неречевые enrollment-фрагменты. Обучение идет в четыре стадии: полностью наложенные смеси, шумные симулированные разговоры, дальнепольные смеси CHiME/AMI/AISHELL и реальные дальнепольные смеси с псевдоцелями. На поздних стадиях используется magnitude MS-STFT loss, потому что фаза псевдоцелей не обязана совпадать с дальнепольной смесью.
Результаты. На dev-наборе TER постепенно снижается с 0.53 после первой стадии до 0.44, 0.39 и 0.37 после четвертой. F1 по речевой активности растет с 0.86 до 0.88, speaker similarity - с 0.48 до 0.55, DNSMOS OVRL - с 2.42 до 2.84. Вариант Pure, обученный без metric-aware losses на последних стадиях, сохраняет тот же TER 0.37 и DNSMOS 2.89, но имеет меньшую speaker similarity 0.47. Это важный результат: прямая оптимизация метрик не обязательно улучшает слышимое качество или основную ошибку извлечения.
Ограничения. Это отчет о соревновании, а не универсальный benchmark архитектур: часть результата зависит от правил Real-TSE, доступных корпусов и качества псевдоцелей. Реальные clean targets отсутствуют, поэтому обучение вынуждено опираться на обработанные close-talk проекции. Нет систематической субъективной оценки, а сами авторы показывают, что неинтрузивные метрики качества и сходства говорящего хрупки. Вывод о данных сильный, но перенос на другие языки, комнаты и микрофонные схемы требует отдельной проверки.
Фишка из статьи. Самый полезный отрицательный результат - атака на метрики. Небольшая покадровая добавка к выходному сигналу за 200 шагов резко поднимает DNSMOS или сходство говорящего, но TER, precision/recall и F1 остаются теми же.
| Атака | TER | F1 | SPK | DNSMOS OVRL |
|---|---|---|---|---|
| Нет | 0.37 | 0.88 | 0.52 | 2.83 |
| DNSMOS | 0.37 | 0.88 | 0.52 | 4.18 |
| SPK-SIM EN | 0.37 | 0.88 | 0.82 | 2.80 |
| DNSMOS + SPK-SIM EN | 0.37 | 0.88 | 0.82 | 4.11 |
| DNSMOS + SPK-SIM EN/CN | 0.37 | 0.88 | 0.99 | 4.07 |
Как это читать: leaderboard-метрика может перестать быть мерой качества, если модель или постобработка научились напрямую ее оптимизировать. Для извлечения речи это практический сигнал: TER/F1, субъективное прослушивание и устойчивые метрики должны рассматриваться вместе.