PS4: выделение целевого диктора без чистых эталонов
PS4 решает прикладную проблему выделения целевого диктора в реальных разговорных смесях, где нет чистой целевой дорожки для обычного обучения по эталону. Вместо имитационных смесей авторы строят корпус из 71,771 реального фрагмента с наложением речи, enrollment-аудио, расшифровкой и покадровой активностью диктора. Главный ход - обучать BSRNN-разделитель через несколько прокси-целей: распознавание, сходство с диктором, активность речи и предсказанную субъективную качество речи.
Метод. Исходная модель - предварительно обученный BSRNN для выделения целевого диктора; при дообучении обновляется только разделитель. Потери включают cross-entropy распознавания по расшифровке, ранжирующую потерю по сходству speaker embeddings, покадровую VAD-потерю и дифференцируемый DNSMOS OVRL как сигнал качества. Корпус собран из AISHELL-4, AliMeeting, AMI, CHiME-6 и DipCo, поэтому включает китайские и английские разговоры, разные микрофонные условия и реальное наложение.
Результаты. На REAL-T development set PS4 получает overall TER 0.473, SIM 0.631, DNSMOS OVRL 3.377 и timing F1 0.888. На отдельных корпусах лучший TER достигается на AMI: 0.388 при SIM 0.714 и F1 0.902. На официальной таблице REAL-T validation PS4 занимает второе место: TER 0.639, F1 0.871, SIM 0.565 и DNSMOS-P808 3.128; при этом у него лучшие F1 и SIM среди перечисленных систем.
Ограничения. Это challenge-oriented работа, поэтому часть выводов зависит от метрик REAL-T и набора корпусов. Прокси-цели могут расходиться с реальным восприятием: например, PS4 лучше по сходству с диктором и timing F1, но уступает MERL по DNSMOS-P808. Кроме того, DNSMOS как обучающий сигнал остается предсказательной метрикой, а не настоящей слушательской оценкой.
Фишка из статьи. Интересен не общий рейтинг, а trade-off на leaderboard: PS4 проигрывает лидеру в TER и DNSMOS, но выигрывает в сохранении личности диктора и временной активности.
| Система | TER ↓ | F1 ↑ | SIM ↑ | DNSMOS-P808 ↑ |
|---|---|---|---|---|
| MERL | 0.613 | 0.861 | 0.538 | 3.371 |
| PS4 | 0.639 | 0.871 | 0.565 | 3.128 |
| CARTSE | 0.651 | 0.857 | 0.544 | 3.138 |
| BSRNN EMB | 0.829 | 0.829 | 0.417 | 2.875 |
| BSRNN TFMAP | 0.838 | 0.829 | 0.443 | 2.756 |
Как это читать: PS4 не просто «лучше baseline», а смещает баланс в сторону правильного диктора и правильной временной маски. Для систем выделения речи это часто важнее, чем небольшая разница в общей ошибке текста.