REAL-TSE: извлечение целевого говорящего в настоящих разговорах
REAL-TSE переносит извлечение целевого говорящего из удобных синтетических смесей в настоящие разговорные записи. Это важно для встреч, слуховых устройств и связи: в реальности есть перекрытия, реверберация, шум, разные каналы записи и живое turn-taking поведение. Статья описывает challenge к IEEE SLT 2026 с двумя режимами: потоковым до 100 мс алгоритмической задержки и offline-режимом с полным контекстом.
Метод. Каждый пример состоит из многоговорящей смеси и enrollment-записи целевого говорящего; система должна оставить только целевую речь. Оценка многомерная: Token Error Rate для разборчивости, SpkSim для сходства с целевым говорящим, DNSMOS-P808 для воспринимаемого качества и F1 активности целевого говорящего. Данные включают 6,991 trials, 2,309 уникальных смесей и 11.3 часа mixture audio на Mandarin и английском. EVAL-2 специально собран в новых условиях: встречи, кафе, дома, автомобиль, микрофоны H1/H2, телефон, headset и внешние enrollment-записи.
Результаты. Базовые BSRNN-системы, обученные только на синтетическом English Libri2Mix, служат нижней планкой. На EVAL-2 BSRNN_TFMAP_CAUSAL получает TER 0.808, SIM 0.391, DNSMOS-P808 2.75 и F1 0.835; некаузальный BSRNN_EMB имеет TER 0.838, SIM 0.357, P808 2.85 и F1 0.830. В challenge было по 12 валидных команд на каждый track. Лучшие системы заметно превосходят baselines, но ни одна не доминирует по всем четырем метрикам: одни лучше сохраняют текст, другие личность говорящего или субъективное качество.
Ограничения. Это обзор challenge, а не единый новый алгоритм. Открытая политика обучения делает результаты ближе к практике, но усложняет строгую атрибуцию, почему конкретная система выиграла. Еще один риск: публичные нейросетевые метрики можно переоптимизировать. Авторы прямо показывают, что coarse labels вроде "meeting" или "car" плохо объясняют сложность: важны доля целевого говорящего, канал, перекрытия, расстояние и локальные шумы.
Фишка из статьи. Авторы не просто поменяли DNSMOS-метрику, а показали, почему это нужно. Старый DNSMOS OVRL оказался почти не связан с человеческим MOS у лучших submissions, особенно в online track.
| Метрика качества | Track 1 LCC | Track 1 SRCC | Track 2 LCC | Track 2 SRCC | Overall LCC/SRCC |
|---|---|---|---|---|---|
| DNSMOS-OVRL | 0.003 | 0.040 | 0.182 | 0.186 | 0.165 / 0.186 |
| DNSMOS-P808 | 0.453 | 0.380 | 0.466 | 0.463 | 0.489 / 0.460 |
| DNSMOS-PRO | 0.156 | 0.115 | 0.229 | 0.234 | 0.233 / 0.230 |
Как это читать: OVRL давал красивые числа, но почти не следовал человеческой оценке. Поэтому в таком benchmark метрика должна быть частью дизайна безопасности, иначе системы начинают оптимизировать показатель, а не звучание.