Cocktail-party systems: что работает в CHiME-9 MCoRec
Эта работа анализирует системы для CHiME-9 MCoRec, где нужно в условиях cocktail-party распознать несколько параллельных разговоров и сгруппировать дикторов по беседам. Это не статья про один новый блок, а разбор того, какие стратегии реально помогают: аудио-визуальное распознавание, target speech separation и семантическая группировка через большие языковые модели. Интересна она как инженерная карта сложной мультимодальной задачи.
Метод. MCoRec содержит 360-градусное видео и одноканальный звук; train/dev/eval включают 56/25/67 сессий и 5.6/2.5/6.9 часа. Системы строятся из компонентов: активность говорящего на видео, аудио-визуальное распознавание речи, иногда явное выделение целевого диктора, затем clustering дикторов в разговоры. Авторы сравнивают разные submitted systems и разбирают ошибки по числу дикторов, числу разговоров и speaking activity.
Результаты. Лучший eval-результат S1: WER 0.3018, conversation F1 0.9572, JointError 0.1597. Базовая система имеет WER 0.5199, F1 0.8194 и JointError 0.3730; это около 57% относительного снижения JointError. S4 близка к лидеру: WER 0.3034, F1 0.9522, JointError 0.1626. Авторы делают важный вывод: когда conversation F1 выше примерно 0.95, итоговую ошибку уже в основном определяет WER, а не clustering.
Ограничения. Работа анализирует challenge-системы, поэтому компоненты и обучение неоднородны, а строгие причинные выводы ограничены. Датасет небольшой по длительности и доступен с условиями; коммерческая переносимость неочевидна. Кроме того, высокие overlap-сценарии остаются тяжелыми: в некоторых сессиях с 90-95% перекрытия все системы дают WER около 0.45-0.6.
Фишка из статьи. Самый полезный разбор - разделение влияния числа дикторов и числа разговоров: первое бьет по распознаванию, второе - по группировке.
| Сравнение | Число | Что означает |
|---|---|---|
| Baseline eval | JointError 0.3730 | Стартовая точка MCoRec |
| S1 eval | 0.1597 | Лучший общий результат |
| S4 eval | 0.1626 | Почти тот же уровень другим дизайном |
| S1, 2 speakers | WER 0.219, F1 1.00 | Простые сцены почти решены |
| S1, 7 speakers | WER 0.509, F1 1.00 | Группировка держится, но распознавание ломается |
Как это читать: это помогает правильно инвестировать усилия: после достаточно хорошей группировки главный узкий участок - устойчивое аудио-визуальное распознавание речи при высокой плотности говорящих.