Распознавание речи Аудио-видео Cocktail party
arXiv cs.CL

Cocktail-party systems: что работает в CHiME-9 MCoRec

arXiv:2608.08510

Эта работа анализирует системы для CHiME-9 MCoRec, где нужно в условиях cocktail-party распознать несколько параллельных разговоров и сгруппировать дикторов по беседам. Это не статья про один новый блок, а разбор того, какие стратегии реально помогают: аудио-визуальное распознавание, target speech separation и семантическая группировка через большие языковые модели. Интересна она как инженерная карта сложной мультимодальной задачи.

Метод. MCoRec содержит 360-градусное видео и одноканальный звук; train/dev/eval включают 56/25/67 сессий и 5.6/2.5/6.9 часа. Системы строятся из компонентов: активность говорящего на видео, аудио-визуальное распознавание речи, иногда явное выделение целевого диктора, затем clustering дикторов в разговоры. Авторы сравнивают разные submitted systems и разбирают ошибки по числу дикторов, числу разговоров и speaking activity.

Результаты. Лучший eval-результат S1: WER 0.3018, conversation F1 0.9572, JointError 0.1597. Базовая система имеет WER 0.5199, F1 0.8194 и JointError 0.3730; это около 57% относительного снижения JointError. S4 близка к лидеру: WER 0.3034, F1 0.9522, JointError 0.1626. Авторы делают важный вывод: когда conversation F1 выше примерно 0.95, итоговую ошибку уже в основном определяет WER, а не clustering.

Ограничения. Работа анализирует challenge-системы, поэтому компоненты и обучение неоднородны, а строгие причинные выводы ограничены. Датасет небольшой по длительности и доступен с условиями; коммерческая переносимость неочевидна. Кроме того, высокие overlap-сценарии остаются тяжелыми: в некоторых сессиях с 90-95% перекрытия все системы дают WER около 0.45-0.6.

Фишка из статьи. Самый полезный разбор - разделение влияния числа дикторов и числа разговоров: первое бьет по распознаванию, второе - по группировке.

СравнениеЧислоЧто означает
Baseline evalJointError 0.3730Стартовая точка MCoRec
S1 eval0.1597Лучший общий результат
S4 eval0.1626Почти тот же уровень другим дизайном
S1, 2 speakersWER 0.219, F1 1.00Простые сцены почти решены
S1, 7 speakersWER 0.509, F1 1.00Группировка держится, но распознавание ломается

Как это читать: это помогает правильно инвестировать усилия: после достаточно хорошей группировки главный узкий участок - устойчивое аудио-визуальное распознавание речи при высокой плотности говорящих.

Оригинальная статья на arXiv