Умные очки Разделение говорящих Понимание речи
arXiv eess.AS

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

arXiv:2608.12034

SmartGlasses Challenge задает реалистичную проверку речи для носимого устройства: четыре микрофонных канала, длинные встречи, перекрытия голосов, временные метки и вопросы, на которые недостаточно одной расшифровки. Самый важный вывод - короткий диалог двух людей уже распознается неплохо, но при 5-8 участниках ошибка атрибуции и текста резко выходит из практического диапазона.

Метод. Набор содержит 106,98 часа, 714 сеансов и 88 говорящих. Первый трек - 518 диалогов двух людей общей длительностью 44,95 часа; второй - 196 встреч на 3-8 участников и 62,03 часа. Системы должны выдавать текст, говорящего и временные границы, а также отвечать на 3 509 вопросов трех типов: акустических, смысловых и совместных. Для распознавания используется tcpCER, допускающая оптимальное сопоставление потоков говорящих.

Результаты. Лидер получает tcpCER 5,23% в диалогах и 27,95% на встречах; следующий результат на встречах уже 48,92%, официальный VibeVoice-ASR - 57,81%. В понимании речи лидер достигает точности 0,888 и 0,930 против 0,699 и 0,659 у Qwen3-Omni-30B-A3B. Средняя tcpCER по системам растет с 15,5% при трех участниках до 31,9% при четырех и 49,3% при пяти, оставаясь выше 63% для шести-восьми.

Ограничения. Все записи мандаринские, участникам 19-34 года, а разговоры строились по подготовленным с помощью языковой модели сценариям, поэтому это не полностью спонтанная повседневная среда. Описания команд различаются, но контролируемых абляций между способами усреднения каналов, лучеформированием и разделением нет. Группы по числу говорящих на тесте малы и неравномерны. Лидер использует внешнее многодикторное предобучение, что усложняет прямое сравнение архитектур.

Фишка из статьи. Количество участников оказывается отдельным фактором трудности, а не просто косвенной заменой доли перекрытий.

Участников во встречеСредняя tcpCER
315,5%
431,9%
549,3%
6-8более 63%

Как это читать: уже переход от трех к четырем людям удваивает среднюю ошибку, а при пяти она почти достигает 50%. Даже при совершенном подавлении шума системе нужно долго удерживать личности, обрабатывать одновременную речь и согласовывать текст с временными границами.

Оригинальная статья на arXiv