потоковое распознавание разделение говорящих задержка
arXiv eess.AS

VibeVoice-ASR-Streaming Technical Report

arXiv:2609.02812

VibeVoice-ASR-Streaming строит потоковую расшифровку многоголосной встречи сразу с метками говорящих, не отделяя диаризацию в самостоятельный последующий этап. Модель чередует фиксированные куски звука с уже выданным текстом и небольшим заглядыванием вперёд, поэтому основная ценность отчёта — измеренный обмен между задержкой, WER и ошибками назначения говорящего.

Метод. Распознаватель масштаба 7B получает очередной звуковой блок, предшествующие блоки и текстовую историю, после чего авторегрессионно продолжает протокол. Основной режим использует 22 кадра и четыре кадра будущего контекста, что соответствует ожидаемой задержке 2,0 с; более быстрый режим использует 15 кадров. Проверка охватывает AISHELL-4, AliMeeting, AMI и многоязычный MLC.

Результаты. Средний WER пяти наборов равен 24,66% против 25,23% у Gemini и 39,31–41,39% у трёх коммерческих потоковых служб. Ожидаемая задержка составляет 2,00 с против 8,21 с у Azure и 9,12 с до первого результата у Google. На A100 RTF лежит между 0,073 и 0,104, то есть обработка идёт существенно быстрее реального времени. Однако потоковый режим хуже офлайнового: например, на AISHELL-4 WER растёт с 19,87% до 22,76%, а cpWER — с 22,03% до 28,70%.

Ограничения. Модель проверена на записях не длиннее восьми минут, перекрывающиеся реплики сериализуются в одну текстовую последовательность. Измерения скорости получены только на A100 в bfloat16 и с пакетом 1. Фактический первый ответ приходит позже установившейся задержки: примерно через 3,5 с в основном режиме.

Фишка из статьи. Небольшое заглядывание вперёд особенно помогает не словам, а согласованию текста с говорящими.

Будущий контекст, кадровОжидаемая задержка, сСредний WER, %Средний cpWER, %
01,4727,1835,88
21,7325,9134,09
42,0024,6631,55

Как это читать: дополнительные 0,53 с уменьшают WER на 2,52 пункта, а cpWER — на 4,33. Значит, будущий звук чаще разрешает границу и личность говорящего, чем просто исправляет отдельное слово.

Оригинальная статья на arXiv