потоковое распознавание границы реплик причинная разметка
arXiv eess.AS

The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR

arXiv:2609.04225

Авторы показывают, что конфликт между ранним завершением реплики и точным распознаванием во многом создаёт сама разметка. Вместо отдельного детектора конца речи они учат Qwen3-ASR 0.6B выдавать причинно допустимые состояния по тем данным, которые действительно доступны в данный момент.

Метод. Около 20 тыс. синтетических примеров снабжаются метками продолжения, завершения и контекстных подсказок без утечки будущей тишины. LoRA-дообучение объединяет распознавание, решение о ходе и использование сущностей из контекста. Отдельные контрфактические примеры учат не копировать отвлекающие подсказки.

Результаты. На основном наборе причинный шлюз достигает полноты 0,969, медианной задержки 0,39 с, 95-го процентиля 0,70 с и 0,3 ложного срабатывания в минуту при медианном WER 0,28. На свежем наборе полнота равна 0,924, задержка 0,42 с и ложные срабатывания 0,2 в минуту. Полнота контекстных сущностей растёт с 66,7% до 95,6%.

Ограничения. Это небольшой синтетический опыт, а объединённая модель всё же повышает ложные срабатывания до 0,97 в минуту и ухудшает офлайновый WER на 1,1–2,7 пункта. Реальные перебивки, шумные комнаты и разные языки почти не покрыты.

Фишка из статьи. Добавление одной секунды тишины превращает «трудный» контрольный набор в простой и раскрывает утечку будущего в обычной разметке.

Набор разметкиПолнота без добавленной тишиныПолнота с 1 с тишины
Opposed0,101,00
Mixed0,820,98

Как это читать: модель не стала в десять раз умнее от добавленного молчания — ей просто показали признак, которого в реальном времени ещё нет. Поэтому сравнение потоковых границ обязано фиксировать, сколько будущего звука скрыто в метке.

Оригинальная статья на arXiv