The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR
Авторы показывают, что конфликт между ранним завершением реплики и точным распознаванием во многом создаёт сама разметка. Вместо отдельного детектора конца речи они учат Qwen3-ASR 0.6B выдавать причинно допустимые состояния по тем данным, которые действительно доступны в данный момент.
Метод. Около 20 тыс. синтетических примеров снабжаются метками продолжения, завершения и контекстных подсказок без утечки будущей тишины. LoRA-дообучение объединяет распознавание, решение о ходе и использование сущностей из контекста. Отдельные контрфактические примеры учат не копировать отвлекающие подсказки.
Результаты. На основном наборе причинный шлюз достигает полноты 0,969, медианной задержки 0,39 с, 95-го процентиля 0,70 с и 0,3 ложного срабатывания в минуту при медианном WER 0,28. На свежем наборе полнота равна 0,924, задержка 0,42 с и ложные срабатывания 0,2 в минуту. Полнота контекстных сущностей растёт с 66,7% до 95,6%.
Ограничения. Это небольшой синтетический опыт, а объединённая модель всё же повышает ложные срабатывания до 0,97 в минуту и ухудшает офлайновый WER на 1,1–2,7 пункта. Реальные перебивки, шумные комнаты и разные языки почти не покрыты.
Фишка из статьи. Добавление одной секунды тишины превращает «трудный» контрольный набор в простой и раскрывает утечку будущего в обычной разметке.
| Набор разметки | Полнота без добавленной тишины | Полнота с 1 с тишины |
|---|---|---|
| Opposed | 0,10 | 1,00 |
| Mixed | 0,82 | 0,98 |
Как это читать: модель не стала в десять раз умнее от добавленного молчания — ей просто показали признак, которого в реальном времени ещё нет. Поэтому сравнение потоковых границ обязано фиксировать, сколько будущего звука скрыто в метке.