Распознавание речи Выравнивание Дисфлюентность
Распознавание речи

Дословное распознавание речи как управляемая политика транскрипции

eF1 93.8%

Эта статья разбирает проблему, которую легко пропустить при оценке распознавания речи: модель не всегда ошибается в словах, иногда она просто выбирает другую политику транскрипции. Один и тот же фрагмент можно записать дословно, с паузами, повторами и звуками, или как очищенный intended-текст; если это не задано явно, WER смешивает ошибку распознавания и стиль разметки. Авторы показывают, что у Whisper уже есть скрытая способность к обоим режимам, и делают ее управляемой через специальные токены задачи, обучение внимания для временных меток и режим verbatimize.

Метод. Система стартует с Whisper-medium, расширяет словарь токенами заполненных пауз, паралингвистических событий и режимов verbatim/intended. Важная часть не в самом добавлении токенов, а в coverage-aware разбиении: если корпус размечает дисфлюентности, но не звуки, модель получает только соответствующие управляющие токены, чтобы не считать отсутствие события доказательством его акустического отсутствия. Для временных меток авторы обучают cross-attention головы на word-level alignment, а режим verbatimize учит модель брать intended-текст как подсказку и восстанавливать дословную форму по аудио.

Результаты. На German DisfluencySpeech без немецких дословных обучающих данных event F1 растет с 10.3% у исходного Whisper до 78.9% уже при обучении только embedding-ов режимов, а полная настройка декодера с тегами дает 93.8%; та же модель без тегов дает только 60.1%. На английском наборе DisfluencySpeech полная версия достигает 90.7% event F1. Для временных границ на FluencyBank средняя абсолютная ошибка падает с 568 мс у базового Whisper до 102 мс у обученного варианта с усредненными attention-головами и sharpening; это лучше, чем MFA на дисфлюентной речи (142 мс) и WhisperX (200 мс). В задаче verbatimize на ICSI rare-word set content loss rate снижается с 9.4% до 1.3%, а recall редких слов растет с 6.8% до 96.1%.

Ограничения. Английский и немецкий близки типологически, поэтому zero-shot перенос на более далекие языки пока не доказан. Немецкий оценочный набор небольшой, временная разметка для обучения опирается на forced alignment, а сама работа не показывает latency-профиль для потокового продукта. Также часть метрик оценивает форму транскрипта, а не пользовательскую полезность.

Фишка из статьи. Самый полезный вывод: управляющие токены нужны не только для удобства интерфейса, они резко уменьшают конфликт разметок. При одной и той же полной настройке декодера модель с тегами и без тегов ведет себя принципиально по-разному.

УсловиеEnglish eF1German eF1English iWERGerman iWER
FT0, с тегами режима90.7%93.8%9.4%4.9%
FT0, без тегов режима80.7%60.1%18.8%17.0%
Исходный Whisper12.0%10.3%14.2%5.7%

Как это читать: теги не просто добавляют команду пользователю, а разрубают скрытую неоднозначность между дословным и очищенным стилем. Особенно показателен немецкий zero-shot случай: без тегов модель почти теряет управляемость, хотя веса декодера уже были дообучены.

Оригинальная статья на arXiv