ASR Non-verbal Paralinguistics
Paralinguistic ASR

Non-verbal ASR: breaths, laugh и cry как полноценные токены

F1 89.0

Статья хороша тем, что рассматривает ASR не как чистую транскрипцию слов, а как распознавание речевого события: дыхание, смех, кашель, вздох или плач могут быть важны для ассистента, call-center analytics и accessibility. Авторы строят RNN-T систему, которая вставляет non-verbal vocalization tags в поток распознавания и специально борется с long-tail классами.

Метод. Базовая модель — примерно 200M-parameter RNN-T с Emformer encoder. Система распознает семь тегов: breath, laugh, swallow, smack, sigh, cry и cough; WER считается после удаления этих тегов, а качество NV — через sentence-level precision/recall/F1. Основные приемы: curriculum learning для редких классов, inter-token transfer от частых NV к редким и class-balanced voice-conversion augmentation для длинного хвоста.

Результаты. На curated in-house English eval из 1700 utterances модель резко превосходит Whisper-D по большинству non-verbal тегов и одновременно снижает WER с 2.40 до 1.62. Например, для breath F1 растет с 11.0 до 72.9, для swallow — с 1.5 до 86.2, для sigh — с 43.6 до 74.5, а для cough — с 74.5 до 89.0. Для редкого cry curriculum learning поднимает F1 с 28.9 до 36.0 при 100 примерах и с 41.0 до 46.2 при 4800 примерах.

Ограничения. Данные in-house и английские, поэтому перенос на другие языки, микрофоны и домены остается открытым. Sentence-level exact tag evaluation полезна для продукта, но не показывает timing ошибки внутри utterance. Voice conversion augmentation помогает не всегда: авторы сами показывают, что без аккуратного class balancing синтетика может ухудшать редкие классы.

Фишка из статьи. Самый инженерно полезный результат — transfer между non-verbal токенами: частые классы вроде breath и laugh могут резко улучшать редкий cry даже при 400 реальных cry examples.

Training setup для cryCry F1WERКомментарий
Только cry, 400 examples32.13.3%редкий класс учится слабо
+ breath67.6не указан в таблицесильный transfer от частого дыхания
+ laugh61.4не указан в таблицеprecision для cry доходит до 79.6
+ breath + laugh69.01.9%лучший transfer setup
Full system78.31.6%добавлены остальные приемы и данные

Как это читать: для paralinguistic ASR не обязательно собирать огромную разметку каждого редкого звука отдельно. Если акустические паттерны частично общие, можно обучать “семейство” non-verbal tokens и использовать transfer как способ вытянуть long-tail.

Оригинальная статья на arXiv