Non-verbal ASR: breaths, laugh и cry как полноценные токены
Статья хороша тем, что рассматривает ASR не как чистую транскрипцию слов, а как распознавание речевого события: дыхание, смех, кашель, вздох или плач могут быть важны для ассистента, call-center analytics и accessibility. Авторы строят RNN-T систему, которая вставляет non-verbal vocalization tags в поток распознавания и специально борется с long-tail классами.
Метод. Базовая модель — примерно 200M-parameter RNN-T с Emformer encoder. Система распознает семь тегов: breath, laugh, swallow, smack, sigh, cry и cough; WER считается после удаления этих тегов, а качество NV — через sentence-level precision/recall/F1. Основные приемы: curriculum learning для редких классов, inter-token transfer от частых NV к редким и class-balanced voice-conversion augmentation для длинного хвоста.
Результаты. На curated in-house English eval из 1700 utterances модель резко превосходит Whisper-D по большинству non-verbal тегов и одновременно снижает WER с 2.40 до 1.62. Например, для breath F1 растет с 11.0 до 72.9, для swallow — с 1.5 до 86.2, для sigh — с 43.6 до 74.5, а для cough — с 74.5 до 89.0. Для редкого cry curriculum learning поднимает F1 с 28.9 до 36.0 при 100 примерах и с 41.0 до 46.2 при 4800 примерах.
Ограничения. Данные in-house и английские, поэтому перенос на другие языки, микрофоны и домены остается открытым. Sentence-level exact tag evaluation полезна для продукта, но не показывает timing ошибки внутри utterance. Voice conversion augmentation помогает не всегда: авторы сами показывают, что без аккуратного class balancing синтетика может ухудшать редкие классы.
Фишка из статьи. Самый инженерно полезный результат — transfer между non-verbal токенами: частые классы вроде breath и laugh могут резко улучшать редкий cry даже при 400 реальных cry examples.
| Training setup для cry | Cry F1 | WER | Комментарий |
|---|---|---|---|
| Только cry, 400 examples | 32.1 | 3.3% | редкий класс учится слабо |
| + breath | 67.6 | не указан в таблице | сильный transfer от частого дыхания |
| + laugh | 61.4 | не указан в таблице | precision для cry доходит до 79.6 |
| + breath + laugh | 69.0 | 1.9% | лучший transfer setup |
| Full system | 78.3 | 1.6% | добавлены остальные приемы и данные |
Как это читать: для paralinguistic ASR не обязательно собирать огромную разметку каждого редкого звука отдельно. Если акустические паттерны частично общие, можно обучать “семейство” non-verbal tokens и использовать transfer как способ вытянуть long-tail.