VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events
VAANI Noise Event Dataset добавляет к многоязычной спонтанной речи не одну метку «шумно», а временные границы конкретных помех: транспорта, животных, музыки, детского голоса и человеческих неречевых звуков. Такой уровень разметки полезен для устойчивого распознавания, обнаружения событий и проверки моделей, которые должны различать фон и содержание речи.
Метод. Выпуск содержит 72 756 мобильных записей общей длительностью 122,17 часа, 38 541 говорящего, 58 языков, 30 штатов и 162 района Индии. Размечено 106 892 шумовых события. Исполнители задавали тип и границы события; 11 111 отрезков длительностью 21,85 часа прошли проверку, а 61 645 отрезков, 100,32 часа, пока остаются в непроверенной части.
Результаты. Человеческие неречевые звуки встречаются в 37,8% отрезков, животные — в 31,3%, транспорт — в 24,9%, детский голос — в 16,1%. Категории сильно различаются по длительности: 37 739 человеческих событий занимают лишь 4,5 часа, тогда как 24 601 событие животных — 22,4 часа. Набор описывает реальную среду сбора лучше чистого корпуса, однако статья не приводит базовых результатов распознавания или улучшения речи.
Ограничения. Около 82% длительности ещё не прошло полную проверку временных меток. Языковой состав резко несбалансирован: на хинди приходится 83,9 из 122,17 часа. Записи одноканальные и сделаны на телефоны, а отсутствие базовых моделей не позволяет оценить, насколько разметка помогает конкретной задаче.
Фишка из статьи. Число событий само по себе вводит в заблуждение: короткие человеческие шумы многочисленны, но животные и техника занимают гораздо больше времени.
| Категория | Отрезки с событием | Доля отрезков, % | События | Суммарно, ч |
|---|---|---|---|---|
| Человеческий неречевой звук | 27 533 | 37,8 | 37 739 | 4,5 |
| Животные | 22 746 | 31,3 | 24 601 | 22,4 |
| Транспорт | 18 150 | 24,9 | 20 603 | 12,5 |
| Детский голос | 11 708 | 16,1 | 12 376 | 10,5 |
| Музыка | 6879 | 9,5 | 6978 | 9,7 |
Как это читать: для обучения по кадрам важнее суммарная длительность, а для обнаружения редких всплесков — число эпизодов. VAANI позволяет строить оба протокола, но проверенную и непроверенную части следует держать раздельно.