речевой корпус шумовые события индийские языки
arXiv eess.AS

VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events

arXiv:2609.02474

VAANI Noise Event Dataset добавляет к многоязычной спонтанной речи не одну метку «шумно», а временные границы конкретных помех: транспорта, животных, музыки, детского голоса и человеческих неречевых звуков. Такой уровень разметки полезен для устойчивого распознавания, обнаружения событий и проверки моделей, которые должны различать фон и содержание речи.

Метод. Выпуск содержит 72 756 мобильных записей общей длительностью 122,17 часа, 38 541 говорящего, 58 языков, 30 штатов и 162 района Индии. Размечено 106 892 шумовых события. Исполнители задавали тип и границы события; 11 111 отрезков длительностью 21,85 часа прошли проверку, а 61 645 отрезков, 100,32 часа, пока остаются в непроверенной части.

Результаты. Человеческие неречевые звуки встречаются в 37,8% отрезков, животные — в 31,3%, транспорт — в 24,9%, детский голос — в 16,1%. Категории сильно различаются по длительности: 37 739 человеческих событий занимают лишь 4,5 часа, тогда как 24 601 событие животных — 22,4 часа. Набор описывает реальную среду сбора лучше чистого корпуса, однако статья не приводит базовых результатов распознавания или улучшения речи.

Ограничения. Около 82% длительности ещё не прошло полную проверку временных меток. Языковой состав резко несбалансирован: на хинди приходится 83,9 из 122,17 часа. Записи одноканальные и сделаны на телефоны, а отсутствие базовых моделей не позволяет оценить, насколько разметка помогает конкретной задаче.

Фишка из статьи. Число событий само по себе вводит в заблуждение: короткие человеческие шумы многочисленны, но животные и техника занимают гораздо больше времени.

КатегорияОтрезки с событиемДоля отрезков, %СобытияСуммарно, ч
Человеческий неречевой звук27 53337,837 7394,5
Животные22 74631,324 60122,4
Транспорт18 15024,920 60312,5
Детский голос11 70816,112 37610,5
Музыка68799,569789,7

Как это читать: для обучения по кадрам важнее суммарная длительность, а для обнаружения редких всплесков — число эпизодов. VAANI позволяет строить оба протокола, но проверенную и непроверенную части следует держать раздельно.

Оригинальная статья на arXiv