Sound events HRI DSP
arXiv cs.SD

Распознавание порядка перекрывающихся звуков для человеко-роботного взаимодействия

arXiv:2608.04072

Работа смотрит на узкую, но практически понятную аудио-задачу: определить, какой из перекрывающихся коротких звуков произошел раньше. Это важно для роботов и интерактивных систем, где очередность хлопка, голоса, сигнала или другого события может менять реакцию системы. Технический интерес в том, что авторы проверяют микрозадержки до 0.0004 секунды и укладываются в режим реального времени.

Метод. Сигнал представляется тремя способами: mel-спектрограммой, MFCC и STFT-магнитудой. Каждая ветка подается в свой CNN, затем признаки сливаются через attention-механизм. Данные синтетически строятся из трех классов звуков с перекрытием и задержками от 0.0004 до 0.3 секунды; отдельно проверяется вариант с разной громкостью до ±12 dB и отдельный набор новых звуков.

Результаты. В одинаковой амплитуде модель достигает 99% accuracy на всех задержках, включая микрозадержку 0.0004 секунды. При разбросе громкости точность падает до 91%, а на невиданных звуках с Z-score нормализацией - до 74%; без нормализации авторы сообщают дополнительное падение примерно на 10 пунктов. Задержка вывода: 4.8 мс на NVIDIA RTX 2060, 18.6 мс на Intel i7-9750H, плюс 8.1 мс на извлечение признаков, то есть полный путь остается ниже 30 мс.

Ограничения. Главный риск - синтетические перекрытия: они дают точный контроль задержки, но не моделируют комнатную реверберацию, шум, разные микрофоны и реальные поведенческие паттерны. Система предполагает ровно два перекрывающихся невербальных события и один микрофон. При переносе в комнату, класс или производственную среду понадобятся реальные записи, возможно разделение источников и лучеформирование.

Фишка из статьи. Здесь важно не только 99% на простом наборе, а соотношение точности, робастности и задержки.

УсловиеДиапазон задержекЛучший результатПрактический смысл
Одинаковая громкость0.0004-0.3 с99% accuracyМодель улавливает порядок даже при микрозадержках
Разная громкость0.0004-0.3 с91% accuracyАмплитудный дисбаланс заметно, но не полностью ломает систему
Новые звуки0.0004-0.3 с74% accuracyОбобщение слабее, нужен реальный набор
Полная задержкаCPU + признаки<30 мсПодходит для интерактивной реакции

Как это читать: статья скорее про проверку осуществимости. Реальное качество в комнате пока неизвестно, но бюджет задержки выглядит убедительно для HRI-прототипа.

Оригинальная статья на arXiv