Распознавание порядка перекрывающихся звуков для человеко-роботного взаимодействия
Работа смотрит на узкую, но практически понятную аудио-задачу: определить, какой из перекрывающихся коротких звуков произошел раньше. Это важно для роботов и интерактивных систем, где очередность хлопка, голоса, сигнала или другого события может менять реакцию системы. Технический интерес в том, что авторы проверяют микрозадержки до 0.0004 секунды и укладываются в режим реального времени.
Метод. Сигнал представляется тремя способами: mel-спектрограммой, MFCC и STFT-магнитудой. Каждая ветка подается в свой CNN, затем признаки сливаются через attention-механизм. Данные синтетически строятся из трех классов звуков с перекрытием и задержками от 0.0004 до 0.3 секунды; отдельно проверяется вариант с разной громкостью до ±12 dB и отдельный набор новых звуков.
Результаты. В одинаковой амплитуде модель достигает 99% accuracy на всех задержках, включая микрозадержку 0.0004 секунды. При разбросе громкости точность падает до 91%, а на невиданных звуках с Z-score нормализацией - до 74%; без нормализации авторы сообщают дополнительное падение примерно на 10 пунктов. Задержка вывода: 4.8 мс на NVIDIA RTX 2060, 18.6 мс на Intel i7-9750H, плюс 8.1 мс на извлечение признаков, то есть полный путь остается ниже 30 мс.
Ограничения. Главный риск - синтетические перекрытия: они дают точный контроль задержки, но не моделируют комнатную реверберацию, шум, разные микрофоны и реальные поведенческие паттерны. Система предполагает ровно два перекрывающихся невербальных события и один микрофон. При переносе в комнату, класс или производственную среду понадобятся реальные записи, возможно разделение источников и лучеформирование.
Фишка из статьи. Здесь важно не только 99% на простом наборе, а соотношение точности, робастности и задержки.
| Условие | Диапазон задержек | Лучший результат | Практический смысл |
|---|---|---|---|
| Одинаковая громкость | 0.0004-0.3 с | 99% accuracy | Модель улавливает порядок даже при микрозадержках |
| Разная громкость | 0.0004-0.3 с | 91% accuracy | Амплитудный дисбаланс заметно, но не полностью ломает систему |
| Новые звуки | 0.0004-0.3 с | 74% accuracy | Обобщение слабее, нужен реальный набор |
| Полная задержка | CPU + признаки | <30 мс | Подходит для интерактивной реакции |
Как это читать: статья скорее про проверку осуществимости. Реальное качество в комнате пока неизвестно, но бюджет задержки выглядит убедительно для HRI-прототипа.