Анализ акустической сцены Слуховые аппараты Оценка мощности
arXiv eess.AS

DNN-Based Frequency-Dependent Estimation of Speech, Music, and Noise Power in Acoustic Mixtures for Hearing-Aid Scene Analysis

arXiv:2608.17482

Вместо отдельного детектора речи, классификатора сцены и оценщика отношения сигнал/шум эта работа строит одну частотно-зависимую картину: какая доля мощности смеси в каждый момент и в каждой полосе приходится на речь, музыку и шум. Для слухового аппарата это удачный промежуточный уровень между грубой меткой сцены и полноценным разделением источников. Из одной причинной модели уже получается детектор речевой активности почти уровня SileroVAD, но остаётся значительно больше информации для последующей настройки обработки.

Метод. На вход подаются 64 причинно нормированных логарифмических мел-полосы смеси. Три двумерных свёрточных слоя извлекают локальные частотно-временные признаки, однонаправленный GRU с 64 состояниями учитывает прошлый контекст, а три выходные ветви оценивают речь, музыку и шум в 16 мел-полосах. Softmax заставляет их доли в каждой ячейке суммироваться до единицы; умножение на наблюдаемую мощность смеси возвращает оценки мощности источников. Обучающая выборка из 50 тысяч шестисекундных смесей собрана из LibriSpeech, VCTK, MUSAN и нескольких шумовых наборов; в двух третях примеров добавлена реверберация из базы импульсных характеристик MIT. Отдельная проверка использует TIMIT и записи HEAR-DS, отсутствовавшие при обучении.

Результаты. На исходном испытательном наборе средняя ошибка уровня составляет 1,40 дБ, корреляция с истинными мощностями - 0,891. На 1000 новых десятисекундных смесях показатели ухудшаются до 1,71 дБ и 0,875. Простое усреднение доли речи по частоте и пороговая обработка дают сбалансированную точность VAD 0,845 против 0,848 у SileroVAD. Модель содержит 181,9 тысячи параметров, занимает 727,6 КБ при 32-разрядных весах и требует 30,9 млн операций с плавающей точкой в секунду.

Ограничения. Даже «новая» проверка остаётся искусственным смешиванием заранее выбранных источников, а реальная акустическая сцена может содержать больше трёх неоднозначных классов. Из возможных применений проверен только VAD; нет опытов с выбором режима слухового аппарата, оценкой SNR, локализацией или лучеформированием. Причинность архитектуры показана по конструкции, но фактическая задержка, энергопотребление и работа на процессоре слухового аппарата не измерены. Ошибки заметно растут для смеси музыки и шума и особенно при одновременном присутствии всех трёх источников.

Фишка из статьи. Полезен не рекорд одного показателя, а соотношение богатства представления и вычислительной цены. Одна сеть выдаёт 48 временных оценок мощности и одновременно почти воспроизводит отдельный детектор речевой активности.

ПроверкаОшибка уровняКорреляцияДополнительный итог
Исходные испытательные смеси1,40 дБ0,891обучающие семейства данных
Новые TIMIT + HEAR-DS1,71 дБ0,8751000 смесей по 10 с
VAD из доли речи--0,845 сбалансированной точности
SileroVAD--0,848 сбалансированной точности

Как это читать: потеря 0,003 относительно специализированного VAD мала, но предложенная сеть решает более широкую задачу и сохраняет распределение энергии по частоте. Цена этого преимущества - 30,9 MFLOPS/с, которую ещё предстоит подтвердить на реальном слуховом устройстве.

Оригинальная статья на arXiv