Акустика помещений Улучшение речи Импульсные характеристики
arXiv eess.AS

Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement

arXiv:2608.20971

Статья задаёт практичный вопрос: насколько качество имитации помещения важно, если сама система улучшения речи не меняется. Более точные синтетические импульсные характеристики дают лишь небольшую прибавку PESQ и STOI, зато заметно снижают ошибку последующего распознавания на измеренных помещениях. Это хороший пример того, как обычные показатели улучшения речи недооценивают полезность акустически правдоподобных обучающих данных.

Метод. Один и тот же DeepFilterNet3 обучается либо на 60 тыс. DNS4 RIR из прямоугольных помещений, рассчитанных методом мнимых источников, либо на 29 144 характеристиках из 324 меблированных гостиных, классов и ресторанов. В гибридном наборе волновой решатель работает до 1-2 кГц, выше используется геометрическая акустика до 12 кГц; материалы имеют частотно-зависимый комплексный импеданс, источники - направленность и ориентацию. Сравнение повторено на малом и полном речевом наборе, при 30 и 120 эпохах и с отключённым случайным изменением времени реверберации.

Результаты. Проверка содержит 827 незнакомых реплик VCTK, 284 измеренные RIR из ACE и MIT и шумы при SNR от 0 до 40 дБ. Усреднённый парный выигрыш гибридных RIR составляет +0,166 PESQ, +0,110 дБ SI-SDRi, +0,013 STOI и +0,270 SRMR; все 95-процентные доверительные интервалы лежат выше нуля. В полном 30-эпоховом режиме PESQ растёт с 2,24 до 2,41, а WER снижается с 14,52% до 12,74%. Для зашумлённого входа WER равна 16,71%, поэтому относительное улучшение распознавания достигает 23,8% против 13,1% у обычных DNS4 RIR.

Ограничения. Одновременно меняются геометрия, мебель, материалы, направленность и сам решатель, поэтому нельзя приписать результат именно волновому моделированию. Гибридный набор создан коммерческим Treble SDK, а моделирование 32 кГц затем передискретизируется в тракт DeepFilterNet3 48 кГц. Оставлены только пары с прямой видимостью; речь английская, система одноканальная. При смешивании к речи и шуму применяется одна RIR, что не полностью соответствует независимым источникам в комнате. Субъективного прослушивания нет.

Фишка из статьи. Более долгое обучение улучшает традиционные показатели, но не обязательно распознавание. На гибридных RIR лучший WER получен после 30, а не 120 эпох, хотя у 120-эпоховой модели выше PESQ, SI-SDRi, STOI и SRMR.

Режим обученияWER, DNS4 RIRWER, гибридные RIRОтносительное улучшение к шумному входу
Полный набор, 30 эпох14,52%12,74%13,1% / 23,8%
Полный набор, 120 эпох14,92%12,90%10,7% / 22,8%
Малый набор, 30 эпох16,63%14,70%0,5% / 12,0%
Малый, без изменения затухания16,16%13,99%3,3% / 16,3%

Как это читать: преимущество акустически точного набора повторяется во всех четырёх парах, однако строка 30 против 120 эпох предупреждает, что PESQ нельзя использовать как единственный критерий остановки, если обработанный звук затем идёт в распознавание речи.

Оригинальная статья на arXiv