Enhancement AGC Meetings
Meeting audio

SE-AGCNet: speech enhancement и loudness control лучше обучать вместе

PESQ 3.00

SE-AGCNet предлагает не собирать speech enhancement и automatic gain control цепочкой из двух независимых модулей. Встречи и дальние микрофоны часто дают одновременно шум, реверберацию и огромные перепады громкости. Если сначала включить AGC, он может усилить шум; если сначала агрессивно чистить речь, enhancement может задавить тихого спикера. Авторы обучают обе задачи end-to-end.

Почему обычный pipeline ломается

В таблице с исходными real-world данными разница хорошо видна: clean VoiceBank+DEMAND и LibriTTS лежат около -23 LUFS и имеют LRA 3.68-4.33 LU, а MMCSG записан около -40.24 LUFS с LRA 20.21. AliMeeting-far тоже далек от “готового” уровня: -34.89 LUFS и LRA 12.08. Это не маленькая косметика громкости, а другая динамическая среда.

Метод

  • SE-AGCNet jointly optimizes denoising и loudness normalization.
  • SE-компонент должен сохранить тихую речь, чтобы AGC потом мог поднять ее без выбрасывания полезного сигнала.
  • Авторы делают SE-AGC-DataGen: concatenation 2-5 utterances, volume perturbation 5-30%, sudden spikes, gradual increase/decrease, fluctuations, плюс noise mixing 5-25 dB SNR.
  • Оценка loudness использует нормальные broadcast/audio метрики: integrated LUFS, short-term LUFS и LRA.

Результаты

На LibriAGC SE-AGCNet достигает PESQ 3.00, SIGMOS OVRL 2.99, DNSMOS OVRL 3.35 и попадает в целевой loudness: -23.66 LUFS, -23.93 St LUFS, LRA 3.86. При этом WER падает до 6.88% на Whisper-large-v3-turbo и 9.12% на Nvidia Conformer CTC. Для сравнения, noisy input имеет PESQ 1.33 и WER 10.67% / 21.61%, а MP-SENet (SE) + pyagc дает PESQ 2.69 и WER 7.09% / 9.35%.

На MMCSG реальных встреч SE-AGCNet тоже наиболее практичен: -22.68 LUFS, LRA 4.80, WER 13.86% / 30.36%. На AliMeeting-far он дает -22.89 LUFS, LRA 4.26 и CER 34.43%, лучше cascaded alternatives в таблице.

Практический вывод

Для meeting transcription это хороший reminder: громкость — не постобработка “после качества”, а часть качества. Если backend распознавания получает тихие, неровные и шумные куски, ASR degradation возникает не только от шума, но и от динамики уровня. Joint SE+AGC особенно полезен там, где один аудиофайл содержит близких и дальних спикеров, перемещения, клавиатуру, двери и разные микрофонные расстояния.

Фишка из статьи. SE-AGCNet объединяет speech enhancement и automatic gain control в одной модели, поэтому она не просто чистит шум, а одновременно держит loudness около вещательного целевого уровня. Это видно на сравнении с пайплайном “SE, потом pyagc”: внешний AGC хорошо сжимает LRA, но хуже попадает в LUFS и хуже помогает ASR.

LibriAGCPESQLUFSShort-term LUFSLRAWERaWERb
Reference--22.75-23.364.212.403.69
Input1.33-24.12-28.9514.8710.6721.61
MP-SENet + pyagc2.69-20.88-21.103.497.099.35
SE-AGCNet3.00-23.66-23.933.866.889.12
Real-worldLUFSShort-term LUFSLRAASR error
MMCSG noisy-40.24-45.9220.21WERa 15.12 / WERb 51.36
MMCSG SE-AGCNet-22.68-23.044.80WERa 13.86 / WERb 30.36
AliMeeting-far noisy-34.89-37.4012.08CERa 36.16
AliMeeting-far SE-AGCNet-22.89-23.204.26CERa 34.43

Это хороший мост между enhancement и production audio: модель оценивают не только по PESQ/STOI, но и по loudness-метрикам, которые реально важны для подкастов, встреч и downstream ASR.

Оригинальная статья на arXiv