SE-AGCNet: speech enhancement и loudness control лучше обучать вместе
SE-AGCNet предлагает не собирать speech enhancement и automatic gain control цепочкой из двух независимых модулей. Встречи и дальние микрофоны часто дают одновременно шум, реверберацию и огромные перепады громкости. Если сначала включить AGC, он может усилить шум; если сначала агрессивно чистить речь, enhancement может задавить тихого спикера. Авторы обучают обе задачи end-to-end.
Почему обычный pipeline ломается
В таблице с исходными real-world данными разница хорошо видна: clean VoiceBank+DEMAND и LibriTTS лежат около -23 LUFS и имеют LRA 3.68-4.33 LU, а MMCSG записан около -40.24 LUFS с LRA 20.21. AliMeeting-far тоже далек от “готового” уровня: -34.89 LUFS и LRA 12.08. Это не маленькая косметика громкости, а другая динамическая среда.
Метод
- SE-AGCNet jointly optimizes denoising и loudness normalization.
- SE-компонент должен сохранить тихую речь, чтобы AGC потом мог поднять ее без выбрасывания полезного сигнала.
- Авторы делают SE-AGC-DataGen: concatenation 2-5 utterances, volume perturbation 5-30%, sudden spikes, gradual increase/decrease, fluctuations, плюс noise mixing 5-25 dB SNR.
- Оценка loudness использует нормальные broadcast/audio метрики: integrated LUFS, short-term LUFS и LRA.
Результаты
На LibriAGC SE-AGCNet достигает PESQ 3.00, SIGMOS OVRL 2.99, DNSMOS OVRL 3.35 и попадает в целевой loudness: -23.66 LUFS, -23.93 St LUFS, LRA 3.86. При этом WER падает до 6.88% на Whisper-large-v3-turbo и 9.12% на Nvidia Conformer CTC. Для сравнения, noisy input имеет PESQ 1.33 и WER 10.67% / 21.61%, а MP-SENet (SE) + pyagc дает PESQ 2.69 и WER 7.09% / 9.35%.
На MMCSG реальных встреч SE-AGCNet тоже наиболее практичен: -22.68 LUFS, LRA 4.80, WER 13.86% / 30.36%. На AliMeeting-far он дает -22.89 LUFS, LRA 4.26 и CER 34.43%, лучше cascaded alternatives в таблице.
Практический вывод
Для meeting transcription это хороший reminder: громкость — не постобработка “после качества”, а часть качества. Если backend распознавания получает тихие, неровные и шумные куски, ASR degradation возникает не только от шума, но и от динамики уровня. Joint SE+AGC особенно полезен там, где один аудиофайл содержит близких и дальних спикеров, перемещения, клавиатуру, двери и разные микрофонные расстояния.
Фишка из статьи. SE-AGCNet объединяет speech enhancement и automatic gain control в одной модели, поэтому она не просто чистит шум, а одновременно держит loudness около вещательного целевого уровня. Это видно на сравнении с пайплайном “SE, потом pyagc”: внешний AGC хорошо сжимает LRA, но хуже попадает в LUFS и хуже помогает ASR.
| LibriAGC | PESQ | LUFS | Short-term LUFS | LRA | WERa | WERb |
|---|---|---|---|---|---|---|
| Reference | - | -22.75 | -23.36 | 4.21 | 2.40 | 3.69 |
| Input | 1.33 | -24.12 | -28.95 | 14.87 | 10.67 | 21.61 |
| MP-SENet + pyagc | 2.69 | -20.88 | -21.10 | 3.49 | 7.09 | 9.35 |
| SE-AGCNet | 3.00 | -23.66 | -23.93 | 3.86 | 6.88 | 9.12 |
| Real-world | LUFS | Short-term LUFS | LRA | ASR error |
|---|---|---|---|---|
| MMCSG noisy | -40.24 | -45.92 | 20.21 | WERa 15.12 / WERb 51.36 |
| MMCSG SE-AGCNet | -22.68 | -23.04 | 4.80 | WERa 13.86 / WERb 30.36 |
| AliMeeting-far noisy | -34.89 | -37.40 | 12.08 | CERa 36.16 |
| AliMeeting-far SE-AGCNet | -22.89 | -23.20 | 4.26 | CERa 34.43 |
Это хороший мост между enhancement и production audio: модель оценивают не только по PESQ/STOI, но и по loudness-метрикам, которые реально важны для подкастов, встреч и downstream ASR.