подавление эха перенос знаний эффективные модели
arXiv eess.AS

Knowledge Distillation for Efficient Acoustic Echo Control

arXiv:2608.25596

Авторы сжимают нейросетевой эхокомпенсатор не уменьшением длины контекста, а переносом поведения большой CGGN16 в модель с 0,2 млн параметров и 0,25 GFLOPS. Полезнее всего здесь разбор функции потерь: промежуточные признаки учителя не помогают, а двухэтапное обучение сначала по спектру учителя, затем по чистой цели дает лучший баланс подавления эха и сохранения речи.

Метод. Учитель содержит 2,4 млн параметров и требует 12,47 GFLOPS, ученик — 0,2 млн и 0,25 GFLOPS, то есть около 2% вычислений учителя. Смеси строятся из открытой речи, шумов и импульсных характеристик с нелинейностью громкоговорителя, отношением эха к ближней речи от -9 до 9 дБ и SNR 5–20 дБ. Сравниваются обучение по истинной цели, временная и частотная передача выхода учителя и двухэтапная схема с последующей настройкой по истинному сигналу.

Результаты. На проверочной выборке частотный перенос с последующим обучением по истинной цели дает PESQ 2,27 и ERLE 12,78 дБ против 2,15 и 9,21 дБ у ученика без переноса. На тесте двухэтапный ученик получает PESQ 2,07 и ERLE 11,19 дБ против 1,95 и 10,68 дБ без переноса. При тех же 0,25 GFLOPS он по качеству приближается к средней модели на 1,87 GFLOPS, используя около 14% ее вычислений. Сопоставление внутренних признаков оказалось нестабильным и было отброшено.

Ограничения. Обучение и основная проверка основаны на синтетических смесях; нет измерений на телефонах, процессорах реального времени, памяти и энергопотребления. Система подавляет эхо, но не решает шумоподавление. Кроме того, отдельные цели конфликтуют: одноэтапный перенос лучше сохраняет речь, но может дать меньший ERLE.

Фишка из статьи. Абляция показывает, что учитель полезен не только как мягкая цель. Финальный этап по истинному сигналу исправляет смещение учителя и дает еще 0,81 дБ ERLE сверх чистого частотного переноса, одновременно немного повышая PESQ и субъективные оценки.

Обучение ученикаPESQERLEДвойной разговор: речьДвойной разговор: эхо
Только истинная цель2,159,21 дБ3,353,78
Временной перенос → истинная цель2,2211,91 дБ3,404,02
Частотный перенос2,2611,97 дБ3,443,96
Частотный перенос → истинная цель2,2712,78 дБ3,494,04

Как это читать: переход от третьей строки к четвертой изолирует пользу второго этапа, потому что архитектура и стоимость вывода не меняются. Улучшение связано с порядком целей обучения, а не с более крупной моделью.

Оригинальная статья на arXiv