подавление эха улучшение речи диффузионные модели
arXiv eess.AS

DiffVQE2: малозадержочная диффузионная модель подавления акустического эха и шума

arXiv:2609.31703

DiffVQE2 переносит диффузионное улучшение речи в причинный тракт подавления эха и шума с задержкой 32 мс. Модель работает с комплексным кратковременным преобразованием Фурье и уменьшает вычисления почти на порядок относительно DeepVQE сопоставимого размера.

Метод. Причинная сеть совместно оценивает чистую речь и подавляет остаточное эхо в комплексной области. Авторы сравнивают большую и компактную конфигурации, а для малой отдельно добавляют два кадра просмотра вперёд, чтобы измерить цену дополнительной задержки.

Результаты. Большая DiffVQE2 содержит 5,1 млн параметров, требует 5,37 GFLOPS и получает средний MOS 3,58; DeepVQE при 5,3 млн параметров требует 42,24 GFLOPS и даёт 3,44. Компактная модель с двумя кадрами просмотра вперёд повышает MOS с 3,55 до 3,62 при росте задержки с 32 до 48 мс.

Ограничения. Проверка основана на наборе ICASSP 2023 AEC Challenge, а не на широком наборе устройств и помещений. Объективные показатели расходятся между режимами, время на реальном оконечном устройстве не измерено.

Фишка из статьи. Причинность оказывается измеримой, но не разрушительной платой: непотоковая DiffVQE получает MOS 3,68, причинная DiffVQE2 3,58. При этом новая архитектура экономит почти восемь раз вычислений относительно DeepVQE.

МодельПараметрыGFLOPS ↓Задержка ↓Средний MOS ↑
DeepVQE5,3 млн42,2432 мс3,44
DiffVQE25,1 млн5,3732 мс3,58
DiffVQE, непотоковая5,1 млн5,37не ограничена3,68

Как это читать: основная инженерная победа не в абсолютном MOS, а в сохранении большей части качества диффузионной модели при причинной обработке и резко меньшей вычислительной цене.

Оригинальная статья на arXiv