DiffVQE2: малозадержочная диффузионная модель подавления акустического эха и шума
DiffVQE2 переносит диффузионное улучшение речи в причинный тракт подавления эха и шума с задержкой 32 мс. Модель работает с комплексным кратковременным преобразованием Фурье и уменьшает вычисления почти на порядок относительно DeepVQE сопоставимого размера.
Метод. Причинная сеть совместно оценивает чистую речь и подавляет остаточное эхо в комплексной области. Авторы сравнивают большую и компактную конфигурации, а для малой отдельно добавляют два кадра просмотра вперёд, чтобы измерить цену дополнительной задержки.
Результаты. Большая DiffVQE2 содержит 5,1 млн параметров, требует 5,37 GFLOPS и получает средний MOS 3,58; DeepVQE при 5,3 млн параметров требует 42,24 GFLOPS и даёт 3,44. Компактная модель с двумя кадрами просмотра вперёд повышает MOS с 3,55 до 3,62 при росте задержки с 32 до 48 мс.
Ограничения. Проверка основана на наборе ICASSP 2023 AEC Challenge, а не на широком наборе устройств и помещений. Объективные показатели расходятся между режимами, время на реальном оконечном устройстве не измерено.
Фишка из статьи. Причинность оказывается измеримой, но не разрушительной платой: непотоковая DiffVQE получает MOS 3,68, причинная DiffVQE2 3,58. При этом новая архитектура экономит почти восемь раз вычислений относительно DeepVQE.
| Модель | Параметры | GFLOPS ↓ | Задержка ↓ | Средний MOS ↑ |
|---|---|---|---|---|
| DeepVQE | 5,3 млн | 42,24 | 32 мс | 3,44 |
| DiffVQE2 | 5,1 млн | 5,37 | 32 мс | 3,58 |
| DiffVQE, непотоковая | 5,1 млн | 5,37 | не ограничена | 3,68 |
Как это читать: основная инженерная победа не в абсолютном MOS, а в сохранении большей части качества диффузионной модели при причинной обработке и резко меньшей вычислительной цене.