MN-TANGO: 8-битное бинауральное улучшение речи
Статья рассматривает бинауральное улучшение речи для устройств с ограниченными вычислениями, например слуховых аппаратов: можно ли сильно квантовать нейронные маски, если после них стоит пространственный фильтр. Интересный результат состоит в том, что ошибки 8-битного квантования заметны на промежуточных масках, но в большой степени гасятся GEVD-фильтрацией. На этой основе авторы упрощают TANGO до MN-TANGO и получают варианты с существенно меньшей памятью и числом операций.
Метод. Исходный TANGO - гибридная система: нейронные сети оценивают маски, а затем пространственный фильтр использует бинауральную структуру сигнала. Авторы сравнивают исходную двухстадийную схему, переставленную схему и MN-TANGO, где оставлена только многоузловая стадия. Для обучения применяют дифференцируемый SDW-MWF как суррогат фильтра, а при выводе используют GEVD. Квантование применяется к нейронным компонентам: сравниваются пост-тренировочное квантование DPTQ и обучение с учетом квантования, основная конфигурация - W8A8 для весов и внутренних активаций, при этом входные и выходные маски оставлены в 16 битах.
Результаты. На полной TANGO пост-тренировочное квантование заметно портит качество: PESQ падает с 1.731/1.770 до 1.585/1.614 для левого и правого уха. Обучение с учетом квантования почти возвращает качество FP32: PESQ 1.729/1.765 при памяти около 1.083 MB вместо 4.03 MB. MN-TANGO в 8-битном варианте без группировки дает 30.79 MMAC/s, 0.5 млн параметров и 0.508 MB памяти, сохраняя финальные STOI 0.86/0.84 и PESQ 1.79/1.73. Вариант с двумя группами снижает сложность до 10.79 MMAC/s, 0.179 млн параметров и 0.274 MB; самый компактный вариант с восемью группами доходит до 4.65 MMAC/s, 0.081 млн параметров и 0.177 MB.
Ограничения. Оценка проведена на моделируемых бинауральных смесях с измеренными комнатными импульсными характеристиками, а не на полном наборе реальных пользовательских сценариев. Пространственный фильтр не квантуется так же агрессивно, как нейронные сети, поэтому результаты не являются полным отчетом о конечной аппаратной реализации. Нет субъективной оценки качества, а задержка, энергопотребление и устойчивость к другим типам шума остаются отдельными вопросами. Кроме того, обучение с учетом квантования и distillation подробно проверены именно для MN-TANGO.
Фишка из статьи. Главный инженерный вывод - не просто "8 бит работают", а то, где именно система теряет и где восстанавливает качество. После нейронной маски квантование ухудшает показатели, но после GEVD-фильтра финальный сигнал почти догоняет FP32.
| Стадия | Точность | SI-SIR L/R | SI-SDR L/R | PESQ L/R |
|---|---|---|---|---|
| MN-DNN | FP32 | 12.2 / 8.9 | 4.2 / 2.0 | 1.19 / 1.13 |
| MN-DNN | W8A8 | 10.7 / 7.1 | 3.7 / 1.4 | 1.18 / 1.12 |
| GEVD-выход | FP32 | 23.7 / 24.2 | 6.1 / 5.5 | 1.79 / 1.73 |
| GEVD-выход | W8A8 | 23.6 / 24.8 | 5.8 / 5.4 | 1.77 / 1.71 |
Как это читать: качество промежуточной нейронной оценки не обязано идеально сохраняться после квантования, если последующий пространственный фильтр устойчив к таким ошибкам. Для встроенного улучшения речи это важнее среднего выигрыша в одной метрике: архитектура допускает сильное уменьшение памяти и операций без полного обрушения финального качества.