BiTSE: бинауральное выделение целевого диктора для AR-очков
Эта статья про выделение речи конкретного человека для AR-очков с бинауральной микрофонной решеткой. Интерес здесь не только в нейросетевой маске, а в том, что модель использует направление целевого диктора и работает в условиях, где одновременно говорят несколько людей. Главный ход - добавить DoA-aware attention и обучать систему так, чтобы она не просто подавляла шум, а лучше сохраняла воспринимаемое качество целевой речи.
Метод. BiTSE берет многоканальный вход с очков, голосовую активность целевого диктора и направление прихода звука. В отличие от обычного многоканального улучшения речи, модель явно кодирует направление через cyclic positional embeddings и подает его в attention-блоки, чтобы разделение источников было привязано к пространственной подсказке. Обучение двухэтапное: сначала упор на подавление помех, затем перцептивная донастройка; в функции потерь комбинируются SegSNR, межканальная фазовая разность и STOI-подобный член.
Результаты. На наборах SPEAR D2/D3/D4 предложенная модель заметно поднимает качество относительно необработанного сигнала и базовых систем. Например, на D2 SegSNR улучшается с -8.69 дБ до -2.57 дБ, а PESQ - с 1.45 до 1.72; на D3 PESQ растет с 1.46 до 1.80. На самом сложном D4, где много перекрытий трех и четырех дикторов, SegSNR меняется с -7.34 до -4.05 дБ, а PESQ - с 1.21 до 1.34. MVDR и BCCTN в этой постановке улучшают отдельные показатели слабее, что показывает пользу явной пространственной подсказки.
Ограничения. Работа остается короткой конференционной статьей с ограниченным сравнением: нет субъективного прослушивания, мало анализа отказов и пока нет измерений задержки на реальных AR-очках. Авторы прямо называют quantization/pruning и real-time проверку будущей работой, поэтому перенос в устройство с жестким энергобюджетом еще не доказан.
Фишка из статьи. Самая полезная деталь - абляция функции потерь: качество не сводится к одному SegSNR, потому что фазовая согласованность и разборчивость тянут модель в другую сторону.
| Вариант обучения на D2 | SegSNR | PESQ |
|---|---|---|
| Только LSNR | -2.50 дБ | 1.66 |
| Только SegSNR | -2.66 дБ | 1.64 |
| Полная функция потерь | -2.57 дБ | 1.72 |
| Необработанный сигнал | -8.69 дБ | 1.45 |
Как это читать: полная система не дает максимальный SegSNR любой ценой, зато лучше балансирует энергетическое подавление, фазу между каналами и воспринимаемое качество. Для бинаурального устройства это важнее, чем одиночная численная победа по одной метрике.