Keyword spotting DSP Streaming
DSP и KWS

Cumsum phase transport для дешевого потокового keyword spotting

5.01 ms

Работа про Cumsum-Composable Phase Transport интересна как редкий мост между частотно-временным представлением и компактным keyword spotting. Авторы заменяют более дорогой scan-слой на кумулятивно-составимую фазовую операцию, которую проще выполнять в потоковом режиме. Идея не в том, чтобы победить большим фронтендом, а в том, чтобы получить похожую временную память дешевле и с контролируемой задержкой.

Метод. Обычные mel-системы для KWS используют БПФ и сверточную агрегацию, а современные scan-варианты добавляют обучаемое затухание во времени. Здесь фазовый перенос формулируется через cumsum: локальные окна и несколько слоев дают эффективный временной охват, но операция остается простой для GPU и потоковой обработки. Авторы также проверяют фронтенд с комплексными каналами, где используются log magnitude, Re и Im, то есть фаза не выбрасывается полностью.

Результаты. На Speech Commands v2 вариант 160.9K параметров достигает 97.3% accuracy, а tied-версия с 51.6K параметров сохраняет те же 97.3%. В matched-сравнении маленькая модель CumsumFixed получает 94.82% test accuracy при 24.8K параметров и задержке 5.01 мс на T4; scan-базовая модель с похожим числом параметров дает 94.33% и 7.09 мс. Сама primitive-операция torch.cumsum быстрее Triton scan примерно в 3.2-4.5 раза в проверенных batch-режимах.

Ограничения. Это пока не полноценная продуктовая оценка wake word: нет FRR/FAR-кривых, оценки ложных срабатываний по длинному аудио и реальной задержки обнаружения события. Основной набор - Speech Commands v2, и авторы прямо указывают на необходимость multi-seed проверки и более сильных baselines. Кроме того, часть выигрыша может зависеть от конкретной реализации GPU, а не только от математической формы слоя.

Фишка из статьи. Самая DSP-часть - проверка, что комплексные каналы во фронтенде несут полезную информацию. Когда перекрытие между окнами убирают, фаза особенно помогает удержать качество.

Фронтендhop 160hop 400 без overlapКомментарий
FFT + log-mel97.1%95.4%обычный сильный baseline
CumsumSpec, frozen phases, log|c|+Re+Im95.2%94.0%фаза сохранена явно
CumsumSpec, learned phases, log|c|+Re+Im93.9%93.6%обучаемые фазы хуже frozen
CumsumSpec, frozen phases, только log|c|93.4%92.0%комплексные каналы удалены

Как это читать: модель не превосходит классический FFT-фронтенд, но разрыв заметно меньше, когда сохраняются Re и Im. Для низкой стоимости это важнее, чем абсолютная победа: фазовая информация помогает компактному приближению не развалиться при грубом временном шаге.

Оригинальная статья на arXiv