Cumsum phase transport для дешевого потокового keyword spotting
Работа про Cumsum-Composable Phase Transport интересна как редкий мост между частотно-временным представлением и компактным keyword spotting. Авторы заменяют более дорогой scan-слой на кумулятивно-составимую фазовую операцию, которую проще выполнять в потоковом режиме. Идея не в том, чтобы победить большим фронтендом, а в том, чтобы получить похожую временную память дешевле и с контролируемой задержкой.
Метод. Обычные mel-системы для KWS используют БПФ и сверточную агрегацию, а современные scan-варианты добавляют обучаемое затухание во времени. Здесь фазовый перенос формулируется через cumsum: локальные окна и несколько слоев дают эффективный временной охват, но операция остается простой для GPU и потоковой обработки. Авторы также проверяют фронтенд с комплексными каналами, где используются log magnitude, Re и Im, то есть фаза не выбрасывается полностью.
Результаты. На Speech Commands v2 вариант 160.9K параметров достигает 97.3% accuracy, а tied-версия с 51.6K параметров сохраняет те же 97.3%. В matched-сравнении маленькая модель CumsumFixed получает 94.82% test accuracy при 24.8K параметров и задержке 5.01 мс на T4; scan-базовая модель с похожим числом параметров дает 94.33% и 7.09 мс. Сама primitive-операция torch.cumsum быстрее Triton scan примерно в 3.2-4.5 раза в проверенных batch-режимах.
Ограничения. Это пока не полноценная продуктовая оценка wake word: нет FRR/FAR-кривых, оценки ложных срабатываний по длинному аудио и реальной задержки обнаружения события. Основной набор - Speech Commands v2, и авторы прямо указывают на необходимость multi-seed проверки и более сильных baselines. Кроме того, часть выигрыша может зависеть от конкретной реализации GPU, а не только от математической формы слоя.
Фишка из статьи. Самая DSP-часть - проверка, что комплексные каналы во фронтенде несут полезную информацию. Когда перекрытие между окнами убирают, фаза особенно помогает удержать качество.
| Фронтенд | hop 160 | hop 400 без overlap | Комментарий |
|---|---|---|---|
| FFT + log-mel | 97.1% | 95.4% | обычный сильный baseline |
| CumsumSpec, frozen phases, log|c|+Re+Im | 95.2% | 94.0% | фаза сохранена явно |
| CumsumSpec, learned phases, log|c|+Re+Im | 93.9% | 93.6% | обучаемые фазы хуже frozen |
| CumsumSpec, frozen phases, только log|c| | 93.4% | 92.0% | комплексные каналы удалены |
Как это читать: модель не превосходит классический FFT-фронтенд, но разрыв заметно меньше, когда сохраняются Re и Im. Для низкой стоимости это важнее, чем абсолютная победа: фазовая информация помогает компактному приближению не развалиться при грубом временном шаге.