KWS без забывания: новые команды через модульное расширение
Статья про keyword spotting важна для устройств, которые уже развернуты и должны получать новые голосовые команды без переобучения всего набора. Обычная донастройка может хорошо выучить новые слова, но сломать старые триггеры; для встроенной системы это недопустимо. Авторы предлагают модульное расширение: базовая сеть и ее пороги остаются замороженными, а новые ключевые слова обслуживает небольшой добавочный блок.
Метод. В отличие от adapters, LoRA или full finetuning, метод не меняет исходные логиты и batch-normalization статистику основной модели. На выбранной глубине добавляется легкая ветка с отдельной головой для новых фраз; решение принимается по правилу core-first: сначала проверяется старая модель, и только если она ничего не нашла, включается новая ветка. Это сохраняет поведение уже поставленного продукта и укладывает расширение в бюджет до 10k дополнительных параметров.
Результаты. При фиксированном FAR 1% предложенный метод дает средний FRR 4.37% для новых фраз, лучше отдельной ensemble-модели с 6.46%, adapters с 8.05% и LoRA с 6.41%. Вычислительная цена тоже умеренная: 16.34M MACs против 18.45M у adapters и 20.52M у LoRA. Полная донастройка достигает FRR 2.35% на новых фразах, но ломает старые: средний FRR по core-фразам вырастает до 69.08%.
Ограничения. Работа проверяет ограниченный класс KWS-моделей и фиксированный operating point FAR 1%, поэтому реальные требования продукта могут отличаться. Метод предполагает, что старая модель должна оставаться неизменной, но не решает более общую задачу обновления акустического фронтенда или шумовой робастности. Также нет длинной оценки последовательных обновлений, когда новые команды добавляются много раз подряд.
Фишка из статьи. Самое убедительное место - отрицательный результат full finetuning. Он показывает, почему высокая точность на новых словах сама по себе бесполезна, если старые команды перестают работать.
| Метод | Core FRR | New FRR | MACs | Комментарий |
|---|---|---|---|---|
| Base | 2.71% | - | 15.08M | старые команды в норме |
| Full finetuning | 69.08% | 2.35% | 15.08M | катастрофическое забывание |
| Ensemble | 2.71% | 6.46% | 16.14M | без изменения базы, но хуже новые слова |
| Adapters | 2.71% | 8.05% | 18.45M | дороже и слабее по FRR |
| Proposed | 2.71% | 4.37% | 16.34M | лучший баланс без регрессии core |
Как это читать: если устройство уже сертифицировано с набором старых триггеров, core FRR важен не меньше new FRR. Модульное расширение выигрывает потому, что не покупает новые команды ценой разрушения старого поведения.