Keyword spotting Edge AI Continual learning
On-device speech

ECL на краю: адаптация keyword spotting и FSC на устройстве

9.5 мкВт

Эта статья шире речевых технологий, но в ней есть важный для встроенной речи результат: обучение и адаптация на устройстве для keyword spotting и spoken sentence classification. Авторы объединяют few-shot, zero-shot, continual и in-context learning вокруг одного embedder-centric learning подхода и показывают его на энергоограниченном Chameleon SoC. Для речевых задач это интересно как пример того, что адаптация голосовых интерфейсов может происходить локально и с микроваттным бюджетом, пусть пока на малых моделях.

Метод. Общая идея ECL - держать фиксированный TCN-эмбеддер, а разные режимы адаптации реализовывать небольшими головами и хранилищем плотных эмбеддингов. Для речевого continual learning используется NeuroBench keyword FSCIL: 100 базовых классов и еще 100 классов, добавляемых десятью 10-way 5-shot сессиями. Для zero-shot spoken sentence classification используется Fluent Speech Commands, где модель должна сопоставлять речевую команду с описанием класса. Речевые признаки подаются через MFCC, а основная адаптация работает с эмбеддингами.

Результаты. В keyword FSCIL чиповая реализация после 200 классов сохраняет final accuracy 71.8%, работает с latency 1.0 с на сэмпл, потребляет в среднем 9.5 мкВт и 9.5 мкДж на сэмпл. Размер квантованного эмбеддера 58.2 КБ, память под эмбеддинги 6.4 КБ. Авторы отмечают, что это на 4.4 п.п. ниже 96-кратно более крупного M5 baseline и на 8.4 п.п. ниже float-модели после 200 классов. В zero-shot FSC программная float-точность 80.8%, а на Chameleon 5-way accuracy падает до 60.6%; обучение требует 8.2 мкВт и 383 мс для пяти классов, вывод - 8.0 мкВт и 13 с realtime latency.

Ограничения. Это не полноценное распознавание речи, а классификация команд и ключевых слов. MFCC-предобработка для речевых задач находится вне основной оценки чипа, что важно для честного энергетического бюджета. Zero-shot режим сильно страдает от квантования: 4-битный вариант теряет 19.6 п.п. Тесты малы по сравнению с реальными голосовыми ассистентами, а фиксированный эмбеддер может ограничивать качество на новых языках, шуме и пользовательских акцентах.

Фишка из статьи. Самый полезный фрагмент - не абсолютная точность, а таблица бюджета для continual keyword learning: видно, что авторы честно платят памятью за новые классы через хранение эмбеддингов, но весь режим остается в микроваттном диапазоне.

Показатель keyword FSCIL на ChameleonЗначениеИнтерпретация
Классов после всех сессий200100 базовых + 100 добавленных
Final accuracy71.8%Качество после десяти 5-shot обновлений
Средняя мощность9.5 мкВтЛокальная адаптация в ультрамалом бюджете
Энергия на сэмпл9.5 мкДжЦена одного примера в оценке авторов
Память эмбеддера58.2 КБКвантованная речевая модель признаков
Память эмбеддингов6.4 КБЦена хранения новых примеров

Как это читать: ECL показывает не рекорд по speech accuracy, а возможную архитектуру локальной персонализации. Для практики важно, что новые ключевые слова можно добавлять без переобучения большой сети, но качество и предобработка пока остаются узкими местами.

Оригинальная статья на arXiv