ECL на краю: адаптация keyword spotting и FSC на устройстве
Эта статья шире речевых технологий, но в ней есть важный для встроенной речи результат: обучение и адаптация на устройстве для keyword spotting и spoken sentence classification. Авторы объединяют few-shot, zero-shot, continual и in-context learning вокруг одного embedder-centric learning подхода и показывают его на энергоограниченном Chameleon SoC. Для речевых задач это интересно как пример того, что адаптация голосовых интерфейсов может происходить локально и с микроваттным бюджетом, пусть пока на малых моделях.
Метод. Общая идея ECL - держать фиксированный TCN-эмбеддер, а разные режимы адаптации реализовывать небольшими головами и хранилищем плотных эмбеддингов. Для речевого continual learning используется NeuroBench keyword FSCIL: 100 базовых классов и еще 100 классов, добавляемых десятью 10-way 5-shot сессиями. Для zero-shot spoken sentence classification используется Fluent Speech Commands, где модель должна сопоставлять речевую команду с описанием класса. Речевые признаки подаются через MFCC, а основная адаптация работает с эмбеддингами.
Результаты. В keyword FSCIL чиповая реализация после 200 классов сохраняет final accuracy 71.8%, работает с latency 1.0 с на сэмпл, потребляет в среднем 9.5 мкВт и 9.5 мкДж на сэмпл. Размер квантованного эмбеддера 58.2 КБ, память под эмбеддинги 6.4 КБ. Авторы отмечают, что это на 4.4 п.п. ниже 96-кратно более крупного M5 baseline и на 8.4 п.п. ниже float-модели после 200 классов. В zero-shot FSC программная float-точность 80.8%, а на Chameleon 5-way accuracy падает до 60.6%; обучение требует 8.2 мкВт и 383 мс для пяти классов, вывод - 8.0 мкВт и 13 с realtime latency.
Ограничения. Это не полноценное распознавание речи, а классификация команд и ключевых слов. MFCC-предобработка для речевых задач находится вне основной оценки чипа, что важно для честного энергетического бюджета. Zero-shot режим сильно страдает от квантования: 4-битный вариант теряет 19.6 п.п. Тесты малы по сравнению с реальными голосовыми ассистентами, а фиксированный эмбеддер может ограничивать качество на новых языках, шуме и пользовательских акцентах.
Фишка из статьи. Самый полезный фрагмент - не абсолютная точность, а таблица бюджета для continual keyword learning: видно, что авторы честно платят памятью за новые классы через хранение эмбеддингов, но весь режим остается в микроваттном диапазоне.
| Показатель keyword FSCIL на Chameleon | Значение | Интерпретация |
|---|---|---|
| Классов после всех сессий | 200 | 100 базовых + 100 добавленных |
| Final accuracy | 71.8% | Качество после десяти 5-shot обновлений |
| Средняя мощность | 9.5 мкВт | Локальная адаптация в ультрамалом бюджете |
| Энергия на сэмпл | 9.5 мкДж | Цена одного примера в оценке авторов |
| Память эмбеддера | 58.2 КБ | Квантованная речевая модель признаков |
| Память эмбеддингов | 6.4 КБ | Цена хранения новых примеров |
Как это читать: ECL показывает не рекорд по speech accuracy, а возможную архитектуру локальной персонализации. Для практики важно, что новые ключевые слова можно добавлять без переобучения большой сети, но качество и предобработка пока остаются узкими местами.