Compressing Streaming Neural Audio Encoders via Latent-Space Distillation
Работа уменьшает потоковый звуковой кодировщик примерно в 2,8 раза, не переобучая последующие распознаватели. Ученик подгоняется к непрерывному представлению учителя перед квантованием, поэтому существующий кодовый словарь и потребители токенов остаются совместимыми.
Метод. Компактный причинный кодировщик регрессирует скрытые векторы более крупной модели, а декодер и квантователь сохраняются. Проверка проводится на нескольких стадиях и вариантах производственной системы распознавания речи. Авторы отдельно сравнивают дистиллированного ученика с сетью той же ёмкости, обученной независимо.
Результаты. На первой стадии средний WER трёх учителей равен 14,64%, 11,68% и 11,91%, у учеников — 14,70%, 11,90% и 12,01%. Пять из шести конфигураций остаются в пределах 1,9% относительного ухудшения. В одной конфигурации второй стадии ученик даже улучшает WER с 12,33% до 11,68%; в другой ухудшает с 8,67% до 9,34%.
Ограничения. Поведение после квантования и для задач, отличных от распознавания, почти не разобрано. Разброс второй стадии показывает зависимость от совместного обучения частей системы. Не приводятся абсолютная задержка, энергопотребление и качество восстановленного звука.
Фишка из статьи. Контроль с независимым учеником показывает, что выигрыш даёт передача внутреннего пространства, а не только выбранный компактный корпус.
| Модель одинаковой ёмкости | Средний WER, % |
|---|---|
| Обучена независимо | 12,36 |
| Дистиллирована по скрытому пространству | 11,90 |
| Крупный учитель | 11,68 |
Как это читать: дистилляция закрывает примерно две трети разрыва между самостоятельной компактной моделью и учителем, причём без изменения последующего распознавателя.