потоковые кодировщики дистилляция сжатие моделей
arXiv cs.SD

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

arXiv:2609.04102

Работа уменьшает потоковый звуковой кодировщик примерно в 2,8 раза, не переобучая последующие распознаватели. Ученик подгоняется к непрерывному представлению учителя перед квантованием, поэтому существующий кодовый словарь и потребители токенов остаются совместимыми.

Метод. Компактный причинный кодировщик регрессирует скрытые векторы более крупной модели, а декодер и квантователь сохраняются. Проверка проводится на нескольких стадиях и вариантах производственной системы распознавания речи. Авторы отдельно сравнивают дистиллированного ученика с сетью той же ёмкости, обученной независимо.

Результаты. На первой стадии средний WER трёх учителей равен 14,64%, 11,68% и 11,91%, у учеников — 14,70%, 11,90% и 12,01%. Пять из шести конфигураций остаются в пределах 1,9% относительного ухудшения. В одной конфигурации второй стадии ученик даже улучшает WER с 12,33% до 11,68%; в другой ухудшает с 8,67% до 9,34%.

Ограничения. Поведение после квантования и для задач, отличных от распознавания, почти не разобрано. Разброс второй стадии показывает зависимость от совместного обучения частей системы. Не приводятся абсолютная задержка, энергопотребление и качество восстановленного звука.

Фишка из статьи. Контроль с независимым учеником показывает, что выигрыш даёт передача внутреннего пространства, а не только выбранный компактный корпус.

Модель одинаковой ёмкостиСредний WER, %
Обучена независимо12,36
Дистиллирована по скрытому пространству11,90
Крупный учитель11,68

Как это читать: дистилляция закрывает примерно две трети разрыва между самостоятельной компактной моделью и учителем, причём без изменения последующего распознавателя.

Оригинальная статья на arXiv