Самоконтролируемое обучение Звуковые представления Причинное предсказание
arXiv eess.AS

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

arXiv:2608.19863

NAPE переносит на звук очень простой принцип: по предыдущим частям спектрограммы предсказывать представление следующей части. В отличие от большинства методов самоконтролируемого обучения звука здесь нет декодера реконструкции, звукового токенизатора, учителя с экспоненциальным усреднением или набора вспомогательных потерь. Интерес работы не только в итоговых таблицах, но и в аккуратной проверке того, почему такая минимальная схема не сваливается в копирование или постоянное представление.

Метод. Логарифмическая мел-спектрограмма делится на непересекающиеся квадраты 16 на 16; десятисекундная запись даёт 504 элемента. Двумерная сетка разворачивается в последовательность растровым или диагональным обходом, а причинный Transformer видит только предыдущие элементы и предсказывает непрерывное представление следующего. Цель берётся прямо с неглубокого свёрточного входа, останавливается для обратного распространения и сравнивается с прогнозом по отрицательному косинусному сходству. При дообучении причинная маска снимается, поэтому классификатор использует весь сигнал. Модели на 19, 85 и 303 млн параметров предварительно обучаются без меток примерно на 1,99 млн записей AudioSet в течение 25-30 эпох на восьми L40S.

Результаты. Крупная модель получила mAP 50,2 на полном AudioSet и 40,5 на AS-20K, точность 96,0% на ESC-50, 97,9% и 98,8% на Speech Commands V1/V2 и 68,0% на распознавании эмоций IEMOCAP. Диагональный обход дал 68,8% на IEMOCAP против 64,5% у сильнейшего приведённого предшественника, хотя по AudioSet результат близок к SSLAM, а не превосходит его: 50,0 против 50,2 и 40,4 против 40,9 mAP. При линейной проверке замороженной крупной модели получены 27,1 mAP, 20,4 mAP и 83,5% на трёх звуковых задачах; лучшие признаки находятся около середины сети, а последние слои сильнее приспособлены к прогнозу следующего элемента. Уже после шести эпох крупная модель достигает 49,45 mAP на AudioSet, но на меньшем AS-20K продолжение до 30 эпох заметно полезнее: 37,15 против 39,94.

Ограничения. Все шесть конечных задач являются классификацией; работа не проверяет распознавание связной речи, синтез, улучшение сигнала или генерацию звука. Предварительное обучение ограничено AudioSet, а сравнения с большинством методов взяты из их статей, без общего бюджета вычислений. Несмотря на простую функцию потерь, крупная версия имеет 303 млн параметров и обучается на восьми ускорителях. При конечном обучении используются сильные искажения данных, а для AudioSet ещё и усреднение весов. Причинная маска затем снимается, поэтому результаты не доказывают пригодность для потоковой обработки.

Фишка из статьи. Потеря обучения может выглядеть почти идеальной и при этом давать плохие признаки. Без причинной маски модель видит целевой элемент, быстро учится почти тождественному переносу и достигает косинусного сходства около единицы, но качество резко падает. Без сдвига цели или остановки градиента обучение вообще расходится.

Вариант базовой моделиAS-2M, mAPAS-20K, mAPESC-50, точность
Полная схема49,639,194,2%
Без причинной маски41,824,868,9%
Без сдвига прогнозаОбучение расходится
Без остановки градиентаОбучение расходится

Как это читать: причинность нужна не для устойчивости численной оптимизации, а для запрета короткого пути к цели. Сдвиг и остановка градиента предотвращают два других вырожденных решения. Это редкий случай, когда абляция объясняет сам механизм обучения, а не только добавляет несколько пунктов к итоговой точности.

Оригинальная статья на arXiv