речевые фундаментальные модели устойчивость состязательные атаки
arXiv eess.AS

Переносимая состязательная устойчивость речевых фундаментальных моделей через иерархическую стабилизацию

arXiv:2610.05310

Обычная защита речевой модели стабилизирует последний слой под конкретную задачу, хотя атака может накапливать сдвиг по всей глубине кодировщика. Здесь устойчивость разбивается на две части: сначала без меток стабилизируются скрытые слои, затем на чистых данных увеличивается геометрический запас классификатора.

Метод. STAGE1 на 100 часах Common Voice минимизирует взвешенный максимум нормированного сдвига представлений по слоям и одновременно сохраняет чистые признаки. После выбора линейной смеси слоёв STAGE2 замораживает кодировщик и увеличивает мягкий нижний предел расстояния до ближайшей границы класса. Проверены Wav2Vec2, HuBERT и WavLM на распознавании команд, намерений, говорящего и эмоции.

Результаты. На 12 сочетаниях «кодировщик — задача» STAGE1 повышает робастную точность в среднем на 46,4 процентного пункта при потере 2,1 пункта чистой точности. STAGE2 добавляет ещё 4,0 пункта робастной точности ценой 1,1 пункта чистой. Для WavLM, например, защищённая точность на определении намерения растёт с 3,1% до 71,1%, а на эмоциях — с 1,3% до 34,0%.

Ограничения. Угроза ограничена цифровыми возмущениями с SNR 24–36 дБ и одним психоакустическим вариантом; физический перенос через помещение не проверен. Полная состязательная тренировка конкретной задачи всё ещё сильнее. Оценка использует замороженные крупные англоязычные кодировщики и четыре классификационные задачи, а не распознавание длинной речи.

Фишка из статьи. Сильнее всего механизм объясняет отрицательная абляция: если убрать якорь сохранения чистых признаков, движение представления уменьшается ещё сильнее, но полезная робастность почти исчезает вместе с обычной точностью.

Вариант STAGE1Изменение сдвига признаковЧистая точностьРобастная точность
Только последний слой−37,5%−3,0 п.п.+22,6 п.п.
Среднее по слоям−72,9%−2,2 п.п.+39,3 п.п.
Без сохранения чистых признаков−93,2%−20,8 п.п.+13,5 п.п.
Полный STAGE1−81,8%−2,1 п.п.+43,8 п.п.

Как это читать: минимальный сдвиг сам по себе не равен устойчивости. Представление должно одновременно мало двигаться под атакой и сохранять структуру чистых классов; иначе защита просто стирает полезную информацию.

Оригинальная статья на arXiv