Поддельная речь Внедрение Устойчивость
arXiv cs.SD

The Last Mile of Deepfake Speech Detection: An Industry-Academia Experience Report

arXiv:2608.17585

Это не очередной детектор с ещё меньшим EER, а технический отчёт о трёхлетней попытке довести обнаружение синтетической речи до коммерческой эксплуатации. Его ценность в отрицательных результатах: ошибка ниже 1% на чистом наборе почти ничего не говорит о длинной записи после кодека, частично поддельной фразе, едином рабочем пороге или ложных тревогах у заказчика. Авторы подробно показывают, где привычная исследовательская постановка перестаёт соответствовать реальному решению.

Метод. Команда Phonexia и двух университетов перебрала открытые архитектуры и в итоге выбрала предварительно обученные самоконтролируемые речевые кодировщики с внимательным объединением по времени. Длинная запись разбивается на фрагменты, итогом служит максимальная оценка, чтобы обнаруживать вставку поддельного участка в настоящую запись. Внутренняя проверка охватывает 30 говорящих, несколько настроек каждого синтезатора, телефонию, шум и простые преобразования. Вместо единого EER команда использует рабочие пороги и собственные веса важности примеров, одновременно признавая, что такой показатель остаётся эвристическим.

Результаты. Самые важные числа описывают разрушение качества при несовпадении канала. После одного неагрессивного прохода через кодек доля пропусков в одном внутреннем опыте выросла примерно с 4% до 60%; специальное дополнение обучающих данных кодеками вернуло большую часть потери, а общие искажения почти не помогли. В узкополосной телефонии ложные тревоги выросли примерно с 5% до 70%, EER достиг около 16% после AMR-NB и 25% после G.711. Эти значения не являются воспроизводимым испытанием: компания не раскрывает число примеров, пороги и доверительные интервалы, но масштаб изменения показывает, почему чистый тест опасен.

Ограничения. Наблюдения происходят из одного проекта, поставщика и набора заказчиков; переносимость на другие продукты не проверена. Значительная часть данных, конфигураций и рабочих порогов закрыта, поэтому независимое воспроизведение невозможно. Отчёт не сравнивает архитектуры в едином открытом протоколе и не даёт итоговой производительности текущей системы. Коммерческая заинтересованность раскрыта авторами. Поэтому статья сильна как карта инженерных рисков, но слаба как количественное доказательство конкретного метода.

Фишка из статьи. Авторы публикуют редкий отрицательный пример загрязнённого разделения «виденные/невиденные атаки». На первый взгляд новая атака распознаётся даже лучше знакомой, но затем выясняется, что большинство «невиденных» записей взято из проверочных частей обучающих корпусов и относится к уже известным синтезаторам.

ВерсияТочность, виденныеТочность, «невиденные»Сбалансированная, виденныеСбалансированная, «невиденные»
Phonexia v20,91350,93810,93830,9509
Phonexia v30,97230,97600,97210,9745

Как это читать: таблица специально не доказывает обобщение. Она показывает, как переименование одной системы в разных наборах данных создаёт утечку между частями и превращает правдоподобные 97% в ложное подтверждение устойчивости. Без происхождения атаки и общего рабочего порога слово «невиденная» недостаточно.

Оригинальная статья на arXiv