Речевые подделки Частичная подмена Человеческое восприятие
arXiv cs.CR

Tracking the Trend in How Speech Synthesizers Deceive People

arXiv:2608.19959

Главный результат этой работы не в общей фразе о том, что современные речевые подделки трудно распознавать, а в сравнении полной и частичной замены на одних и тех же слушателях. Технически подготовленные участники, заранее предупреждённые о подделках, обнаруживали единственное предложение ElevenLabs внутри настоящей записи лишь в 22,65% случаев. Шесть автоматических детекторов ошибались иначе, но тоже не обеспечили надёжной локализации.

Метод. В опыте участвовали 82 посетителя DevConf, в основном ИТ-специалисты. Для девяти известных англоязычных актёров и музыкантов подготовили по семь четырёхфразовых записей: одну настоящую, три полностью синтетические и три с заменой одной фразы. Использованы RTVC 2019 года, YourTTS 2022 года и коммерческий ElevenLabs 2024 года; синтез выполнялся без дообучения по трём минутам голоса. Участники после эталонного видео помечали каждую фразу как настоящую, синтетическую или неопределённую; неопределённые ответы исключались. Те же записи проверили шесть систем с XLS-R или WavLM и классификаторами AASIST или MHFA при фиксированном пороге 0,5.

Результаты. Для полной подделки человеческая F1 составила 0,90 на RTVC, 0,92 на YourTTS и только 0,48 на ElevenLabs; строгая доля записей без единой ошибки - 0,86, 0,89 и 0,28. При замене одной фразы F1 равна 0,87, 0,90 и 0,29, а строгая точность - 0,63, 0,69 и 0,09. На ElevenLabs обнаружение синтетической фразы падает с 0,43 в полной записи до 0,23 в частичной, p примерно 6 на 10 в минус восьмой степени; чувствительность d-prime составляет 0,73 против 2,75 и 2,88 у старых систем. Одновременно 17,5% настоящих фрагментов получают ложную метку подделки. Детекторы лучше людей на старых системах, но на полной ElevenLabs их средняя F1 всего 0,09; на частичной она 0,40, однако строгая локализация равна нулю.

Ограничения. По одному синтезатору на период недостаточно, чтобы доказать временную тенденцию, а ElevenLabs одновременно новее и единственный коммерческий вариант. Выборка ограничена ИТ-специалистами; участники предупреждены, а шесть из семи записей в каждом наборе содержат синтез, что усиливает подозрительность и ложные срабатывания. Исключение неопределённых ответов может смещать оценки. В частичной подделке меняются не только акустика и окружение, но и текст заменённой фразы, поэтому причинный вклад настоящего контекста не отделён. Детекторы проверены вне их обучающего распределения с некалиброванным порогом, а сами записи публично не выпущены из-за голосов известных людей.

Фишка из статьи. Люди и детекторы не просто «плохие» или «хорошие»: их ошибки дополняют друг друга. На полностью синтетической ElevenLabs человек сохраняет некоторую чувствительность, тогда как автоматические системы почти полностью разваливаются. На частичной подмене их средняя F1 выглядит лучше человеческой, но ни один детектор не проходит строгий тест, требующий одновременно найти вставку и не обвинить настоящие фразы.

ПроверяющийПолная ElevenLabs, F1Частичная ElevenLabs, F1Частичная, все 4 фразы верны
Люди0,480,290,09
Среднее 6 детекторов0,090,400,00

Как это читать: запись целиком и поиск короткой вставки являются разными задачами. F1 по записи может скрыть провал локализации; для защиты от подмены одного предложения нужен временной детектор с проверкой каждого участка, а не один итоговый балл подлинности.

Оригинальная статья на arXiv