распознавание речи безопасность агентов устойчивость к ошибкам
arXiv cs.AI

When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI

arXiv:2608.28518

Ошибка распознавания речи может не просто испортить команду роботу, а сдвинуть границу отказа от опасного действия. Работа показывает разные режимы риска: фонетически близкие замены повышают и принятие вредной команды, и исполнимость плана, а очень сильное загрязнение повышает принятие, но уже разрушает сам план.

Метод. Четыре вида текстовых ошибок генерируются GPT-4, пятый создаётся вставкой фрагментов CHIME-6 с уровнями WER около 6%, 24%, 53% и 80%. Искажённые инструкции подаются в POEX с 136 вредными командами и 25 средами; план строит Qwen2.5-7B-Instruct, оценивает GPT-4o. На 300 безопасных заданиях SafeAgentBench отдельно проверяются GPT-4o-mini и GPT-4.1-mini. Исправление входа также выполняет GPT-4.

Результаты. Для чистых вредных команд доля принятия AR уже равна 55,33%, а исполнимого вредного результата ESR — 35,33%. Фонетические замены повышают их до 60,00% и 38,67%; при WER 80% AR доходит до 67,33%, но ESR составляет 34,00%. Исправление фонетических замен снижает AR до 53,33%, ESR до 30,67% и число переходов из безопасного ответа в опасный с 14 до 6. На обычных задачах смешанные ошибки снижают успешность с 27,67% до 23,33% и с 38,00% до 35,67%.

Ограничения. Это не испытание звукового тракта: большая часть ошибок синтезирована сразу в тексте, а «шум» — вставленные текстовые фрагменты, а не запись, пропущенная через распознаватель. Вредный опыт использует один планировщик и модель-судью без ручной проверки и доверительных интервалов; чистая основа уже принимает больше половины опасных команд. Поэтому работа картирует возможные отказы, но не оценивает вероятность в реальном голосовом роботе.

Фишка из статьи. Риск не растёт монотонно вместе с WER. При тяжёлом и особенно предельном загрязнении модель чаще перестаёт отказывать, но исполнимость вредного плана не увеличивается: семантика команды разрушается быстрее, чем граница безопасности.

УсловиеWERAR, принятие вредной командыESR, исполнимый вредный планПереходы в опасный ответ
Чистый вход0%55,33%35,33%
Фонетическая заменане задан60,00%38,67%14
Тяжёлое загрязнение53%62,00%36,00%14
Предельное загрязнение80%67,33%34,00%27
Смешанные ошибкине задан54,67%30,67%9

Как это читать: AR измеряет ослабление отказа, ESR — способность превратить принятый вредный запрос в рабочую последовательность действий. Высокий WER ухудшает первое, но может случайно уменьшить второе; одной средней ошибкой слов безопасность описать нельзя.

Оригинальная статья на arXiv