When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI
Ошибка распознавания речи может не просто испортить команду роботу, а сдвинуть границу отказа от опасного действия. Работа показывает разные режимы риска: фонетически близкие замены повышают и принятие вредной команды, и исполнимость плана, а очень сильное загрязнение повышает принятие, но уже разрушает сам план.
Метод. Четыре вида текстовых ошибок генерируются GPT-4, пятый создаётся вставкой фрагментов CHIME-6 с уровнями WER около 6%, 24%, 53% и 80%. Искажённые инструкции подаются в POEX с 136 вредными командами и 25 средами; план строит Qwen2.5-7B-Instruct, оценивает GPT-4o. На 300 безопасных заданиях SafeAgentBench отдельно проверяются GPT-4o-mini и GPT-4.1-mini. Исправление входа также выполняет GPT-4.
Результаты. Для чистых вредных команд доля принятия AR уже равна 55,33%, а исполнимого вредного результата ESR — 35,33%. Фонетические замены повышают их до 60,00% и 38,67%; при WER 80% AR доходит до 67,33%, но ESR составляет 34,00%. Исправление фонетических замен снижает AR до 53,33%, ESR до 30,67% и число переходов из безопасного ответа в опасный с 14 до 6. На обычных задачах смешанные ошибки снижают успешность с 27,67% до 23,33% и с 38,00% до 35,67%.
Ограничения. Это не испытание звукового тракта: большая часть ошибок синтезирована сразу в тексте, а «шум» — вставленные текстовые фрагменты, а не запись, пропущенная через распознаватель. Вредный опыт использует один планировщик и модель-судью без ручной проверки и доверительных интервалов; чистая основа уже принимает больше половины опасных команд. Поэтому работа картирует возможные отказы, но не оценивает вероятность в реальном голосовом роботе.
Фишка из статьи. Риск не растёт монотонно вместе с WER. При тяжёлом и особенно предельном загрязнении модель чаще перестаёт отказывать, но исполнимость вредного плана не увеличивается: семантика команды разрушается быстрее, чем граница безопасности.
| Условие | WER | AR, принятие вредной команды | ESR, исполнимый вредный план | Переходы в опасный ответ |
|---|---|---|---|---|
| Чистый вход | 0% | 55,33% | 35,33% | — |
| Фонетическая замена | не задан | 60,00% | 38,67% | 14 |
| Тяжёлое загрязнение | 53% | 62,00% | 36,00% | 14 |
| Предельное загрязнение | 80% | 67,33% | 34,00% | 27 |
| Смешанные ошибки | не задан | 54,67% | 30,67% | 9 |
Как это читать: AR измеряет ослабление отказа, ESR — способность превратить принятый вредный запрос в рабочую последовательность действий. Высокий WER ухудшает первое, но может случайно уменьшить второе; одной средней ошибкой слов безопасность описать нельзя.