полнодуплексная речь задержанное намерение голосовые агенты
arXiv eess.AS

Когда намерение раскрывается поздно: полнодуплексные речевые модели при задержанном контексте

arXiv:2610.00272

Этот тест проверяет полнодуплексные голосовые модели в ситуации, когда начало реплики допускает безопасный ответ, а решающее намерение становится ясно только позже. Такая постановка отделяет умение дождаться смысла от общей способности быстро реагировать на паузу.

Метод. 98 парных сценариев имеют безопасное и вредное продолжение; для каждого строятся четыре задержки раскрытия намерения, всего 3136 сессий. Оцениваются Persona, Moshi, FLM и VoiceChat, а метрики фиксируют преждевременный ответ, взаимодействие с вредной просьбой после раскрытия и сохранение полезной реакции на парную безопасную просьбу.

Результаты. При задержке 1,5 с Persona преждевременно отвечает в 64,3% случаев и после раскрытия вредного намерения продолжает в 73,5%. У Moshi показатели 35,7% и 42,9%, у VoiceChat — 41,8% и 12,2%. FLM почти всегда начинает заранее, 96,4%, но низкая доля продолжения 18,4% частично объясняется общим прекращением ответа.

Ограничения. Сценарии синтетические и покрывают только четыре нативные системы с конкретными интерфейсами. Таксономия вреда и детектор участия автоматизированы, а естественные перебивания, шум и эмоциональная речь почти не представлены. Низкую долю продолжения нельзя считать безопасностью без учёта выпадения модели.

Фишка из статьи. Одинаковая пауза действует по-разному в зависимости от места. Пауза 1,5 с после раскрытия намерения почти не меняет преждевременный ответ, тогда как такая же пауза до ключевой части поднимает его от умеренных значений вплоть до 100%.

Модель, задержка раскрытия 1,5 сПреждевременный ответВзаимодействие с вредной просьбойВзаимодействие с безопасной просьбой
Persona64,3%73,5%100,0%
Moshi35,7%42,9%59,2%
FLM96,4%18,4%37,8%
VoiceChat41,8%12,2%80,6%

Как это читать: низкие первые два показателя желательны, а высокий последний подтверждает, что система остаётся полезной. У FLM падение вредного взаимодействия сопровождается падением безопасного с 72,4% без задержки до 37,8%, поэтому это широкое disengagement, а не избирательное улучшение безопасности.

Оригинальная статья на arXiv