DuplexSpeechBench-Document Grounding: опора на документы и галлюцинации голосовых агентов
DuplexSpeechBench-Document Grounding проверяет, способен ли голосовой агент отвечать по предоставленному документу и не додумывать отсутствующие факты. Важная часть набора — изменение длины контекста, обновление документа между ходами и разделение качества ответа, галлюцинаций и задержки.
Метод. Набор содержит 1636 вопросов по 50 документам из пяти профессиональных областей при контексте от 500 до 8000 токенов. Сравниваются каскадная система и нативные модели «речь-в-речь»; автоматический судья оценивает grounded accuracy, ответы классифицируются по галлюцинациям, а для потоковых систем измеряется время до первого звука.
Результаты. Каскад удерживает точность 88,5–90,3% во всём диапазоне контекста. GPT-4o Realtime снижается с 88,0% при 500 токенах до 85,8% при 8000, MiniCPM — с 85,9% до 74,0%, SALMONN — с 77,4% до 25,4%. У GPT медианная задержка 1214 мс при точности 87,7%; у Moshi — 229 мс, но точность лишь 3,2%.
Ограничения. Речь синтезирована, а корректность и галлюцинации определяет автоматический судья. Пять профессиональных областей не покрывают бытовые диалоги, безопасность и шумную акустику. Системы различаются доступом к документу и внешним компонентам, поэтому результаты нельзя трактовать как чистое сравнение архитектур.
Фишка из статьи. Обновление контекста не монотонно полезно. Для GPT одно обновление повышает точность с 79,6% до 94,2%, но несколько обновлений снижают её до 88,1%; некоторые открытые модели после обновления становятся хуже исходного режима.
| Система | Без обновления | Одно обновление | Несколько обновлений | Эффект одного обновления |
|---|---|---|---|---|
| GPT-4o Realtime | 79,6% | 94,2% | 88,1% | +14,6 п.п. |
| Каскад | 87,8% | 94,9% | — | +7,1 п.п. |
Как это читать: сам факт повторной загрузки документа не гарантирует лучшую опору на него. Системе нужны управление версиями контекста и подавление устаревших фрагментов; иначе дополнительная информация увеличивает конфликт и галлюцинации.