речевые агенты многоходовый диалог оценка рассуждений
arXiv cs.CL

SCB: SpeechConversationBench для оценки многоходового рассуждения в моделях «речь-в-речь»

arXiv:2609.40198

SpeechConversationBench отделяет способность решить устную задачу от способности удержать её части между ходами диалога. Одна и та же математическая задача подаётся целиком, как единая запись из фрагментов или как последовательность отдельных реплик; разница между последними двумя режимами измеряет цену именно многоходового контекста.

Метод. Используются 103 задачи из раздробленного GSM8K. FULL содержит исходную полную формулировку, CONCAT — те же фрагменты в одном звуковом сообщении, SHARDED — по одному фрагменту на ход. Четыре коммерческие системы сравниваются с каскадом LEGO, который явно обновляет память между ходами.

Результаты. Все коммерческие системы хуже в SHARDED, чем в CONCAT: падение составляет от 5,0 до 25,3 процентного пункта. GPT-4o Realtime сохраняет 76,6% против 81,6%, GPT-4o Mini Realtime — 52,4% против 77,7%. LEGO показывает 77,5% во всех трёх режимах и на 0,9 п.п. превосходит лучший коммерческий результат SHARDED.

Ограничения. Это небольшой набор школьной арифметики, не проверяющий естественный диалог, языковое разнообразие, перебивания, просодию, шум, задержку или качество синтеза. Не указаны точные снимки моделей, число повторов и детали извлечения ответа; у LEGO нет абляции памяти, поэтому причинный вывод об архитектуре невозможен.

Фишка из статьи. Выбор базового режима меняет вывод. GPT-4o Realtime в многоходовом режиме лучше, чем на исходном FULL, но хуже, чем на составленном из тех же фрагментов CONCAT; сравнение только с FULL ошибочно показало бы, что многоходовость помогает.

СистемаFULLCONCATSHARDEDSHARDED − CONCAT
GPT-4o Realtime70,0%81,6%76,6%−5,0 п.п.
GPT-4o Mini Realtime75,5%77,7%52,4%−25,3 п.п.
Gemini 2.5 Flash Live54,4%62,1%46,6%−15,5 п.п.
Gemini 2.5 Flash Preview Native Audio Dialog85,0%80,0%55,0%−25,0 п.п.
LEGO77,5%77,5%77,5%0,0 п.п.

Как это читать: CONCAT контролирует акустическое дробление без разрыва контекста, поэтому именно разность SHARDED − CONCAT является более чистой оценкой многоходовой памяти; равенство LEGO пока остаётся наблюдением на уровне системы, а не доказательством преимущества суммаризации.

Оригинальная статья на arXiv