голосовые помощники контекст LLM потоковые системы
arXiv cs.SD

Scalable Context Orchestration for Serving LLMs Over Voice

arXiv:2609.04288

Работа описывает промежуточный слой для голосовых LLM, который хранит смысловой, паралингвистический, сетевой и акустический контекст отдельно от текста. Такой «виртуальный контекст» позволяет не отправлять модели всю историю и одновременно выбирать речевой тракт по темпу, шуму и потерям пакетов.

Метод. Контекст организован в vpages и vthreads с ограниченным объёмом, проектором признаков и исполняемыми указаниями. Система оценивает темп речи, состояние канала и задачу, затем выбирает параметры фильтрации, краткое содержание и объём обращения к LLM. Сравнение выполнено на двух голосовых службах и нескольких сценариях.

Результаты. Средняя абсолютная ошибка оценки темпа падает с 38,26 до 18,23 слова в минуту. На трассах потерь пакетов фиксированная схема даёт 46% отказов, задержку 1286 мс и стоимость 0,003344 условной единицы; контекстная — 0,9%, 1831 мс и 0,000695. Для двух приложений стоимость снижается в 4,4 и 24,9 раза, а задержка до первого звука — с 2451 до 2070 мс и с 7510 до 1909 мс.

Ограничения. Часть приложений и данных внутренние, качество оценивает LLM, а стоимость зависит от текущих тарифов поставщиков. Сжатие расшифровки до краткого содержания ошибается в 14,6% случаев. Сам промежуточный слой добавляет около 51–78 мс, а условный вызов функции — примерно 790 мс.

Фишка из статьи. Экономия достигается не бесплатно: на плохой сети система сознательно принимает дополнительную задержку ради резкого снижения отказов.

Политика при потерях пакетовОтказыЗадержка, мсСтоимость
Фиксированная46%12860,003344
Всегда максимальная защита0%40210
Контекстная0,9%18310,000695

Как это читать: адаптивная политика почти достигает надёжности максимальной защиты, но отвечает более чем вдвое быстрее. Относительно фиксированного режима она медленнее примерно на 545 мс, зато устраняет почти все обрывы.

Оригинальная статья на arXiv