Scalable Context Orchestration for Serving LLMs Over Voice
Работа описывает промежуточный слой для голосовых LLM, который хранит смысловой, паралингвистический, сетевой и акустический контекст отдельно от текста. Такой «виртуальный контекст» позволяет не отправлять модели всю историю и одновременно выбирать речевой тракт по темпу, шуму и потерям пакетов.
Метод. Контекст организован в vpages и vthreads с ограниченным объёмом, проектором признаков и исполняемыми указаниями. Система оценивает темп речи, состояние канала и задачу, затем выбирает параметры фильтрации, краткое содержание и объём обращения к LLM. Сравнение выполнено на двух голосовых службах и нескольких сценариях.
Результаты. Средняя абсолютная ошибка оценки темпа падает с 38,26 до 18,23 слова в минуту. На трассах потерь пакетов фиксированная схема даёт 46% отказов, задержку 1286 мс и стоимость 0,003344 условной единицы; контекстная — 0,9%, 1831 мс и 0,000695. Для двух приложений стоимость снижается в 4,4 и 24,9 раза, а задержка до первого звука — с 2451 до 2070 мс и с 7510 до 1909 мс.
Ограничения. Часть приложений и данных внутренние, качество оценивает LLM, а стоимость зависит от текущих тарифов поставщиков. Сжатие расшифровки до краткого содержания ошибается в 14,6% случаев. Сам промежуточный слой добавляет около 51–78 мс, а условный вызов функции — примерно 790 мс.
Фишка из статьи. Экономия достигается не бесплатно: на плохой сети система сознательно принимает дополнительную задержку ради резкого снижения отказов.
| Политика при потерях пакетов | Отказы | Задержка, мс | Стоимость |
|---|---|---|---|
| Фиксированная | 46% | 1286 | 0,003344 |
| Всегда максимальная защита | 0% | 4021 | 0 |
| Контекстная | 0,9% | 1831 | 0,000695 |
Как это читать: адаптивная политика почти достигает надёжности максимальной защиты, но отвечает более чем вдвое быстрее. Относительно фиксированного режима она медленнее примерно на 545 мс, зато устраняет почти все обрывы.