речевые языковые модели скрытое рассуждение задержка
arXiv cs.CL

AURAL: адаптивное скрытое рассуждение с совместным предсказанием блоков для речевых языковых моделей

arXiv:2610.01560

AURAL сокращает задержку рассуждающих речевых моделей, не заставляя их проговаривать длинную цепочку промежуточного текста. Модель строит несколько продолжений в скрытом пространстве, предсказывает сразу блок скрытых шагов и сама выбирает, когда рассуждение можно завершить.

Метод. Gaussian Mixture Modeling поддерживает несколько возможных направлений рассуждения, joint chunk prediction выдаёт несколько скрытых состояний за проход, а обучение по подкреплению регулирует число шагов по сложности запроса. Для обучения собран двуязычный AuralReason-683K примерно на 1000 часов; основой служит Qwen2.5-Omni.

Результаты. При блоке из четырёх шагов и пределе 10 блоков среднее число последовательных проходов снижается с 64,25 до 1,79, то есть на 97,21%, а время до первого токена — с 1,22 до 0,10 с. На EchoMind MCQ AURAL-RL получает 68,63%, на MMSU — 64,76%, на MMAU — 61,37%; результаты близки к явной CoT-RL, но выдача начинается примерно в 11,8 раза быстрее.

Ограничения. Большая часть рассуждений и оценок зависит от автоматически сгенерированных двуязычных данных и судей-моделей. Для ряда наборов приведён один прогон, а скрытые шаги труднее проверять и интерпретировать, чем текстовую цепочку. Выигрыш по задержке получен на конкретной модели и оборудовании.

Фишка из статьи. Ускорение быстро выходит на плато: увеличение блока с четырёх до восьми шагов доводит число проходов почти до одного, но экономит лишь ещё 16 мс. Значит, после устранения последовательного рассуждения основную задержку создают кодирование речи и обычная генерация.

РежимПоследовательные проходыВремя до первого токенаEchoMind MCQMMSU
Явная цепочка рассуждений64,251,22 с68,42%64,34%
AURAL, блок 41,790,10 с68,63%64,76%
AURAL, блок 8около 10,084 с——

Как это читать: почти весь выигрыш даёт переход от десятков зависимых шагов к совместному блоку. Дальнейшее укрупнение скрытого блока мало влияет на пользовательскую задержку, поэтому его нельзя считать бесплатным универсальным ускорителем.

Оригинальная статья на arXiv