AURAL: адаптивное скрытое рассуждение с совместным предсказанием блоков для речевых языковых моделей
AURAL сокращает задержку рассуждающих речевых моделей, не заставляя их проговаривать длинную цепочку промежуточного текста. Модель строит несколько продолжений в скрытом пространстве, предсказывает сразу блок скрытых шагов и сама выбирает, когда рассуждение можно завершить.
Метод. Gaussian Mixture Modeling поддерживает несколько возможных направлений рассуждения, joint chunk prediction выдаёт несколько скрытых состояний за проход, а обучение по подкреплению регулирует число шагов по сложности запроса. Для обучения собран двуязычный AuralReason-683K примерно на 1000 часов; основой служит Qwen2.5-Omni.
Результаты. При блоке из четырёх шагов и пределе 10 блоков среднее число последовательных проходов снижается с 64,25 до 1,79, то есть на 97,21%, а время до первого токена — с 1,22 до 0,10 с. На EchoMind MCQ AURAL-RL получает 68,63%, на MMSU — 64,76%, на MMAU — 61,37%; результаты близки к явной CoT-RL, но выдача начинается примерно в 11,8 раза быстрее.
Ограничения. Большая часть рассуждений и оценок зависит от автоматически сгенерированных двуязычных данных и судей-моделей. Для ряда наборов приведён один прогон, а скрытые шаги труднее проверять и интерпретировать, чем текстовую цепочку. Выигрыш по задержке получен на конкретной модели и оборудовании.
Фишка из статьи. Ускорение быстро выходит на плато: увеличение блока с четырёх до восьми шагов доводит число проходов почти до одного, но экономит лишь ещё 16 мс. Значит, после устранения последовательного рассуждения основную задержку создают кодирование речи и обычная генерация.
| Режим | Последовательные проходы | Время до первого токена | EchoMind MCQ | MMSU |
|---|---|---|---|---|
| Явная цепочка рассуждений | 64,25 | 1,22 с | 68,42% | 64,34% |
| AURAL, блок 4 | 1,79 | 0,10 с | 68,63% | 64,76% |
| AURAL, блок 8 | около 1 | 0,084 с | — | — |
Как это читать: почти весь выигрыш даёт переход от десятков зависимых шагов к совместному блоку. Дальнейшее укрупнение скрытого блока мало влияет на пользовательскую задержку, поэтому его нельзя считать бесплатным универсальным ускорителем.