Spoken LM Рассуждение Latency
Spoken LM

ECoM: сжатое рассуждение для spoken language models

FST 1.60 s

ECoM разбирает проблему, которая особенно заметна в речевых языковых моделях: chain-of-thought повышает точность, но заставляет модель долго молчать или произносить слишком много промежуточного текста. Авторы сжимают рассуждение прогрессивно, сохраняя полезные шаги для ответа, но уменьшая число речевых токенов. Главный результат - лучшее соотношение точности и длины ответа на spoken math QA, а не просто более короткая генерация.

Метод. Обычный Chain-of-Modality заставляет модель переводить рассуждение в речь почти полностью. ECoM обучает модель проходить через последовательные уровни сжатия: сначала подробное рассуждение, затем более компактное, затем почти финальный ответ с сохранением ключевых вычислений. Это снижает задержку первого речевого токена и количество генерируемых токенов, но оставляет модель в речевом режиме, без полного ухода в каскад text-only reasoning.

Результаты. На четырех наборах spoken math QA ECoM Reasoning дает среднюю accuracy 60.66 при 30.21 токена и efficiency 2.05. Для сравнения, CoM Reasoning получает 57.74 accuracy при 96.56 токена и efficiency 0.61, а каскадная система - 55.31 при 93.11 токена. Задержка первого речевого токена снижается с 4.90 с у CoM Reasoning до 1.60 с на одном A800 GPU.

Ограничения. Основная проверка идет на математических задачах с короткими ответами, поэтому нельзя автоматически переносить вывод на открытый диалог, пересказ или многошаговое аудио-планирование. Часть оценки проходит через распознавание и GPT-mini как судью, что добавляет внешний слой неопределенности. Латентность измерена на A800, а пользовательский сценарий может требовать совсем другого железа и потокового протокола.

Фишка из статьи. Сжатие не монотонно полезно: слишком агрессивное сокращение делает ответ коротким, но убивает точность. Лучший рабочий режим у авторов - около 40% исходного рассуждения.

Доля рассужденияAccuracy avgТокенов avgEfficiency
100%54.6963.270.89
80%55.0245.581.23
60%60.0035.351.73
40%60.6630.212.05
20%53.2523.252.32
0%35.079.413.68

Как это читать: самая высокая efficiency у 0%, но это почти отказ от рассуждения и заметная потеря точности. Практический вывод тоньше: полезно сжимать промежуточную речь, но оставлять достаточно структуры, чтобы модель не превращала вычисление в угадывание.

Оригинальная статья на arXiv