ECoM: сжатое рассуждение для spoken language models
ECoM разбирает проблему, которая особенно заметна в речевых языковых моделях: chain-of-thought повышает точность, но заставляет модель долго молчать или произносить слишком много промежуточного текста. Авторы сжимают рассуждение прогрессивно, сохраняя полезные шаги для ответа, но уменьшая число речевых токенов. Главный результат - лучшее соотношение точности и длины ответа на spoken math QA, а не просто более короткая генерация.
Метод. Обычный Chain-of-Modality заставляет модель переводить рассуждение в речь почти полностью. ECoM обучает модель проходить через последовательные уровни сжатия: сначала подробное рассуждение, затем более компактное, затем почти финальный ответ с сохранением ключевых вычислений. Это снижает задержку первого речевого токена и количество генерируемых токенов, но оставляет модель в речевом режиме, без полного ухода в каскад text-only reasoning.
Результаты. На четырех наборах spoken math QA ECoM Reasoning дает среднюю accuracy 60.66 при 30.21 токена и efficiency 2.05. Для сравнения, CoM Reasoning получает 57.74 accuracy при 96.56 токена и efficiency 0.61, а каскадная система - 55.31 при 93.11 токена. Задержка первого речевого токена снижается с 4.90 с у CoM Reasoning до 1.60 с на одном A800 GPU.
Ограничения. Основная проверка идет на математических задачах с короткими ответами, поэтому нельзя автоматически переносить вывод на открытый диалог, пересказ или многошаговое аудио-планирование. Часть оценки проходит через распознавание и GPT-mini как судью, что добавляет внешний слой неопределенности. Латентность измерена на A800, а пользовательский сценарий может требовать совсем другого железа и потокового протокола.
Фишка из статьи. Сжатие не монотонно полезно: слишком агрессивное сокращение делает ответ коротким, но убивает точность. Лучший рабочий режим у авторов - около 40% исходного рассуждения.
| Доля рассуждения | Accuracy avg | Токенов avg | Efficiency |
|---|---|---|---|
| 100% | 54.69 | 63.27 | 0.89 |
| 80% | 55.02 | 45.58 | 1.23 |
| 60% | 60.00 | 35.35 | 1.73 |
| 40% | 60.66 | 30.21 | 2.05 |
| 20% | 53.25 | 23.25 | 2.32 |
| 0% | 35.07 | 9.41 | 3.68 |
Как это читать: самая высокая efficiency у 0%, но это почти отказ от рассуждения и заметная потеря точности. Практический вывод тоньше: полезно сжимать промежуточную речь, но оставлять достаточно структуры, чтобы модель не превращала вычисление в угадывание.