звуковые языковые модели мобильные устройства спекулятивное декодирование
arXiv cs.SD

AS²D: ускорение звукового понимания по запросу на мобильных устройствах

arXiv:2609.37617

AS²D ускоряет ответ большой звуковой языковой модели на телефоне, разрешая малой модели готовить кандидаты без ожидания постоянно меняющегося текстового префикса основной модели. Подготовка и проверка идут параллельно, а окончательное распределение основной модели сохраняется благодаря проверке кандидатов.

Метод. Звуковой контекст обеих моделей заполняется до запроса, после чего черновая модель независимо публикует неизменяемые пакеты токенов. Планировщик выбирает фиксированный бюджет по профилю телефона; основная модель принимает совпавший префикс или исправляет его.

Результаты. На 688 окнах распознавания и четырёх телефонах пропускная способность выше обычного декодирования на 42-76%, а замедление возникает только в 5,7% окон против 58,1-63,0% у последовательных вариантов. В настоящем запуске Redmi K70 Pro прирост достигает 78%, а на одном 60-секундном запросе Xiaomi 14 оценённая энергия снижается с 342 до 239 Дж.

Ограничения. Основные массовые сравнения используют воспроизведение измеренных стоимостей, а не полный запуск каждого окна. Звуковая подготовка вынесена за время ответа; энергетическая проверка сделана на одном запросе с разной последовательностью токенов и не учитывает загрузку модели и охлаждение.

Фишка из статьи. Высокая доля принятых кандидатов сама по себе не означает ускорение. В звуковых вопросах и ответах принимается 84,7% доступных кандидатов, но многотокенная проверка возникает лишь в 17,5% раундов, поэтому прирост составляет только 8%.

ЗадачаЛучший базовый вариант, ток/сAS²D, ток/сУсловное принятиеПрирост
Перевод EN→ZH8,119,5254,6%17,4%
Перевод ZH→EN8,3710,9863,8%31,2%
Звуковые вопросы и ответы8,909,6284,7%8,0%

Как это читать: ускорение определяется не только точностью черновика, но и тем, успевает ли он подготовить длинный полезный блок до очередной проверки основной моделью.

Оригинальная статья на arXiv