синтез речи спекулятивное декодирование мобильные устройства
arXiv cs.SD

Спекулятивное декодирование с учётом позиции RVQ для синтеза речи на устройстве

arXiv:2609.37007

Авторы ускоряют внутренний декодер кодовых книг Qwen3-TTS, не добавляя отдельную крупную черновую сеть. Для каждой позиции остаточного векторного квантования обучается небольшой сдвиг скрытого вектора, после чего уже существующие выходные головы предсказывают несколько следующих кодов.

Метод. Три вектора-смещения на 3072 параметра исправляют позиционное несоответствие между головами кодовых книг. Разреженное дерево кандидатов проверяется одним вызовом основной модели по стандартному правилу спекулятивного декодирования, поэтому распределение выходного потока не меняется.

Результаты. Метод принимает 2,44-2,46 токена за шаг на шести языках при обучении смещений только на английском. На iPhone 17 Pro Max оптимальное дерево даёт ускорение 2,34 раза, на MacBook M3 Pro 2,13 раза, на iPhone 12 1,82 раза. В рабочем конвейере авторы сообщают ускорение генерации RVQ-токенов в 2-2,2 раза.

Ограничения. Ускоряется только MultiCodeDecoder, а не весь синтезатор. Качество проверяется автоматическим распознаванием и ручным прослушиванием авторами без формального MOS; оптимальный размер дерева зависит от устройства.

Фишка из статьи. Полные Medusa-головы добавляют около 94 млн параметров и принимают 2,60 токена, тогда как 3072 параметра смещений дают 2,47. Разница в теоретическом принятии мала, но экономия памяти особенно важна именно на телефоне.

ЧерновикПринято токенов за шаг ↑Дополнительные параметры ↓
Повторное использование голов без поправки1,700
Отдельные Medusa-головы2,60около 94 млн
Позиционные смещения RVQ2,473072

Как это читать: почти весь выигрыш Medusa здесь связан с исправлением геометрии позиций кодовых книг, а не с ёмкостью новых голов. На старом iPhone слишком большое дерево уже переводит проверку из режима ограничения памятью в режим ограничения вычислениями и уменьшает ускорение.

Оригинальная статья на arXiv