Синтез речи Голосовые ассистенты Управление стилем
Синтез речи

Harness TTS: контекстное управление выразительным синтезом речи

First-ID 41.2 ms

Harness TTS рассматривает выразительный синтез речи как задачу управляемой маршрутизации, а не как свободную текстовую инструкцию к TTS-модели. Для голосовых ассистентов это практично: стиль можно выбирать из закрытого реестра аудио-подсказок, учитывать контекст и приоритеты, а потом объяснить, почему был выбран именно такой голосовой режим. Главный ход - вынести управление стилем в отдельный слой над любым TTS-движком.

Метод. Авторы строят реестр из 42 prompt tools: 27 axis-based вариантов по сетке скорость x громкость x эмоция и 15 preset-сценариев для типичных ассистентских ситуаций. На выводе планировщик получает структурированное наблюдение: профиль пользователя, сценарий, окружающие признаки, implicit intent и явную инструкцию. Приоритетная схема заставляет явную инструкцию переопределять контекст, а Qwen3-планировщик выбирает один или несколько инструментов из реестра, после чего обычный TTS-исполнитель синтезирует речь по соответствующему prompt audio.

Результаты. Qwen3-4B с chain-of-thought дает T-Exact@1 74.3% на explicit subset, 43.0% на implicit subset и 64.6% на conflict subset, где нужно разрешить противоречия между пользовательской инструкцией и контекстом. Без chain-of-thought точность ниже, но задержка сильно лучше: Qwen3-4B without CoT имеет P95 Full 206.0 мс и P95 First-ID 41.2 мс, то есть первый подходящий инструмент появляется почти сразу. В синтезе Harness выигрывает у instruction-only управления на CosyVoice3 на 23.1-35.6 процентных пункта по instruction-following win rate, на VoxCPM2 на 13.8-20.0 пункта, а UTMOSv2 растет на 0.11-0.38.

Ограничения. Оценка маршрутизации опирается на LLM-учителя и синтетически собранные сценарии, а не на реальные пользовательские логи. Прослушивание также автоматизировано через судей и UTMOSv2, без полноценной субъективной панели. Реестр из 42 инструментов мал по сравнению с настоящим ассистентом, а chain-of-thought режим слишком дорог для жесткого real-time.

Фишка из статьи. Интересен не только выигрыш качества, а trade-off между рассуждением и задержкой. Для интерактивного ассистента первый валидный инструмент важнее полного списка.

МетодExplicit T-Exact@1Conflict T-Exact@1P95 FullP95 First-ID
Retrieval-4B0.3480.19956.1 мс56.1 мс
Qwen3-4B без CoT0.6140.495206.0 мс41.2 мс
Qwen3-4B с CoT0.7430.6461191.7 мс323.6 мс

Как это читать: CoT нужен для максимальной точности, особенно при конфликте сигналов, но стандартный 4B-планировщик без CoT выглядит более практичным: он сильно обгоняет retrieval по качеству и выдает первый выбор за десятки миллисекунд.

Оригинальная статья на arXiv