синтез речи проверяемое планирование обоснование источниками
arXiv cs.SD

VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis

arXiv:2609.03203

VoxReason переносит проверку управляемого синтеза речи на шаг до звуковой волны: система сначала выдаёт структурированный план подачи и указывает, какие записи разрешают выбранные эмоцию, темп, высоту тона, энергию, паузы и акценты. Это полезная постановка для аудита, потому что правдоподобно звучащий результат ещё не означает, что модель опиралась на нужные сведения.

Метод. Планировщик формирует JSON с типизированными полями и ссылками на реплики, роль, сцену и речевые признаки. Детерминированная проверка отслеживает законность ссылок, соответствие полей источнику, выдуманные состояния, корректность схемы и локальность контрфактического изменения: если меняется одна подсказка, посторонние поля должны остаться прежними. Основная контролируемая выборка содержит 1440 случаев; отдельно собран срез из 100 примеров с непересекающимися ключами источников.

Результаты. На отложенных ключах обычная 7-миллиардная модель получает точность полей 0,684 и локальность 0,141. Дообучение SFT+CF на локальных контрфактических правках повышает эти показатели до 0,919 и 1,000, а оценку с обязательными ссылками на источник — с 0,858 до 0,964. Удаление исходных записей в согласованном сравнении уменьшает эту оценку на 0,488 и точность полей на 0,599, тогда как простое увеличение модели с 3 до 7 млрд параметров даёт лишь +0,023 и +0,051.

Ограничения. Работа намеренно не оценивает естественность синтезированной речи и не проводит прослушивание. В основной постановке эмоция и интенсивность заданы явными метками, роли и сцены почти фиксированы, поэтому результаты нельзя переносить на свободный контекст или сложные акустические признаки. Исходный звук также не распространяется из-за лицензий.

Фишка из статьи. Высокая точность самого плана оказывается опасно слабым показателем: правило, знающее только эмоцию, почти угадывает поля, но не умеет доказать их происхождение и не соблюдает локальность.

Вариант на непересекающихся ключахТочность полейЛокальностьОценка с обязательными ссылками
7B, обычное дообучение0,6840,1410,858
3B, исправленная схема JSON0,5460,1480,796
7B, SFT+CF0,9191,0000,964
Правило только по эмоции0,9580,000не определена

Как это читать: правило без ссылок превосходит обычную 7B-модель по точности полей, но полностью проваливает проверку причинности. Главный результат SFT+CF не в ещё одной прибавке к средней точности, а в одновременном восстановлении привязки к источнику и реакции только на изменённую подсказку.

Оригинальная статья на arXiv