VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis
VoxReason переносит проверку управляемого синтеза речи на шаг до звуковой волны: система сначала выдаёт структурированный план подачи и указывает, какие записи разрешают выбранные эмоцию, темп, высоту тона, энергию, паузы и акценты. Это полезная постановка для аудита, потому что правдоподобно звучащий результат ещё не означает, что модель опиралась на нужные сведения.
Метод. Планировщик формирует JSON с типизированными полями и ссылками на реплики, роль, сцену и речевые признаки. Детерминированная проверка отслеживает законность ссылок, соответствие полей источнику, выдуманные состояния, корректность схемы и локальность контрфактического изменения: если меняется одна подсказка, посторонние поля должны остаться прежними. Основная контролируемая выборка содержит 1440 случаев; отдельно собран срез из 100 примеров с непересекающимися ключами источников.
Результаты. На отложенных ключах обычная 7-миллиардная модель получает точность полей 0,684 и локальность 0,141. Дообучение SFT+CF на локальных контрфактических правках повышает эти показатели до 0,919 и 1,000, а оценку с обязательными ссылками на источник — с 0,858 до 0,964. Удаление исходных записей в согласованном сравнении уменьшает эту оценку на 0,488 и точность полей на 0,599, тогда как простое увеличение модели с 3 до 7 млрд параметров даёт лишь +0,023 и +0,051.
Ограничения. Работа намеренно не оценивает естественность синтезированной речи и не проводит прослушивание. В основной постановке эмоция и интенсивность заданы явными метками, роли и сцены почти фиксированы, поэтому результаты нельзя переносить на свободный контекст или сложные акустические признаки. Исходный звук также не распространяется из-за лицензий.
Фишка из статьи. Высокая точность самого плана оказывается опасно слабым показателем: правило, знающее только эмоцию, почти угадывает поля, но не умеет доказать их происхождение и не соблюдает локальность.
| Вариант на непересекающихся ключах | Точность полей | Локальность | Оценка с обязательными ссылками |
|---|---|---|---|
| 7B, обычное дообучение | 0,684 | 0,141 | 0,858 |
| 3B, исправленная схема JSON | 0,546 | 0,148 | 0,796 |
| 7B, SFT+CF | 0,919 | 1,000 | 0,964 |
| Правило только по эмоции | 0,958 | 0,000 | не определена |
Как это читать: правило без ссылок превосходит обычную 7B-модель по точности полей, но полностью проваливает проверку причинности. Главный результат SFT+CF не в ещё одной прибавке к средней точности, а в одновременном восстановлении привязки к источнику и реакции только на изменённую подсказку.