Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement
Семантические речевые единицы должны хранить содержание, но часто продолжают кодировать говорящего и темп. ISTP использует простой критерий отбора: всё, что можно надёжно предсказать только по тексту, вероятнее относится к содержанию; непредсказуемые детали голоса и длительности следует ослабить. Для этого речевой и текстовый преобразователи единиц поочерёдно переучивают друг друга.
Метод. Исходный речевой токенизатор на HuBERT выдаёт 4096 дискретных единиц с частотой 25 Гц, после чего повторы удаляются. BART учится предсказывать эту последовательность по фонемам текста. Его декодированный результат становится CTC-целью для заново инициализированного речевого токенизатора, который затем создаёт данные для следующего BART; выполнено четыре цикла. Для честной проверки исходного и итогового пространств отдельно обучаются одинаковые декодеры речи примерно на 100 000 часов Mandarin и English Emilia.
Результаты. От T0 к T4 ошибка согласования речевого и текстового преобразователей снижается относительно на 72,0-86,7%, а BLEU растёт на 58,88-73,39 пункта; к четвёртому циклу разница между ними не превышает 0,0058 WER и 0,85 BLEU. На VCTK расстояние редактирования единиц UED падает с 344,61 до 59,44, SelfBLEU-4 растёт с 27,04 до 94,17. При преобразовании голоса английский WER немного улучшается с 3,00% до 2,94%, а сходство с заданным голосом - с 0,63 до 0,71; для китайского сходство растёт с 0,73 до 0,77.
Ограничения. Четыре переобучения S2U и T2U плюс отдельные декодеры на 100 000 часов делают метод дорогим, хотя время и энергозатраты не приведены. Проверены только китайский и английский, без субъективного прослушивания и задач понимания речи. Точность определения говорящего по исходным единицам уже всего 0,10%, поэтому её снижение до 0,09% мало в абсолютном выражении. Высокая одинаковость последовательностей может удалить полезную просодию, что не проверено на эмоциях или пении.
Фишка из статьи. Нормализация подтверждается сразу на трёх уровнях: одинаковый текст у разных говорящих получает почти одинаковые единицы, простой классификатор хуже восстанавливает личность, а декодер лучше следует темпу опорного голоса.
| Единицы | UED, ниже лучше | SelfBLEU-4 | Точность определения говорящего | Английский VC: WER / SIM |
|---|---|---|---|---|
| R-Spin | 241,42 | 76,64 | 0,15% | - |
| ISTP, цикл 0 | 344,61 | 27,04 | 0,10% | 3,00% / 0,63 |
| ISTP, цикл 4 | 59,44 | 94,17 | 0,09% | 2,94% / 0,71 |
Как это читать: рост сходства единиц не покупается явной потерей разборчивости. Но почти нулевая точность классификатора не доказывает полной анонимности: более сильная атака или другие признаки могут всё ещё извлечь личность.