Синтез речи Hallucinations Decoding
Надежность TTS

ECCD: защита синтеза речи от hallucinations на этапе декодирования

CMOS +0.644

Статья решает конкретную проблему LM-based TTS: синтезатор может начать говорить не тот текст, особенно в трудных переходах, и это выглядит как речевая hallucination. Авторы не меняют архитектуру и не требуют дополнительного обучения, а вмешиваются только в decoding-time score. ECCD сравнивает предсказания одной и той же речевой языковой модели с текстовым условием и без него, усиливая токены, где текст реально поддерживает выбранное продолжение.

Метод. Авторы разделяют две информации: alignment information из текста и experience information из акустического контекста и выученных речевых закономерностей. Обычный contrastive decoding может слишком сильно давить "amateur" распределение и портить голос или естественность. ECCD добавляет expert anchor, positive-only усиление и калибровку по совместимости опыта, чтобы не разрушать полезную акустическую регулярность. Метод применяется к score перед выбором следующего токена и не требует переобучения модели.

Результаты. На SeedTTS-Eval ECCD снижает ошибки у всех четырех базовых моделей. У CosyVoice2 CER на test-zh падает с 1.34% до 0.95%, WER на test-en с 2.98% до 2.08%, CER на test-hard с 8.10% до 6.91%. У Llasa улучшение еще сильнее: test-zh CER 8.66% -> 3.95%, test-en WER 6.83% -> 3.03%, test-hard CER 26.26% -> 14.27%. На multilingual CV3-Eval метод улучшает 24 из 25 условий. В субъективной проверке CosyVoice2 на test-hard получает CMOS +0.644 против native decoding при SMOS 3.811.

Ограничения. ECCD помогает именно ошибкам выбора токенов на декодировании, но не исправляет плохую обученную модель или ошибочную фонетическую разметку. Метод требует доступа к распределениям модели с текстовым условием и без него; это не всегда доступно в закрытых TTS API. В одной японской настройке CosyVoice2 ошибка слегка выросла с 9.46% до 9.71%. Кроме того, снижение WER/CER не всегда означает лучшую похожесть голоса: в некоторых строках speaker similarity немного падает.

Фишка из статьи. Абляция показывает, почему обычный contrastive decoding недостаточен. Если просто вычитать распределение без текстового условия, CER на CosyVoice2 test-hard даже растет. Улучшение появляется только после экспертной опоры, positive-only правила и калибровки через compatibility.

Вариант на CosyVoice2 test-hardCERSSUAC ratioTAD ratio
Native decoder8.10%0.8221.001.00
Conventional CD8.72%0.7380.660.76
+ Expert anchor6.86%0.7930.770.87
+ Positive-only6.43%0.7950.780.87
+ Compatibility, ECCD6.91%0.8110.870.93

Как это читать: минимальный CER дает positive-only вариант, но ECCD сознательно возвращает часть speaker similarity и траекторной совместимости. Это полезный trade-off для TTS: меньше ошибок текста без сильного разрушения голоса и акустической связности.

Оригинальная статья на arXiv