ECCD: защита синтеза речи от hallucinations на этапе декодирования
Статья решает конкретную проблему LM-based TTS: синтезатор может начать говорить не тот текст, особенно в трудных переходах, и это выглядит как речевая hallucination. Авторы не меняют архитектуру и не требуют дополнительного обучения, а вмешиваются только в decoding-time score. ECCD сравнивает предсказания одной и той же речевой языковой модели с текстовым условием и без него, усиливая токены, где текст реально поддерживает выбранное продолжение.
Метод. Авторы разделяют две информации: alignment information из текста и experience information из акустического контекста и выученных речевых закономерностей. Обычный contrastive decoding может слишком сильно давить "amateur" распределение и портить голос или естественность. ECCD добавляет expert anchor, positive-only усиление и калибровку по совместимости опыта, чтобы не разрушать полезную акустическую регулярность. Метод применяется к score перед выбором следующего токена и не требует переобучения модели.
Результаты. На SeedTTS-Eval ECCD снижает ошибки у всех четырех базовых моделей. У CosyVoice2 CER на test-zh падает с 1.34% до 0.95%, WER на test-en с 2.98% до 2.08%, CER на test-hard с 8.10% до 6.91%. У Llasa улучшение еще сильнее: test-zh CER 8.66% -> 3.95%, test-en WER 6.83% -> 3.03%, test-hard CER 26.26% -> 14.27%. На multilingual CV3-Eval метод улучшает 24 из 25 условий. В субъективной проверке CosyVoice2 на test-hard получает CMOS +0.644 против native decoding при SMOS 3.811.
Ограничения. ECCD помогает именно ошибкам выбора токенов на декодировании, но не исправляет плохую обученную модель или ошибочную фонетическую разметку. Метод требует доступа к распределениям модели с текстовым условием и без него; это не всегда доступно в закрытых TTS API. В одной японской настройке CosyVoice2 ошибка слегка выросла с 9.46% до 9.71%. Кроме того, снижение WER/CER не всегда означает лучшую похожесть голоса: в некоторых строках speaker similarity немного падает.
Фишка из статьи. Абляция показывает, почему обычный contrastive decoding недостаточен. Если просто вычитать распределение без текстового условия, CER на CosyVoice2 test-hard даже растет. Улучшение появляется только после экспертной опоры, positive-only правила и калибровки через compatibility.
| Вариант на CosyVoice2 test-hard | CER | SS | UAC ratio | TAD ratio |
|---|---|---|---|---|
| Native decoder | 8.10% | 0.822 | 1.00 | 1.00 |
| Conventional CD | 8.72% | 0.738 | 0.66 | 0.76 |
| + Expert anchor | 6.86% | 0.793 | 0.77 | 0.87 |
| + Positive-only | 6.43% | 0.795 | 0.78 | 0.87 |
| + Compatibility, ECCD | 6.91% | 0.811 | 0.87 | 0.93 |
Как это читать: минимальный CER дает positive-only вариант, но ECCD сознательно возвращает часть speaker similarity и траекторной совместимости. Это полезный trade-off для TTS: меньше ошибок текста без сильного разрушения голоса и акустической связности.