S2ST Benchmark Expressiveness
Speech translation

STEB: speech-to-speech translation нужно оценивать не только по смыслу

32.6h S2ST

STEB — benchmark для speech-to-speech translation, который смотрит дальше BLEU/COMET. В S2ST важно сохранить не только лексический смысл, но и expressiveness: emotion, scenario style и nonverbal vocalizations вроде laughter, cough, sigh или whisper. Обычная reference-based оценка плохо масштабируется, поэтому авторы предлагают caption-then-judge схему.

Что входит в benchmark

STEB содержит 32.6 часа Chinese-English speech-to-speech translation evaluation data и покрывает оба направления: Chinese to English и English to Chinese. В сравнительной таблице авторы подчеркивают отличие от CVSS, FLEURS, mExpresso, MELD-ST и EmphAssess: STEB одновременно поддерживает emotion preservation, scenario-style preservation и nonverbal-vocalization preservation.

Как оценивают expressiveness

Авторы не требуют идеальную target reference speech для каждого source sample. Вместо этого они строят summary/caption representation для исходной речи, а затем LLM judge оценивает, насколько переведенная речь сохранила translation fidelity, speaker similarity, duration alignment и выразительные признаки. Для NV отдельно смотрят тип, число, порядок и примерную позицию событий.

Human-correlation table показывает, что summary-based scoring ближе к людям, чем прямой audio-based scoring. Для emotion Spearman rho у human-human — 0.584, у summary-based LLM vs human — 0.515, тогда как direct audio scoring дает только 0.044. Для nonverbal vocalizations human-human rho 0.789, summary-based — 0.518, direct audio — -0.009. Это сильный аргумент в пользу промежуточной структурированной репрезентации.

Что видно по системам

На Chinese to English two-stage pipeline выигрывает по BLEU: 41.59 против 38.20 у three-stage, но UniSS заметно сильнее по emotion preservation: 3.61 против 1.68-1.73 у cascaded pipelines. На English to Chinese та же дилемма: two-stage дает BLEU 59.66-59.73, а UniSS берет emotion 3.82 и почти идеальный duration alignment SLC0.2 0.980. То есть системы, которые лучше переводят текст, не обязательно лучше сохраняют голосовую выразительность.

Практический вывод

STEB хорошо формулирует следующий рубеж для S2ST: “перевел правильно” уже недостаточно. Для дубляжа, live translation, customer support и ассистентов важно, чтобы тревога, сарказм, стиль новости или драматической реплики и невербальные события не исчезали при переводе. Benchmark полезен именно тем, что делает этот trade-off видимым: translation fidelity, voice similarity, timing и expressiveness начинают измеряться вместе.

Фишка из статьи. STEB показывает, что современные S2ST-системы гораздо лучше переносят “что сказано”, чем “как сказано”. Причем простое добавление текстовых инструкций в cascaded TTS почти не добавляет выразительности, а reference-free оценивание через caption/summarize/judge коррелирует с людьми лучше, чем прямое audio LLM judging.

БенчмаркОбъемEmotionStyleNon-verbal
CVSS12.1 чнетнетнет
FLEURS4.8 чнетнетнет
mExpresso4.8 чданетнет
MELD-ST3.3 чданетнет
EmphAssess2.1 чнетчастичнонет
STEB32.6 чдадада
Метрика корреляции с людьмиEmotion ρStyle ρNV ρ
Human-human0.5840.5140.789
Summary-based LLM score0.5150.4270.518
Direct audio LLM score0.0440.158-0.009
Caption-only score0.0470.1470.193

Самая полезная деталь для будущих работ: BLEU уже не объясняет качество S2ST. Например, UniSS и Step-Audio 2 могут показывать сильную передачу текста, но expressive-аспекты все еще остаются отдельной, плохо решенной задачей.

Оригинальная статья на arXiv