STEB: speech-to-speech translation нужно оценивать не только по смыслу
STEB — benchmark для speech-to-speech translation, который смотрит дальше BLEU/COMET. В S2ST важно сохранить не только лексический смысл, но и expressiveness: emotion, scenario style и nonverbal vocalizations вроде laughter, cough, sigh или whisper. Обычная reference-based оценка плохо масштабируется, поэтому авторы предлагают caption-then-judge схему.
Что входит в benchmark
STEB содержит 32.6 часа Chinese-English speech-to-speech translation evaluation data и покрывает оба направления: Chinese to English и English to Chinese. В сравнительной таблице авторы подчеркивают отличие от CVSS, FLEURS, mExpresso, MELD-ST и EmphAssess: STEB одновременно поддерживает emotion preservation, scenario-style preservation и nonverbal-vocalization preservation.
Как оценивают expressiveness
Авторы не требуют идеальную target reference speech для каждого source sample. Вместо этого они строят summary/caption representation для исходной речи, а затем LLM judge оценивает, насколько переведенная речь сохранила translation fidelity, speaker similarity, duration alignment и выразительные признаки. Для NV отдельно смотрят тип, число, порядок и примерную позицию событий.
Human-correlation table показывает, что summary-based scoring ближе к людям, чем прямой audio-based scoring. Для emotion Spearman rho у human-human — 0.584, у summary-based LLM vs human — 0.515, тогда как direct audio scoring дает только 0.044. Для nonverbal vocalizations human-human rho 0.789, summary-based — 0.518, direct audio — -0.009. Это сильный аргумент в пользу промежуточной структурированной репрезентации.
Что видно по системам
На Chinese to English two-stage pipeline выигрывает по BLEU: 41.59 против 38.20 у three-stage, но UniSS заметно сильнее по emotion preservation: 3.61 против 1.68-1.73 у cascaded pipelines. На English to Chinese та же дилемма: two-stage дает BLEU 59.66-59.73, а UniSS берет emotion 3.82 и почти идеальный duration alignment SLC0.2 0.980. То есть системы, которые лучше переводят текст, не обязательно лучше сохраняют голосовую выразительность.
Практический вывод
STEB хорошо формулирует следующий рубеж для S2ST: “перевел правильно” уже недостаточно. Для дубляжа, live translation, customer support и ассистентов важно, чтобы тревога, сарказм, стиль новости или драматической реплики и невербальные события не исчезали при переводе. Benchmark полезен именно тем, что делает этот trade-off видимым: translation fidelity, voice similarity, timing и expressiveness начинают измеряться вместе.
Фишка из статьи. STEB показывает, что современные S2ST-системы гораздо лучше переносят “что сказано”, чем “как сказано”. Причем простое добавление текстовых инструкций в cascaded TTS почти не добавляет выразительности, а reference-free оценивание через caption/summarize/judge коррелирует с людьми лучше, чем прямое audio LLM judging.
| Бенчмарк | Объем | Emotion | Style | Non-verbal |
|---|---|---|---|---|
| CVSS | 12.1 ч | нет | нет | нет |
| FLEURS | 4.8 ч | нет | нет | нет |
| mExpresso | 4.8 ч | да | нет | нет |
| MELD-ST | 3.3 ч | да | нет | нет |
| EmphAssess | 2.1 ч | нет | частично | нет |
| STEB | 32.6 ч | да | да | да |
| Метрика корреляции с людьми | Emotion ρ | Style ρ | NV ρ |
|---|---|---|---|
| Human-human | 0.584 | 0.514 | 0.789 |
| Summary-based LLM score | 0.515 | 0.427 | 0.518 |
| Direct audio LLM score | 0.044 | 0.158 | -0.009 |
| Caption-only score | 0.047 | 0.147 | 0.193 |
Самая полезная деталь для будущих работ: BLEU уже не объясняет качество S2ST. Например, UniSS и Step-Audio 2 могут показывать сильную передачу текста, но expressive-аспекты все еще остаются отдельной, плохо решенной задачей.