диаризация распознавание речи многоязычность
arXiv eess.AS

HINTT для MLC-SLM: каскадная и единая диаризация с распознаванием речи

arXiv:2610.08063

Система HINTT даёт полезное инженерное сравнение двух способов многоязычного распознавания речи с метками говорящих: каскада из диаризации и распознавателя и единой модели, которая делает всё сразу. На 21 языке и локали каскад оказывается заметно стабильнее, хотя единая модель выигрывает в отдельных языках.

Метод. Каскад использует дообученный DiariZen, голосовые признаки SimAMResNet100, Qwen3-ASR и исправление текста большой языковой моделью. Единый вариант дообучает VibeVoice-ASR на 60-секундных фрагментах. Все модели используют только официальные данные MLC-SLM без псевдоразметки; итоговая метрика tcpWER/tcpCER учитывает одновременно расшифровку и привязку к говорящему.

Результаты. Дообучение DiariZen снижает средний DER с 17,04% до 3,25%, а замена голосовых признаков уменьшает его до 2,93%; остаток почти полностью составляет путаница говорящих, 2,27 процентного пункта. Лучший каскад на development достигает 15,28% tcpWER/tcpCER против 18,50% у VibeVoice-ASR и 79,15% у официальной LoRA-базы. На evaluation SpecAugment и исправление текста последовательно снижают ошибку с 16,70% до 16,27%.

Ограничения. Это конкурсная система, а не чистое архитектурное исследование: компоненты и гиперпараметры оптимизированы под один набор. Единая модель дообучалась лишь на коротких 60-секундных окнах из-за вычислительных ограничений, что делает сравнение не полностью симметричным. LLM-корректор добавляет стоимость и может менять имена или редкие слова.

Фишка из статьи. После хорошей сегментации основной резерв находится уже не в детекторе речи, а в назначении говорящего: пропуски и ложные срабатывания вместе дают лишь 0,66% DER.

ДиаризаторПропуск, %Ложная речь, %Путаница, %DER, %
Исходный DiariZen7,733,006,3017,04
Дообученный DiariZen0,060,602,593,25
+ SimAMResNet1000,060,602,272,93
VibeVoice-ASR0,520,863,755,12

Как это читать: после дообучения сегментация почти насыщается. Следующее улучшение должно приходить от более устойчивых межъязыковых голосовых представлений и контекстного назначения говорящего, а не от ещё одного порога VAD.

Оригинальная статья на arXiv