Кодек 300 bps WER
Речевые кодеки

ClariCodec: нейрокодек речи на 300 бит/с с оптимизацией разборчивости

300 bps

ClariCodec нацелен на экстремально низкий битрейт, где обычная оптимизация акустического восстановления начинает тратить биты не туда: звук может быть более приятным, но слова распознаются хуже. Авторы предлагают нейрокодек на 300 бит/с и дообучают кодировщик через reward, связанный с WER, оставляя акустический тракт под контролем реконструкционных потерь. Главная ценность работы - явный trade-off между разборчивостью, качеством и задержкой.

Система использует ConvNeXt V2 encoder и residual FSQ: 12.5 frames/s умножаются на 24 bits/frame, что дает ровно 300 bps. Stage 1 обучает реконструкцию речи, Stage 2 рассматривает квантование как стохастическую политику и применяет GRPO с reward = -WER, где WER считается внешним распознавателем. Чтобы не разрушить акустическое качество, к RL добавляют mel reconstruction anchor. Для потокового варианта ограничивают temporal context; теоретическая задержка получается 374 мс.

На LibriSpeech test-clean ClariCodec без RL дает 4.64% WER, после RL - 3.55% WER, то есть относительное снижение на 23.5%, при STOI 0.87, PESQ 1.87, UTMOS 4.16 и SIM 0.50. Это лучше StableCodec-400 по WER, 3.55% против 4.88%, хотя StableCodec работает на 400 bps. Потоковый вариант улучшает WER с 6.63% до 4.53% при 374 мс задержки. На test-other WER падает с 13.3% до 10.4%, на LJSpeech - с 4.44% до 3.82%, что показывает перенос эффекта за пределы test-clean.

Ограничения ожидаемые для такого режима. PESQ 1.87 ниже, чем у более широкополосных семантических кодеков вроде SAC и FlexiCodec, то есть статья честно выбирает разборчивость, а не Hi-Fi качество. Reward зависит от внешнего распознавателя, поэтому возможна подгонка под его ошибки. Эксперименты в основном англоязычные и офлайн/лабораторные; реальная связь с потерями пакетов, шумом канала и интерактивными пользовательскими оценками не закрыта.

Фишка из статьи. Хорошая инженерная деталь - ablation показывает, что чистый RL почти весь выигрыш по WER дает, но немного портит PESQ; mel anchor возвращает качество почти обратно.

Stage 2 lossSTOIPESQUTMOSSIMWER
Stage 1, без RL0.871.884.120.504.64%
Only RL loss0.871.834.150.503.54%
Mel + RL loss0.871.874.160.503.55%

Как это читать: цель не в том, чтобы сделать самый красивый звук на 300 bps, а в том, чтобы не потерять слова. Mel + RL почти не уступает чистому RL по WER, но возвращает PESQ с 1.83 до 1.87, то есть фиксирует именно опасный перекос reward-only оптимизации.

Оригинальная статья на arXiv