просодия распознавание речи отрицательный результат
arXiv eess.AS

Помогает ли обученное на просодии представление сверх обучаемого объединения? Сравнение с замороженным HuBERT при равном числе параметров

arXiv:2609.36754

Работа разбирает частую ловушку вспомогательных речевых признаков: улучшение может давать не новый признак, а сам обучаемый модуль, через который его подключили. Просодическое представление сравнивается с тем же слоем объединения, получающим постоянный нулевой вход.

Метод. Отдельный кодировщик учится предсказывать F0, изменение F0, энергию, спектральный наклон и звонкость. Затем его 64-мерный выход подаётся в двенадцать FiLM-модулей поверх замороженных слоёв HuBERT; Baseline не имеет этих модулей, Null имеет те же параметры, но всегда получает ноль.

Результаты. Null снижает WER относительно Baseline на 1,45 пункта в Buckeye, 0,71 в Switchboard и 0,89 в AMI. Learned отличается от Null всего на +0,07, -0,09 и 0,00 пункта; все доверительные интервалы включают ноль. При этом замена просодии другой записью ухудшает WER на 0,42-1,06 пункта, то есть сеть использует вход, но не получает от него добавочной пользы.

Ограничения. Вывод относится к одному замороженному HuBERT, CTC и постфактум-объединению; полное дообучение или передача изменённых состояний в следующие слои может дать другой результат. Просодическая разметка автоматическая и не включает длительность.

Фишка из статьи. Нулевая ветвь является активной моделью, а не пустой заглушкой: её остаточные изменения скрытых состояний даже больше, чем у Learned. Поэтому сравнение только с Baseline ошибочно приписало бы весь выигрыш просодическому представлению.

КорпусBaseline WER ↓Null WER ↓Learned WER ↓Learned - Null
Buckeye37,27%35,82%35,89%+0,07 п.п.
Switchboard31,95%31,24%31,15%-0,09 п.п.
AMI IHM39,11%38,23%38,23%0,00 п.п.

Как это читать: обучаемая ветвь улучшает распознавание, но сведения о просодии поверх неё почти ничего не добавляют. Только контроль с равным числом параметров отделяет эти два эффекта.

Оригинальная статья на arXiv