Помогает ли обученное на просодии представление сверх обучаемого объединения? Сравнение с замороженным HuBERT при равном числе параметров
Работа разбирает частую ловушку вспомогательных речевых признаков: улучшение может давать не новый признак, а сам обучаемый модуль, через который его подключили. Просодическое представление сравнивается с тем же слоем объединения, получающим постоянный нулевой вход.
Метод. Отдельный кодировщик учится предсказывать F0, изменение F0, энергию, спектральный наклон и звонкость. Затем его 64-мерный выход подаётся в двенадцать FiLM-модулей поверх замороженных слоёв HuBERT; Baseline не имеет этих модулей, Null имеет те же параметры, но всегда получает ноль.
Результаты. Null снижает WER относительно Baseline на 1,45 пункта в Buckeye, 0,71 в Switchboard и 0,89 в AMI. Learned отличается от Null всего на +0,07, -0,09 и 0,00 пункта; все доверительные интервалы включают ноль. При этом замена просодии другой записью ухудшает WER на 0,42-1,06 пункта, то есть сеть использует вход, но не получает от него добавочной пользы.
Ограничения. Вывод относится к одному замороженному HuBERT, CTC и постфактум-объединению; полное дообучение или передача изменённых состояний в следующие слои может дать другой результат. Просодическая разметка автоматическая и не включает длительность.
Фишка из статьи. Нулевая ветвь является активной моделью, а не пустой заглушкой: её остаточные изменения скрытых состояний даже больше, чем у Learned. Поэтому сравнение только с Baseline ошибочно приписало бы весь выигрыш просодическому представлению.
| Корпус | Baseline WER ↓ | Null WER ↓ | Learned WER ↓ | Learned - Null |
|---|---|---|---|---|
| Buckeye | 37,27% | 35,82% | 35,89% | +0,07 п.п. |
| Switchboard | 31,95% | 31,24% | 31,15% | -0,09 п.п. |
| AMI IHM | 39,11% | 38,23% | 38,23% | 0,00 п.п. |
Как это читать: обучаемая ветвь улучшает распознавание, но сведения о просодии поверх неё почти ничего не добавляют. Только контроль с равным числом параметров отделяет эти два эффекта.