Latent Softmax: фонемное распознавание тональных и нетональных языков
Статья аккуратно разбирает проблему фонемного многоязычного распознавания: тональные языки требуют tone-marked vowels, а нетональные обычно размечают только базовые гласные. Если держать все классы раздельно, модель плохо делится данными между языками; если схлопнуть тоны, теряются нужные различия для Mandarin. Latent Softmax предлагает CTC-совместимый выходной слой, где тоновые варианты являются подклассами, а для нетонального языка конкретный подкласс остается скрытым.
Метод. Для Mandarin метка вроде tone-marked vowel обучает конкретный subclass. Для English базовая гласная supervises major class, полученный суммированием вероятностей совместимых тоновых subclass. Согласные и CTC blank остаются singleton-классами. Сверху авторы проверяют два downstream интерфейса: LLM-P2G, который переводит фонемную строку в графемы, и projector, который подает представления S2P encoder в языковую модель без прямой дискретной строки.
Результаты. На AISHELL-1 Latent Softmax снижает tonal PER с 2.03% до 1.86%, а WER с 5.63% до 5.26% в LLM-P2G. На LibriSpeech test-clean non-tonal PER падает с 1.60% до 1.32%, WER с 4.29% до 3.91%; на test-other PER с 5.00% до 4.37%, WER с 10.70% до 9.89%. С projector интерфейсем WER тоже улучшается: AISHELL-1 5.61% -> 5.52%, test-clean 3.92% -> 3.63%, test-other 9.61% -> 9.14%. На CS-Dialogue projector MER снижается с 15.53 до 14.06, то есть на 9.5% относительно baseline.
Ограничения. Метод проверен на паре Mandarin-English и двух code-switching наборах; перенос на другие тональные языки не доказан. На ASRU2019 с LLM-P2G стандартный softmax чуть лучше по MER: 13.69 против 13.83 у Latent Softmax. Интерпретация "тоновых" subclass для English качественная: авторы прямо предупреждают, что это не ground-truth тоны английского языка. LLM-P2G для CS-Dialogue оказался нестабилен из-за малого объема данных и шумных S2P последовательностей.
Фишка из статьи. Самый интересный кусок - проверка subclass versus major-class input для LLM-P2G. Даже в английском, где тоновые метки не являются лингвистической истиной, subclass-последовательность дает небольшой, но стабильный выигрыш.
| S2P output для LLM-P2G | AISHELL-1 WER | LibriSpeech clean WER | LibriSpeech other WER |
|---|---|---|---|
| Major class | 5.31% | 4.10% | 10.19% |
| Subclass | 5.26% | 3.91% | 9.89% |
Как это читать: subclass-представление не превращает английский в тональный язык, но сохраняет тонкую просодическую/акустическую вариативность, полезную для P2G. Это умеренный результат, а не радикальный скачок, зато он хорошо объясняет, почему частичное sharing через Latent Softmax лучше плоского softmax.