StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Supervised Streaming Speech Recognition
StreamHear переносит знания полно-контекстного распознавателя в потоковую модель, когда размеченной предметной речи мало, а неразмеченной достаточно. Главный практический вывод прост: одного цикла псевдоразметки хватает, чтобы при 160 мс алгоритмической задержки почти догнать офлайнового учителя на финансовых звонках.
Метод. Учитель Parakeet-TDT-0.6B-v3 сначала дообучается на размеченной части области и один раз расшифровывает неразмеченную. Потоковый ученик Nemotron-Speech-Streaming-EN-0.6B затем обучается на смеси настоящих и псевдометок. Для длинных записей авторы исправляют распределение слов по фрагментам: CTC-сегментация задаёт исходные границы, Whisper-Large-v3 даёт независимую привязку, а динамическое программирование переносит совпавшие слова между соседними фрагментами с штрафом за большое смещение. Основной режим использует 80-мс блок и 80 мс правого контекста.
Результаты. Относительно обычного дообученного ученика WER снижается с 7,19% до 6,63% на Earnings-21, с 12,46% до 11,76% на Earnings-22, с 2,77% до 2,59% на SPGISpeech и с 10,68% до 9,80% на BankCall. На неразмеченных при обучении, но размеченных для оценки частях выигрыш больше: 9,62% против 7,77% на Earnings-21 и 10,81% против 9,56% на Earnings-22. В последнем случае потоковая модель практически совпадает с дообученным офлайновым учителем, у которого 9,55%. Исправление границ отдельно уменьшает ошибку фрагментной разметки с 17,46% до 8,01% и с 20,54% до 10,97%.
Ограничения. Все четыре области англоязычные и в основном финансовые; BankCall закрыт. Качество зависит от сильного полно-контекстного учителя и дополнительного распознавателя для выравнивания, поэтому рецепт не устраняет стоимость подготовки. Указанные 160 мс - алгоритмическая задержка контекста, а не полная серверная задержка. Для каждой ячейки выполнено пять запусков на четырёх A100, но перенос на малые устройства и более шумные открытые разговоры не проверен.
Фишка из статьи. Отсечение псевдометок с низкой уверенностью не помогает. Чем больше материала оставляют, тем ниже WER, даже когда последние примеры учитель считает наименее надёжными.
| Доля псевдометок | Earnings-21, тест / доп. часть | Earnings-22, тест / доп. часть |
|---|---|---|
| 25% | 6,92 / 8,65 | 11,99 / 10,17 |
| 50% | 6,83 / 8,28 | 11,86 / 9,87 |
| 75% | 6,72 / 8,01 | 11,80 / 9,68 |
| 100% | 6,63 / 7,77 | 11,76 / 9,56 |
Как это читать: последовательное улучшение на обеих областях означает, что объём предметной речи оказался важнее ранжирования по правдоподобию учителя. Это полезный отрицательный результат для конвейеров псевдоразметки, хотя он не гарантирован при более слабом учителе или сильнее смещённой области.