распознавание речи телефония тайский язык
arXiv cs.SD

Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications

arXiv:2608.24916

Авторы показывают не просто еще одно дообучение распознавателя речи, а довольно честную картину специализации модели для тайских контакт-центров. Главный прием состоит в поэтапном добавлении телефонной речи и словаря имен с адресами к Canary Flash; особенно полезен результат, что усиление одной предметной области заметно портит другую.

Метод. Модели Canary 180M Flash и 1B Flash дообучают в NeMo на 1593 часах открытой тайской речи, затем на 77 часах телефонного материала BOTNOI, из которых 25 часов взяты из настоящих звонков, а 52 часа получены из записанных по сценарию и расширенных примеров. Для имен и адресов добавляют еще 104 часа. Такое разбиение позволяет отдельно увидеть языковую адаптацию, приспособление к телефонному каналу и обучение предметной лексике.

Результаты. На телефонном наборе BOTNOI символьная ошибка CER снижается с 23,31% у Canary без телефонной адаптации до 9,04%; для сравнения, Whisper-large-v3 дает 48,44%, ElevenLabs 19,68%, а Google Chirp 3 — 13,42%. На Common Voice 23 модель Canary 180M достигает CER 2,87% и обрабатывает звук в 601,8 раза быстрее реального времени на A100 при пакете из 32 примеров; версия 1B дает близкие 2,73% при скорости 531,4x. Это серверное измерение пропускной способности, а не задержка одиночного звонка.

Ограничения. Значительная часть проверки проведена на внутренних тайских данных и голосах сотрудников, а не на потоке реальных клиентов. Скорость измерена только на A100 40 ГБ и с пакетной обработкой. Наконец, ухудшение общей телефонной речи после добавления имен показывает, что для промышленного применения понадобится либо более аккуратное смешивание данных, либо маршрутизация специализированных моделей.

Фишка из статьи. Самый содержательный результат — отрицательный: резкое улучшение имен и адресов покупается ухудшением на обычных телефонных репликах. Усиленная специализация не является бесплатным продолжением общей адаптации.

Вариант CanaryCER на именах и адресахCER на телефонной речи
Телефонное дообучение16,98%9,04%
Телефония + имена и адреса3,78%10,89%

Как это читать: добавление предметного набора уменьшает ошибку на именах в 4,5 раза, но относительная ошибка на общей телефонной речи растет примерно на 20%. Среднее качество здесь скрывало бы важный риск переноса.

Оригинальная статья на arXiv