Улучшение речи Частотный анализ 48 kHz
Расширение полосы речи

AnyBand: спектральное достраивание речи для любой полосы

HF-LSD 1.269

AnyBand решает практичную задачу bandwidth extension: речь может приходить с разными частотами среза, а обычные модели часто обучаются под фиксированное преобразование. Авторы формулируют расширение полосы как in-context spectral infilling: наблюдаемая низкочастотная часть служит частотной подсказкой, а модель достраивает отсутствующий верх спектра. Работа особенно интересна как частотно-временной метод для речи: она явно использует маску среза, frequency-aware модули и спектральные дискриминаторы.

Метод. Входом служит mel-представление, где частоты выше текущего cutoff замаскированы. Генератор обучается flow-matching задаче восстановления недостающего спектра и затем донастраивается adversarial refinement. Multi-view spectral discriminators смотрят на спектр в разных временных масштабах, а cross-band discriminator проверяет, согласованы ли высокочастотные огибающие с наблюдаемой низкой полосой. Отдельная Easy-to-Balanced curriculum сначала чаще дает более легкие высокие cutoff, а затем переходит к равномерному покрытию всего диапазона.

Результаты. На VCTK при входе 2 кГц AnyBand получает LSD 1.248, HF-LSD 1.269, NISQA 3.125 и STOI 0.8214; ближайший Fre-Painter имеет LSD 1.323, HF-LSD 1.331, NISQA 2.697, STOI 0.7820. На EARS при 2 кГц AnyBand дает LSD 1.546 и HF-LSD 1.584 против 1.958/1.971 у AudioSR и 2.568/2.595 у Fre-Painter. На нерегулярных входах 3, 6, 12 и 15 кГц AnyBand сохраняет лучший LSD и HF-LSD во всех четырех настройках, что важно для переменных каналов связи.

Ограничения. Входы создаются маскированием частотных bin-ов, поэтому реальные телефонные и кодековые артефакты могут быть сложнее. Система генерирует 48 кГц, но статья не фокусируется на задержке потокового режима. Субъективная оценка есть, но основная аргументация держится на LSD, NISQA, COL и STOI. Для речи с сильным шумом, реверберацией или музыкальным фоном переносимость надо проверять отдельно.

Фишка из статьи. Самый хороший инженерный фрагмент - абляция cutoff sampling. Непрерывный охват cutoff сам по себе не гарантирует лучший результат; Easy-to-Balanced curriculum дает лучший средний LSD/HF-LSD и при этом сохраняет STOI.

Sampling strategy на VCTKAvg. LSDAvg. HF-LSDAvg. NISQAAvg. STOI
Uniform discrete1.1431.1963.7350.9341
Uniform continuous1.1831.2443.5450.9265
Easy-to-Balanced1.1221.1843.7780.9358

Как это читать: непрерывная равномерная выборка cutoff даже хуже дискретной в среднем, а curriculum выигрывает у обеих. Значит, для спектрального достраивания важно не только покрыть все полосы, но и правильно организовать сложность обучения от простых к более недоопределенным случаям.

Оригинальная статья на arXiv