AnyBand: спектральное достраивание речи для любой полосы
AnyBand решает практичную задачу bandwidth extension: речь может приходить с разными частотами среза, а обычные модели часто обучаются под фиксированное преобразование. Авторы формулируют расширение полосы как in-context spectral infilling: наблюдаемая низкочастотная часть служит частотной подсказкой, а модель достраивает отсутствующий верх спектра. Работа особенно интересна как частотно-временной метод для речи: она явно использует маску среза, frequency-aware модули и спектральные дискриминаторы.
Метод. Входом служит mel-представление, где частоты выше текущего cutoff замаскированы. Генератор обучается flow-matching задаче восстановления недостающего спектра и затем донастраивается adversarial refinement. Multi-view spectral discriminators смотрят на спектр в разных временных масштабах, а cross-band discriminator проверяет, согласованы ли высокочастотные огибающие с наблюдаемой низкой полосой. Отдельная Easy-to-Balanced curriculum сначала чаще дает более легкие высокие cutoff, а затем переходит к равномерному покрытию всего диапазона.
Результаты. На VCTK при входе 2 кГц AnyBand получает LSD 1.248, HF-LSD 1.269, NISQA 3.125 и STOI 0.8214; ближайший Fre-Painter имеет LSD 1.323, HF-LSD 1.331, NISQA 2.697, STOI 0.7820. На EARS при 2 кГц AnyBand дает LSD 1.546 и HF-LSD 1.584 против 1.958/1.971 у AudioSR и 2.568/2.595 у Fre-Painter. На нерегулярных входах 3, 6, 12 и 15 кГц AnyBand сохраняет лучший LSD и HF-LSD во всех четырех настройках, что важно для переменных каналов связи.
Ограничения. Входы создаются маскированием частотных bin-ов, поэтому реальные телефонные и кодековые артефакты могут быть сложнее. Система генерирует 48 кГц, но статья не фокусируется на задержке потокового режима. Субъективная оценка есть, но основная аргументация держится на LSD, NISQA, COL и STOI. Для речи с сильным шумом, реверберацией или музыкальным фоном переносимость надо проверять отдельно.
Фишка из статьи. Самый хороший инженерный фрагмент - абляция cutoff sampling. Непрерывный охват cutoff сам по себе не гарантирует лучший результат; Easy-to-Balanced curriculum дает лучший средний LSD/HF-LSD и при этом сохраняет STOI.
| Sampling strategy на VCTK | Avg. LSD | Avg. HF-LSD | Avg. NISQA | Avg. STOI |
|---|---|---|---|---|
| Uniform discrete | 1.143 | 1.196 | 3.735 | 0.9341 |
| Uniform continuous | 1.183 | 1.244 | 3.545 | 0.9265 |
| Easy-to-Balanced | 1.122 | 1.184 | 3.778 | 0.9358 |
Как это читать: непрерывная равномерная выборка cutoff даже хуже дискретной в среднем, а curriculum выигрывает у обеих. Значит, для спектрального достраивания важно не только покрыть все полосы, но и правильно организовать сложность обучения от простых к более недоопределенным случаям.