π€ AI Summary
Audio denoising is critical for enhancing intelligibility and fidelity of complex audio signals such as music, yet discriminative models (e.g., U-Net) suffer from limitations in generation quality and fine-grained reconstruction. This paper introduces the first generative music denoising framework built upon the neural Audio Codec (DAC), achieved by adapting the Descript Audio Codec architecture into an end-to-end differentiable denoising system. We propose a multi-objective loss function jointly optimizing time-domain fidelity, spectral consistency, and perceptual quality. The model is trained on a large-scale, custom-synthesized noisyβclean paired dataset. Experiments demonstrate that our method significantly outperforms state-of-the-art discriminative and generative baselines across objective metrics (STOI, ESTOI, PESQ) and subjective listening tests. To our knowledge, this is the first work to validate the effectiveness and superiority of neural audio codecs for high-fidelity generative audio restoration.
π Abstract
Audio denoising is critical in signal processing, enhancing intelligibility and fidelity for applications like restoring musical recordings. This paper presents a proof-of-concept for adapting a state-of-the-art neural audio codec, the Descript Audio Codec (DAC), for music denoising. This work overcomes the limitations of traditional architectures like U-Nets by training the model on a large-scale, custom-synthesized dataset built from diverse sources. Training is guided by a multi objective loss function that combines time-domain, spectral, and signal-level fidelity metrics. Ultimately, this paper aims to present a PoC for high-fidelity, generative audio restoration.