ADNAC: Audio Denoiser using Neural Audio Codec

πŸ“… 2025-11-03
πŸ“ˆ Citations: 0
✨ Influential: 0
πŸ“„ PDF
πŸ€– AI Summary
Audio denoising is critical for enhancing intelligibility and fidelity of complex audio signals such as music, yet discriminative models (e.g., U-Net) suffer from limitations in generation quality and fine-grained reconstruction. This paper introduces the first generative music denoising framework built upon the neural Audio Codec (DAC), achieved by adapting the Descript Audio Codec architecture into an end-to-end differentiable denoising system. We propose a multi-objective loss function jointly optimizing time-domain fidelity, spectral consistency, and perceptual quality. The model is trained on a large-scale, custom-synthesized noisy–clean paired dataset. Experiments demonstrate that our method significantly outperforms state-of-the-art discriminative and generative baselines across objective metrics (STOI, ESTOI, PESQ) and subjective listening tests. To our knowledge, this is the first work to validate the effectiveness and superiority of neural audio codecs for high-fidelity generative audio restoration.

Technology Category

Machine Learning: Deep Generative Models & AutoencodersCognitive Modeling & Cognitive Systems: Neural Spike CodingComputer Vision: Generative Adversarial Networks (GANs) for Vision

Application Category

Economics, Online Markets and Human Computation: Economic ramifications for generative AI infrastructure and applicationsSearch and Retrieval-Augmented AI: Web learning to rank, online learning, and counterfactual learning for rankingUser Modeling, Personalization and Recommendation: On-Device user modeling, personalization, and recommendation
πŸ“ Abstract
Audio denoising is critical in signal processing, enhancing intelligibility and fidelity for applications like restoring musical recordings. This paper presents a proof-of-concept for adapting a state-of-the-art neural audio codec, the Descript Audio Codec (DAC), for music denoising. This work overcomes the limitations of traditional architectures like U-Nets by training the model on a large-scale, custom-synthesized dataset built from diverse sources. Training is guided by a multi objective loss function that combines time-domain, spectral, and signal-level fidelity metrics. Ultimately, this paper aims to present a PoC for high-fidelity, generative audio restoration.
Problem

Research questions and friction points this paper is trying to address.

Adapting neural audio codec for music denoising
Overcoming limitations of traditional denoising architectures
Achieving high-fidelity generative audio restoration
Innovation

Methods, ideas, or system contributions that make the work stand out.

Adapting neural audio codec for denoising
Training on large custom-synthesized dataset
Using multi-objective loss for fidelity metrics
πŸ”Ž Similar Papers
No similar papers found.
πŸ’Ό Related Jobs
No related jobs found.
D
Daniel Jimon
Technical University of Cluj-Napoca, Romania
M
Mircea Vaida
Technical University of Cluj-Napoca, Romania
A
Adriana Stan
Technical University of Cluj-Napoca, Romania