Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

📅 2026-09-28
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
This study addresses the temporal-semantic inconsistencies arising from the isolated processing of audio and video in existing models by proposing a unified probabilistic framework that formulates joint generation, cross-modal generation, and editing as three subproblems under a single distribution. Building upon this framework, we construct a five-axis taxonomy that systematically organizes joint audio-visual editing tasks for the first time, mapping nine editing paradigms encompassing twenty-eight distinct types. By integrating multimodal fusion techniques with standardized evaluation protocols, this work identifies optimal methods, datasets, and metrics for various scenarios. Furthermore, it distills the most impactful open problems in the field, providing a comprehensive roadmap for future research in unified audio-visual editing.
📝 Abstract
Video and audio are perceived together, yet most generative models treat them in isolation. We examine methods that model the two modalities jointly, generate one from the other, or edit them in a coupled manner, organized around a single question: how is the output kept coherent across modalities in time and semantics? A unified formulation casts joint generation, cross-modal generation, and joint editing as three problems defined on a single distribution over audio-visual pairs, and a taxonomy compares methods along five design axes. To our knowledge, this is the first overview to systematically taxonomize joint audio-visual editing, which we map as nine edit categories spanning 28 edit types. We describe methods, datasets, and metrics for each setting and close with the open problems we view as most consequential.
Problem

Research questions and friction points this paper is trying to address.

video-audio generation
cross-modal generation
joint editing
audio-visual coherence
generative models
Innovation

Methods, ideas, or system contributions that make the work stand out.

Joint Audio-Visual Generation
Cross-Modal Generation
Unified Formulation
Design Taxonomy
Audio-Visual Editing
💼 Related Jobs
No related jobs found.
A
Abhinav Sharma
University of Massachusetts Amherst
S
Sai Karthik Navuluru
University of Texas at Dallas
Wang Wei
Wang Wei
Virginia Tech
D
Daksh Dangi
University of Massachusetts Amherst
Xiangbo Gao
Xiangbo Gao
Texas A&M University
collaborative autonomous drivingmulti-agent systemcomputer vision
Li Li
Li Li
Pennsylvania State University; Southern University of Science and Technology
Materials ScienceDielectricsFerroelectricsPolymers and composites
Bo Ni
Bo Ni
Vanderbilt University
Machine LearningGraph Machine LearningNatural Language Processing
Vardhan Dongre
Vardhan Dongre
Adobe Research Intern, PhD student @ UIUC
LLMConversational AIEmbodied AIMultimodal Reasoning
Junda Wu
Junda Wu
University of California San Diego
Natural Language ProcessingRecommender SystemMultimodal LearningReinforcement Learning
Xiyang Hu
Xiyang Hu
PhD, Carnegie Mellon University
Machine LearningTrustworthyHuman-AIGenerative AIOut of Distribution
Jiuxiang Gu
Jiuxiang Gu
Adobe Research
Computer VisionNatural Language ProcessingMachine Learning
Seunghyun Yoon
Seunghyun Yoon
Assistant Professor, Korea Institute of Energy Technology (KENTECH)
Reinforcement LearningDeep LearningData ScienceNetworkingCyber Security
Tong Yu
Tong Yu
Adobe Research
C
Chien Van Nguyen
University of Oregon
M
Mohamed Elmoghany
Stanford University
Nedim Lipka
Nedim Lipka
Adobe Systems Inc
Big Data AnalyticsMachine LearningWeb MiningOnline Advertisement
Hoda Eldardiry
Hoda Eldardiry
Associate Professor of Computer Science, Virginia Tech
Machine Learning
H
Hongjie Chen
Dolby Laboratories
T
Tyler Derr
Vanderbilt University
Thien Huu Nguyen
Thien Huu Nguyen
University of Oregon
Information ExtractionDeep LearningNatural Language ProcessingMachine Learning
Zhengzhong Tu
Zhengzhong Tu
Texas A&M University, Google Research, University of Texas at Austin
Agentic AITrustworthy AIEmbodied AI
Nesreen K. Ahmed
Nesreen K. Ahmed
Senior Principal Scientist, Cisco AI Research, Intel Labs, Purdue University
Geometric Deep LearningGraph Representation LearningML for SystemsML4code
Franck Dernoncourt
Franck Dernoncourt
NLP/ML Researcher. MIT PhD.
Machine LearningNeural NetworksNatural Language Processing
Ryan A. Rossi
Ryan A. Rossi
Adobe Research
Machine LearningPersonalizationGraph Representation LearningGraph MLGraph Theory