JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

📅 2026-08-04
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
This work addresses the challenges of real-time open-domain video editing under strict computational constraints, where maintaining source fidelity, long-term temporal consistency, and causality—without access to future frames—is critical. The paper introduces the first streaming editing framework based on a 16-billion-parameter autoregressive diffusion model. It mitigates training-inference mismatch, source distortion, and temporal drift through chunk-wise autoregressive adaptation, Source-Anchored Distribution Matching Distillation (SA-DMD), and long-range autoregressive distillation. The method achieves end-to-end 720p video editing at approximately 30 FPS on a single NVIDIA B200 GPU, significantly outperforming existing streaming approaches in both automatic and human evaluations while matching the performance of powerful offline systems.
📝 Abstract
Real-time video editing requires low-latency causal generation with bounded computational resources while preserving source fidelity and long-term temporal consistency. We present JoyAI-Video-Edit, a 16B-parameter autoregressive diffusion framework for real-time, open-ended video editing without access to future frames or a predefined video duration. Our method combines chunk-wise autoregressive adaptation, Source-Anchored Distribution Matching Distillation (SA-DMD), and Long-Horizon Autoregressive Distillation to reduce train--inference mismatch, preserve source fidelity during two-step generation, and mitigate accumulated temporal drift. Extensive automatic and human evaluations show that JoyAI-Video-Edit substantially outperforms existing streaming editors and remains competitive with strong offline systems on both short and long videos. The complete system achieves end-to-end 720p video editing at approximately 30 FPS on a single Nvidia B200 GPU. Code is available at https://github.com/jd-opensource/JoyAI-Video-Edit.
Problem

Research questions and friction points this paper is trying to address.

real-time video editing
temporal consistency
source fidelity
open-ended editing
low-latency generation
Innovation

Methods, ideas, or system contributions that make the work stand out.

autoregressive diffusion
real-time video editing
temporal consistency
distribution matching distillation
streaming video generation
🔎 Similar Papers
No similar papers found.
Yicheng Xiao
Yicheng Xiao
Tsinghua University
Artificial IntelligenceMultimodal Learning
W
Wenxun Dai
Joy Future Academy, JD
X
Xinran Qin
Joy Future Academy, JD
L
Lin Song
Joy Future Academy, JD
M
Maoquan Zhang
Joy Future Academy, JD
H
Hang Xu
Joy Future Academy, JD
Yukang Chen
Yukang Chen
Research Scientist, NVIDIA
Large Language ModelsEfficient Deep LearningLong AI
Y
Yitong Li
Joy Future Academy, JD
Guohui Zhang
Guohui Zhang
Professor of Civil Engineering, University of Hawaii
Traffic EngineeringITSTraffic DetectionTraffic System ModelingSimulation
Y
Yuan Zhang
Joy Future Academy, JD
X
Xuying Zhang
Joy Future Academy, JD
T
Tommy Zhang
Joy Future Academy, JD
J
Jianlong Yuan
Joy Future Academy, JD
Peihao Li
Peihao Li
Tsinghua University; Tongyi Lab, Alibaba
3D reconstructiongenerative modelhuman avatar
S
Shuai Lu
Joy Future Academy, JD
Siming Fu
Siming Fu
Zhejiang University
LLM,Long-tailed learningMulti-modal
C
Chuyang Zhao
Joy Future Academy, JD
X
Xin Han
Joy Future Academy, JD
J
Jie Huang
Joy Future Academy, JD
Wenbo Li
Wenbo Li
The Chinese University of Hong Kong
Computer VisionDeep Learning
G
Guoqing Ma
Joy Future Academy, JD
W
Wei Huang
Joy Future Academy, JD
Xiaojuan Qi
Xiaojuan Qi
Assistant Professor, The University of Hong Kong
3D VisionDeep learningArtificial IntelligenceMedical Image Analysis
Haoyang Huang
Haoyang Huang
JD Explore Academy (present) | StepFun | Microsoft Research
Multimodal & Multilingual Foundation Model
Nan Duan
Nan Duan
JD.Com (now) | StepFun | Microsoft Research
NLPArtificial General Intelligence