Conditional Trajectory Peaks: Single-Pass Multimodal Policies over Action Chunks

📅 2026-10-05
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
This study addresses the inherent conflict between execution diversity and replanning consistency in multimodal imitation learning by proposing the CTP framework. This framework pioneers single-trajectory modeling, enabling efficient policy generation through the joint prediction of action chunk candidates, probabilities, and scales. Furthermore, it introduces Distribution-Aware Peak Specialization (DAPS) and Evidential Gated Belief Transfer (ETBT) mechanisms to simultaneously preserve multimodal behavioral expressiveness and ensure closed-loop consistency. Experimental evaluations demonstrate that the proposed method achieves a 97.25% success rate on the LIBERO benchmark while reducing real-world robot inference latency to 75.8 ms, significantly outperforming existing baselines.
📝 Abstract
Multimodal imitation learning requires diverse executable futures under the same observation and consistent behavior across replanning cycles. We present Conditional Trajectory Peaks (CTP), a single-pass policy framework that jointly predicts complete action-chunk candidates, probability masses, and trajectory scales. Distribution-Aware Peak Specialization (DAPS) specializes trajectory peaks using trajectory-level posterior responsibilities and mass- and scale-modulated overlap constraints. Evidence-Gated Trajectory Belief Transport (ETBT) maintains cross-chunk consistency through geometric correspondence between exchangeable candidate sets, while allowing current policy evidence to override historical constraints. CTP achieves a coverage score of 91.40% on Push-T; success rates of 100.0%, 79.72%, and 84.44% on D3IL Avoiding, Aligning, and Sorting-2, respectively. On LIBERO, CTP achieves an average success rate of 97.25%. In real-world dual-arm experiments, CTP preserves both placement modes in a two-plate task, succeeding in all 50 trials. On bottle uprighting and pen placement into a holder, it maintains success rates comparable to $\pi_{0.5}$ while reducing policy inference latency from 218.24 ms to 75.80 ms. These results demonstrate that single-pass trajectory modeling can combine multimodal behavior, closed-loop consistency, and efficient inference.
Problem

Research questions and friction points this paper is trying to address.

Multimodal Imitation Learning
Action Chunks
Closed-loop Consistency
Inference Latency
Innovation

Methods, ideas, or system contributions that make the work stand out.

Conditional Trajectory Peaks
Single-Pass Policy
Multimodal Imitation Learning
Action Chunks
Distribution-Aware Peak Specialization
🔎 Similar Papers
2024-10-04International Conference on Learning RepresentationsCitations: 0
💼 Related Jobs
No related jobs found.
D
Di Wu
Magiclab Robotics Technology Co., Ltd., China; Southeast University, Nanjing, China
R
Rongtian Shen
Magiclab Robotics Technology Co., Ltd., China
Ping Liu
Ping Liu
Assistant Professor, Krannert School of Management, Purdue University
Contract theoryGame theoryMacro financeReal OptionsDynamic and Empirical corporate finance
X
Xuhua Chen
Magiclab Robotics Technology Co., Ltd., China
H
He Zheng
Magiclab Robotics Technology Co., Ltd., China
Lingfeng Zhang
Lingfeng Zhang
PhD student at Tsinghua University
embodied ai
T
Tao Zhang
Magiclab Robotics Technology Co., Ltd., China