CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies

📅 2026-09-21
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决机器人操作中偏离预定轨迹的问题,CARE框架通过从执行失败中学习并生成修正演示来改进恢复策略。
📝 Abstract
Vision-Language-Action (VLA) policies achieve strong performance in robotic manipulation but remain brittle once execution deviates from nominal trajectories. We propose CARE (Corrective Atomic Robotic Execution), a framework that improves recovery by learning from failures encountered during execution. Instead of generating corrective data from manually designed or random perturbations, CARE collects failed rollouts, models stage-conditioned post-failure deviations, and uses the resulting empirical distributions to synthesize representative failure states and corrective demonstrations. At inference time, CARE combines stage-wise planning with physically grounded 3D monitoring to trigger atomic adjustments or re-operations while preserving task progress. We further introduce the Failure State Recovery Benchmark (FSR-Bench), which evaluates recovery from intermediate failure states under local deviations and structural anomalies. Experiments across multiple VLA backbones, simulation benchmarks, and real-world dual-arm tasks show consistent improvements, with average task-success gains of 14.5 points in simulation and 15.9 points in the real world. Code, models, and data are available at https://github.com/xiaojunlan/care
Problem

Research questions and friction points this paper is trying to address.

Vision-Language-Action
robotic manipulation
failure recovery
execution deviation
Innovation

Methods, ideas, or system contributions that make the work stand out.

Corrective Atomic Robotic Execution
Failure State Recovery
Stage-Conditioned Deviations
Physically Grounded 3D Monitoring
💼 Related Jobs
No related jobs found.
J
Junlan Xiao
Dalian University of Technology, Dalian, China
J
Junwei Jiang
Dalian University of Technology, Dalian, China
Zaibin Zhang
Zaibin Zhang
Dalian University of Technology
LLMsMulti-agent SystemMulti-modal Agent
Yifan Wang
Yifan Wang
Dalian University of Technology
Video & Image SegmentationImage Processing
Z
Zhongbo Zhang
Dalian University of Technology, Dalian, China
H
Huchuan Lu
Dalian University of Technology, Dalian, China
Lijun Wang
Lijun Wang
Zhejiang University
Statistical LearningBioinformaticsAstrophysics