SimpleTouch: Can Vision-Language-Action Models Master Contact-Rich Manipulation Without Tactile Policy Pretraining?
This study addresses the data and computational bottlenecks arising from integrating tactile sensing into large-scale pretraining for Vision-Language-Action (VLA) models by proposing SimpleTouch. Built upon the π0.5 architecture, this method eliminates complex multi-stage alignment pipelines by freezing the tactile encoder and incorporating multi-horizon latent action prediction, enabling contact-rich manipulation through single-stage action-supervised fine-tuning. Experimental results demonstrate that SimpleTouch achieves an average success rate of 77.5% on the UniVTAC benchmark using only 50 demonstrations—outperforming FTP-π0.5 by 32.3%—and attains a 71.3% success rate in real-world tasks. These findings significantly surpass existing baselines, validating the efficiency of directly fine-tuning pretrained representations for tactile-dependent robotic manipulation without extensive retraining.