Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes

📅 2026-09-22
📈 Citations: 0
✨ Influential: 0
📄 PDF
🤖 AI Summary
为了解决视觉语言模型在空间度量推理中的局限性,研究引入了Metric-Bench基准和MetricReasoner方法,通过上下文信息和强化学习提高模型的2D到3D映射能力。
📝 Abstract
Metric reasoning is a critical and challenging task for Vision Language Models (VLMs), playing a pivotal role in embodied AI tasks such as robotic manipulation and autonomous navigation. However, current spatial reasoning remains bottlenecked by rigid pixel-level supervision; such localized optimization often compromises general multimodal intelligence, triggering performance degradation or catastrophic forgetting of broad reasoning capabilities. To address these limitations, we introduce Metric-Bench, a focused benchmark designed to guide metric-spatial reasoning using contextual information. By incorporating in-image reference objects with known physical dimensions, Metric-Bench guides models to implicitly learn the 2D-to-3D mapping without camera intrinsics. We further present MetricReasoner, a task-adapted reinforcement fine-tuning recipe for reference-grounded metric reasoning, using structured prompts and verifiable numerical rewards. Extensive experiments on Metric-Bench demonstrate that our approach significantly enhances spatial metric understanding, outperforming existing and even larger proprietary models by 43.1\%, while improving downstream embodied performance over a spatial-specialized counterpart by 30.4\% on RoboSpatial overall accuracy and 9.3\% on ERQA, and additionally delivering consistent gains on general benchmarks (15.9\% on V$\star$Bench, 88.9\% on BLINK), indicating that the proposed adaptation does not necessarily compromise general VLM capabilities.
Problem

Research questions and friction points this paper is trying to address.

Metric Reasoning
Vision Language Models
Spatial Reasoning
Embodied AI
Innovation

Methods, ideas, or system contributions that make the work stand out.

Metric-Bench
In-context Spatial Metric Reasoning
2D-to-3D Mapping
MetricReasoner
Reinforcement Fine-tuning
🔎 Similar Papers
No similar papers found.
💼 Related Jobs
No related jobs found.
Y
Yuling Xi
State Key Lab of CAD & CG, Zhejiang University, China
H
Haokai Zhang
State Key Lab of CAD & CG, Zhejiang University, China
Muzhi Zhu
Muzhi Zhu
Zhejiang University
Computer VisionMachine Learning
Hao Zhong
Hao Zhong
Professor, Shanghai Jiao Tong University
Software Engineering
Z
Zongze Du
State Key Lab of CAD & CG, Zhejiang University, China
H
Hengyu Zhao
State Key Lab of CAD & CG, Zhejiang University, China
C
Chenchen Jing
Zhejiang University of Technology
Y
Yufei Yin
Hangzhou Dianzi University, China
Bin Qin
Bin Qin
Institute of Software Chinese Academy of Sciences
Machine LearningCausal Inference
Y
Yongjie Yang
Xiaomi Corporation, China
Zhenbo Luo
Zhenbo Luo
XiaoMi
Vision Language ModelComputer Vision
Hao Chen
Hao Chen
Zhejiang University
Computer Science
Chunhua Shen
Chunhua Shen
Zhejiang University
Computer VisionMachine Learning