Scholar
Zhenbo Luo
Google Scholar ID: Sh6y-_EAAAAJ
XiaoMi
Vision Language Model
Computer Vision
Follow
Google Scholar
↗
Citations & Impact
All-time
Citations
3,360
H-index
16
i10-index
20
Publications
20
Co-authors
13
list available
Publications
39 items
Towards Omni-dimensional GUI Agent Navigation with Masked Trajectory Prediction
2026
Cited
0
Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes
2026
Cited
0
DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents
2026
Cited
0
Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
2026
Cited
0
When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
2026
Cited
0
DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models
2026
Cited
0
UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation
2026
Cited
0
ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval
2026
Cited
0
Load more
Co-authors
8 total
Pei Fu (付培)
Xiaomi
Zengchang Qin
Beihang University
Fei Yin
NLPR, CASIA
Cheng-Lin Liu
Institute of Automation, Chinese Academy of Sciences
Jingdong Wang (王井东), Fellow of CAE & IEEE & IAPR
Baidu
Chunhua Shen
Zhejiang University
Rui Wu
Horizon Robotics
Yunhong Wang
Professor, School of Computer Science and Engineering, Beihang University