Scholar
Yu Luo
Google Scholar ID: KQjoQOMAAAAJ
Huawei Noah's Ark Lab
Reinforcement Learning
LLM for Reasoning
Model Predictive Control
Robotic Control
Follow
Google Scholar
↗
Citations & Impact
All-time
Citations
330
H-index
9
i10-index
9
Publications
20
Co-authors
7
list available
Publications
6 items
Ratio-Variance Regularized Policy Optimization
2026
Cited
0
When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling
2026
Cited
0
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
2026
Cited
0
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
2026
Cited
0
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
2026
Cited
0
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
arXiv.org · 2026
Cited
0
Co-authors
4 total
Huazhe Xu
Tsinghua University
Xianyuan Zhan
Associate Professor, Institute for AI Industry Research (AIR), Tsinghua University
Wenbing Huang
Associate Professor, Renmin University of China
Huaping Liu(刘华平)
Department of Computer Science and Technology, Tsinghua University