Scholar
Rong Bao
Google Scholar ID: teGqP3kAAAAJ
PhD student, Fudan University
Alignment
Generative AI
Reinforcement Learning
Follow
Google Scholar
↗
Citations & Impact
All-time
Citations
344
H-index
7
i10-index
5
Publications
12
Co-authors
0
Publications
4 items
OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses
2026
Cited
0
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
Cited
0
Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
2025
Cited
0
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
arXiv.org · 2024
Cited
7