🤖 AI Summary
This study addresses the performance disparity in multilingual semantically equivalent queries caused by divergent reasoning trajectories. To this end, we propose mRewriter-R1, a framework that formulates query rewriting as a multi-turn sequential decision-making process and leverages agentic reinforcement learning to dynamically optimize semantic transformations. Moving beyond single-paradigm rewriting, the framework enables adaptive operator selection conditioned on query characteristics alongside multi-objective collaborative optimization. Extensive experiments demonstrate that our approach significantly outperforms existing baselines across diverse backbone models, exhibiting strong generalization capabilities and plug-and-play compatibility with heterogeneous architectures.
📝 Abstract
In multilingual scenarios, queries with equivalent semantics but in different languages could guide the model into different reasoning trajectories, leading to performance disparities. To mitigate this gap, previous studies typically apply a one-size-fits-all query rewriting strategy, such as translation, which overlooks the fact that different scenarios require diverse types of semantic transformations. In this paper, we propose mRewriter-R1, an agentic multilingual query rewriting framework with reinforcement learning. Unlike single-turn rewriting, mRewriter-R1 formulates multilingual query rewriting as a multi-turn sequential decision-making process, where the model dynamically performs multi-aspect optimization through adaptive operator selection. Experimental results demonstrate that mRewriter-R1 outperforms all strong multilingual rewriting baselines on different large reasoning backbones. Further analyses show that the learned policy can adaptively decide on rewriting operators according to query characteristics, exhibiting strong generalization ability across diverse reasoning tasks, and plug-and-play compatibility with heterogeneous reasoning language models.