UniPolicy: Unified Objective-Specific Policies for Generative Search Advertising

📅 2026-09-17
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
针对搜索广告中多目标优化问题,提出UniPolicy框架,通过目标特定策略对齐和多阶段反馈增强生成分布,实现用户体验与商业价值平衡。
📝 Abstract
Search advertising connects user intent with commercial content and plays a critical role in platform monetization. Recent systems typically align pretrained generative models with a single business reward, such as eCPM, or use naive reward fusion for preliminary multi-objective alignment. However, an ideal search advertising system must jointly account for heterogeneous objectives, including relevance, click propensity, and commercial value, to balance user experience and business value while mitigating globally suboptimal performance caused by gradient competition. We propose UniPolicy, an objective-aware multi-policy alignment framework. UniPolicy combines objective-specific prefix tokens, sparse MoE-LoRA routing, and objective-specific residual FFNs to hierarchically decouple parameters within a shared backbone, providing differentiated parameter and policy-expression spaces for different business objectives. It further constructs pairwise preferences from multi-stage behavioral feedback, supplementing the relative preference information in exposed-but-unclicked samples and strengthening the relative advantage of clicked candidates in the generation distribution. At inference, UniPolicy supports parallel, business-customizable multi-policy beam search, flexibly allocating candidate quotas across objectives under a fixed retrieval budget. Large-scale offline experiments show that UniPolicy delivers balanced improvements across multiple metrics while preserving retrieval quality, outperforming single-objective reinforcement learning and naive reward-fusion baselines. In a 7-day online A/B test on a real search advertising system, UniPolicy improves CTR by 0.71%, RPS by 1.58%, and advertising revenue by 1.32%, while maintaining stable serving latency.
Problem

Research questions and friction points this paper is trying to address.

search advertising
heterogeneous objectives
user experience
business value
gradient competition
Innovation

Methods, ideas, or system contributions that make the work stand out.

UniPolicy
Objective-aware Multi-policy Alignment
Sparse MoE-LoRA Routing
Hierarchical Decoupling
Pairwise Preferences
🔎 Similar Papers
No similar papers found.
K
Kun Yao
Meituan, Beijing, China
Y
Yuhang Zhou
Meituan, Beijing, China
Y
Yichi Zhang
Meituan, Beijing, China
Z
Zeliang Tong
Meituan, Beijing, China
S
Shengri Xue
Meituan, Beijing, China
H
Haitao Wang
Meituan, Beijing, China
Siyu Lu
Siyu Lu
Department of Geography, Texas A&M University
Geo AIGIS/RSGeoSpatial AIGeoSpatial IntelligenceSpatial Dynamics
Q
Qianlong Xie
Meituan, Beijing, China
X
Xingxing Wang
Meituan, Beijing, China