本文的研究由多位来自不同机构的学者共同完成,主要作者包括 Yewen Li(南洋理工大学)、Shuai Mao(香港中文大学)、Jingtong Gao(香港城市大学)、Nan Jiang(快手科技)、Yunjian Xu(香港中文大学)、Qingpeng Cai(快手科技)、Fei Pan(快手科技)、Peng Jiang(快手科技)以及 Bo An(南洋理工大学)。该研究发表于 WWW Companion ’25(The ACM Web Conference 2025 Companion Proceedings),会议于2025年4月28日至5月2日在澳大利亚悉尼举行。论文标题为《GAS: Generative Auto-bidding with Post-training Search》。该研究聚焦于在线广告领域的自动竞价(auto-bidding)问题,提出了一种基于训练后搜索(post-training search)的生成式自动竞价方案,旨在解决生成式模型在自动竞价中面临的数据质量与偏好对齐挑战。
自动竞价是在线广告系统中至关重要的技术,它能够代表广告主自动提交出价,从而在预算和关键绩效指标(KPI)约束下优化广告投放效果。传统的强化学习(reinforcement learning, RL)方法通常基于马尔可夫决策过程(Markovian Decision Process, MDP)假设,但近期研究表明,广告环境中的状态转移往往依赖于更长的历史序列,这使得单纯依赖当前状态的MDP方法容易出现不稳定性。此外,RL策略一旦部署,其偏好往往固定,难以灵活适应不同广告主的需求变化。生成式自动竞价方法近年来逐渐兴起,其代表性模型包括决策Transformer(Decision Transformer, DT)和扩散模型(diffuser)等。这类方法能够以可调节的条件向量表示广告主偏好,并据此直接生成出价动作或完整轨迹,从而避免了MDP假设的限制。然而,生成式模型在实际应用中面临两大挑战:第一,训练数据中的条件(如return-to-go)可能无法准确反映动作的真实价值,导致学习到的策略难以达到最优;第二,生成式模型往往偏向模仿数据集中多数广告主的偏好,难以泛化到少数或新的偏好场景,而针对不同偏好重新训练多个大型模型成本过高。
为了应对上述挑战,本文提出了GAS(Generative Auto-bidding with Post-training Search)框架。该框架的核心思想是采用弱到强(weak-to-strong)的搜索对齐策略,即利用小型评论家网络(critics)来评估不同偏好下的动作价值,并通过受蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)启发的搜索过程对基础策略模型的输出进行细化。GAS框架包含三个主要阶段:选择(selection)、扩展与模拟(expansion and simulation)以及反向传播(backpropagation)。在选择阶段,首先由决策Transformer生成一个基础动作,然后通过在该动作上乘以一个在90%到110%之间均匀分布的随机扰动因子,生成多个候选动作。在扩展与模拟阶段,由于实际竞价环境无法进行真实的rollout模拟,本文提出使用Transformer-based Q-value网络(QT)来近似估计每个候选动作在给定状态下的长期回报。为了提高Q值估计的准确性,QT网络利用了历史轨迹信息作为策略表示,从而缓解了策略分布偏移问题。在反向传播阶段,为了缓解Q值函数常见的过估计问题,本文提出了一种称为Q-voting的投票机制。该机制通过独立训练多个QT网络,对每个候选动作的Q值进行min-max归一化后求和投票,从而选择出在多个评论家网络中达成共识的最优动作。
在应用层面,GAS提供了两种使用范式:一种是在测试时进行搜索(GAS-infer),即在每个时间步通过搜索过程细化基础动作;另一种是利用搜索进行微调(GAS-sft),即利用搜索找到的更优动作对基础策略模型进行监督微调(supervised fine-tuning, SFT)。在实验部分,研究团队使用了阿里巴巴发布的大规模真实竞价数据集AuctionNet及其稀疏版本AuctionNet-sparse,并在多种预算设置下与多个基线方法进行了对比实验。实验结果表明,GAS-infer和GAS-sft在所有预算设置下均取得了最高的综合得分(score),相较于基础策略模型DT-score有显著提升,例如在AuctionNet数据集100%预算设置下,GAS-infer相较DT-score提升了7.48%。在偏好对齐实验中,GAS-infer和GAS-sft在score-first、value-first和er-first三种不同偏好下均表现出更好的对齐性能,验证了搜索方法能够有效适应不同偏好。消融实验进一步分析了搜索范围、评论家网络数量和搜索预算对性能的影响,结果表明三个评论家网络和五个搜索动作即可达到较好的性能,同时10%的搜索范围能够提供最佳效果。此外,QT网络的有效性实验表明,利用历史轨迹信息作为策略表示的QT网络显著优于仅使用状态-动作对的传统Q值函数。
在线A/B测试在快手广告平台上进行了六天,实验设置将25%的预算和流量分配给基线模型和GAS方法。结果显示,GAS在展示量(impression)、消耗(cost)、目标成本(target cost)和整体ROI方面分别提升了1.65%、0.94%、4.60%和3.62%,所有指标均表现出显著改善。这一结果表明GAS方法在真实广告环境中具有良好的应用价值。
本研究的核心贡献在于提出了一种灵活且实用的生成式自动竞价框架,通过训练后搜索方法实现了对单一基础策略模型的多偏好适配,避免了为不同偏好重新训练大型模型的成本。该方法利用Transformer-based评论家网络和Q-voting机制提高了价值估计的准确性,并通过在测试时搜索或微调两种范式实现了对基础模型的优化。研究结果不仅在多个数据集和预算设置下验证了GAS的优越性,还通过在线A/B测试证明了其在实际广告平台上的有效性。该研究的亮点包括:提出了基于弱到强搜索对齐的生成式自动竞价方案,解锁了自动竞价基础模型的应用潜力;设计了基于历史轨迹感知的QT网络和Q-voting投票机制,提高了搜索过程中的价值估计精度;提供了测试时搜索和微调两种应用范式,兼顾了性能和计算效率的平衡。
尽管GAS框架在实验中表现优异,但研究也存在一些局限性。例如,MCTS过程中的扩展与模拟步骤被简化近似,可能无法完全捕捉真实竞价场景的复杂性;此外,GAS-sft的性能虽然优于基线,但仍不及GAS-infer,表明微调方法仍有进一步改进的空间。未来的研究可以探索更先进的偏好对齐方法,如直接偏好优化(direct preference optimization, DPO)或基于人类反馈的强化学习(reinforcement learning from human feedback, RLHF),以进一步提升微调范式的性能。总体而言,GAS框架为生成式自动竞价领域提供了一种新的技术路径,具有重要的学术价值和应用前景。