分享自:

AIGB:基于扩散模型的生成式自动竞价

期刊:Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '24)DOI:10.1145/3637528.3671526

本文属于类型a,即单一原创研究的学术报告。以下为根据文档内容生成的综合报告:

本文所介绍的研究工作由来自北京大学与阿里巴巴集团的研究人员共同完成。论文的第一作者为jiayan guo,其工作于阿里巴巴集团实习期间完成;通讯作者为bo zheng。该项研究成果发表于第30届acm sigkdd知识发现与数据挖掘会议(kdd ‘24),会议于2024年8月25日至29日在西班牙巴塞罗那举行。论文标题为“aigb: generative auto-bidding via diffusion modeling”,其核心内容提出了一种全新的自动出价范式——aigb,并在此基础上设计并验证了基于条件扩散模型的自动出价方法diffbid。

自动出价在在线广告系统中扮演着至关重要的角色,它使得广告主无需人工干预即可对每一次曝光机会自动给出竞价。然而,在线广告环境具有高度随机性、回报稀疏、数据覆盖有限以及长时程规划等特点,使得传统的基于强化学习(reinforcement learning, rl)的自动出价方法面临严重挑战。现有的大多数rl自动出价方法基于马尔可夫决策过程(markovian decision process, mdp)建模,其核心假设是下一状态仅依赖于当前状态与动作。然而,本文通过对真实广告出价轨迹的统计分析发现,历史状态序列长度与下一出价状态之间的相关性显著增强,质疑了马尔可夫假设在自动出价任务中的适用性。基于这一观察,研究团队提出了基于生成式学习的全新出价范式aigb(ai-generated bidding),其核心思想是直接建模回报与整条出价轨迹之间的相关性,从而将自动出价转化为一个生成式序贯决策问题。

在方法层面,研究团队提出了diffbid模型。diffbid采用去噪扩散概率模型(denoising diffusion probabilistic models, ddpm)作为生成建模的基础框架。模型以前向扩散过程逐步向状态轨迹注入高斯噪声,破坏原始轨迹结构,随后通过参数化神经网络在给定回报和时序条件的引导下,从被噪声破坏的轨迹中逆向重建出目标状态序列。与常规的rl方法不同,diffbid并不依赖bellman方程进行时序差分学习,而是通过最大似然估计(maximum likelihood estimation, mle)条件生成模型来学习整条轨迹的联合分布。在生成过程中,模型使用分类器自由引导(classifier-free guidance)策略和低温采样方式,以提取数据集中与给定条件共现的高似然轨迹片段。为了从生成的状态轨迹中恢复出动作,diffbid采用了非马尔可夫的逆动力学模型(inverse dynamics model),该模型基于历史状态序列与预测的下一状态来推断当前时间步的最优出价参数。这种将状态轨迹优化与动作生成解耦的两阶段设计,有效增强了模型的可解释性和训练稳定性。

在训练流程上,diffbid同时优化噪声预测模型与逆动力学模型。对于每条出价轨迹,随机采样扩散步,构造含噪轨迹,并通过均方误差损失训练噪声模型逼近真实噪声。在条件设计上,本文提出了多种将工业指标转化为生成条件的方法:其一是回报归一化条件,将轨迹总价值映射至[0,1]区间,生成时以最大回报条件引导轨迹生成;其二是约束条件,例如判断最终cpc是否超出给定约束的二元变量,通过将该变量作为条件引入训练,使得生成轨迹能够满足广告主的多约束要求;其三是人工反馈条件,包括成本平滑度与早/晚花费比例等指标,这些条件使得diffbid可以灵活地根据广告主经验偏好调整出价轨迹。

在实验设置上,研究团队构建了一个模拟真实广告系统的离线环境ras,使用uscb方法在在线环境中生成出价日志,并加入随机探索数据以提升数据多样性。最终形成了三个训练数据集:uscb-5k、uscbex-5k和uscbex-50k。基线方法包括uscb、bcq、cql、iql和dt等五种代表性的在线与离线rl方法。评估预算规模设定为1500、2000、2500和3000四个档次,每种方法在每个预算下随机初始化50次,取前五名平均分作为评估指标。实验结果显示,diffbid在所有预算场景和所有数据集规模下均取得了最高的累积回报。在uscb-5k数据集上,diffbid相较于最强基线dt在3000预算下获得了1.03%的相对提升;在uscbex-50k大规模数据集上,diffbid在1500预算下的相对提升更达到了8.05%。此外,消融实验表明,移除条件信息或改用仅基于当前状态与预测下一状态的逆动力学模型,均会导致性能明显下降,从而验证了条件设计与非马尔可夫逆动力学建模对整体性能的重要贡献。

在进一步的分析实验中,研究者考察了状态转移、约束控制能力、扩散步数影响以及模型训练稳定性。状态转移分析显示,diffbid相较于uscb能够更有效地提升预算完成率,大多数广告主在diffbid策略下可以消耗超过80%的预算。约束控制实验表明,diffbid在控制cpc超标比例的同时,总体回报明显优于iql。对于人工反馈条件,diffbid生成轨迹的平滑度与早花费比例分布均能按条件进行有效控制。在扩散步数方面,小预算广告主对扩散步数更敏感,而大预算场景下30步以内即可取得较优结果。稳定性测试中,cql和iql在不同随机种子下表现出较大的性能波动,而diffbid则展现出显著更强的训练稳定性。

在线a/b测试方面,diffbid部署于阿里巴巴广告平台,并与性能最优的基线方法iql进行对比。测试于2024年2月1日至2月8日进行。结果显示,diffbid在成本基本持平的情况下,购买数量提升了2.09%,gmv提升了2.81%,roi提升了3.36%。在推理效率方面,diffbid在gpu加速下每请求耗时约为0.2秒,延迟控制良好。

在理论分析部分,论文证明了基于最大似然估计的diffbid模型等价于求解一个非马尔可夫决策问题。该结论表明,diffbid不依赖mdp假设,因此能够更好地应对广告环境中的高随机性与稀疏回报问题。这一理论结果为生成式建模在自动出价任务中的应用提供了坚实的数学基础。

该研究的突出价值体现在三个方面:其一,从统计与理论层面揭示了马尔可夫假设在长时程自动出价任务中的局限性,并提出以生成式模型替代传统rl建模的新思路;其二,提出的diffbid模型首次将条件扩散模型与逆动力学相结合,实现了广告出价参数的端到端生成,并具备多种约束与人工反馈条件的灵活组合能力;其三,通过大规模离线实验与在线a/b测试验证了方法的实际效果,显示出显著的gmv与roi提升,具有较强的工业落地潜力。总体而言,本研究为在线广告自动出价领域提供了一种全新的建模视角,具有重要的学术价值与应用前景。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com