本文提出并验证了一种用于推荐系统的自进化(self-evolving)端到端自主模型优化框架,核心贡献在于利用大语言模型(Large Language Model,LLM)智能体(agent)代替传统的人工机器学习工程师(Machine Learning Engineer,MLE),在 YouTube 实际生产环境中完成从假设生成、代码实现、离线评估到在线 A/B 实验的完整模型优化闭环。论文作者为 Haochen Wang、Yi Wu、Daryl Chang、Li Wei 与 Lukasz Heldt,均来自 Google Inc,研究发表于 RecSys ’26(The 20th ACM Conference on Recommender Systems)。
从学术背景来看,该研究处于推荐系统、强化学习(Reinforcement Learning,RL)与自动化机器学习(Automated Machine Learning,AutoML)的交叉领域。现代工业级推荐系统越来越被形式化为强化学习问题,其目标不再只是预测点击率,而是优化长期用户满意度。然而,训练时使用的可微分代理损失函数与真实业务指标之间存在系统性偏差:真实用户满意度往往具有不可微分、延迟、稀疏和语义复杂等特点。传统 AutoML 方法只能在固定搜索空间内调节数值超参数,缺乏提出新奖励逻辑、重构模型架构或解释历史实验结果的推理能力。因此,本文的研究目标是在工业规模系统中建立一套由 LLM 驱动的自主进化机制,使智能体能够像专家 MLE 一样进行结构性与语义层面的创新。
该研究的方法核心是一套双层智能体系统,围绕一个名为“实验日志”(experiment journal)的共享持久知识库构建。该系统将发现过程解耦为两个同步的推理环路。离线智能体(offline agent)构成快环路,每天运行一次但每 5 分钟唤醒一次,负责高频候选生成。它利用专门化的推理人格(persona)对模型配置空间进行探索,具体包括优化器人格(optimizer persona)、架构人格(architecture persona)和奖励人格(reward persona)。优化器人格负责搜索优化算法及其内部超参数,使用 compute_loss 工具以验证损失作为可比指标。架构人格关注神经网络拓扑结构,能够编写新代码,例如提出门控路径(gated path)结构或引入层归一化(layer normalization)。奖励人格则执行多步推理:首先通过 run_sql_query 工具对海量用户日志进行开放式数据分析,发现诸如“被分享视频具有更高观看时长”之类的假设,然后利用 compute_eval 工具计算与长期用户行为高度相关但独立于训练损失的代理指标,如长观看相关性(long-watch correlation)。在线智能体(online agent)构成慢环路,每天运行一次,负责从候选池中排序并选择最有潜力的配置进入线上实验,同时管理实验生命周期,包括选择、模型训练、线上实验、指标合成和资源清理五个阶段。所有智能体共享一个提示模板,其中注入具体任务、历史实验日志和少样本示例(few-shot examples)。
在部署与结果方面,该研究在 YouTube 多个关键业务面上进行了系统性验证。第一阶段是离线验证,主要针对优化器与架构组件,目标是最小化训练损失。离线智能体自主发现将传统 Adagrad 优化器替换为 RMSprop 后,在离线损失和线上流量指标上都带来统计显著提升。在训练效率方面,智能体通过调整批大小(batch size)、训练轮数(epoch)与优化器超参数,将训练延迟先降低 4 倍,再降低 2 倍,总计提升 8 倍且未牺牲业务指标。架构层面,智能体提出类似门控线性单元(Gated Linear Unit,GLU)的门控路径结构,并在后续迭代中进一步将标准 sigmoid 门替换为 GELU 激活函数并加入层归一化,展示了探索与利用相结合的结构创新能力。第二阶段是在线 A/B 实验,主要针对奖励组件。奖励人格通过多目标奖励合成,将用户是否在站内进行主动交互的新信号纳入训练标签,显著优于人工设计的基线奖励函数。此外,智能体在仅依赖在线慢环路的条件下,成功在两周内调优了四个奖励超参数,而此前人工团队数月的尝试未能同时提升 YouTube 级与业务面级指标。
在消融实验中,研究比较了不同 LLM 模型、人格设定与上下文管理策略对优化器组件离线损失的影响。结果显示,使用 Gemini 2.5 Pro 的基线配置在所有变体中表现最佳,而使用 Gemini 2.5 Flash 的配置则显著劣化,说明更大规模且具备高级推理能力的模型对算法发现有重要增益。去除专家 MLE 人格框架或使用按时间戳排序而非按损失排序的历史信息,均会导致性能下降。限制历史记录为仅前 1 条或完全不提供历史上下文时,智能体倾向于提出教科书式的通用改进,无法进行有效迭代发现。
该研究的主要贡献可以从四个层面加以总结。第一,提出了面向工业级推荐系统的自主 MLE 框架,使专门化 LLM 智能体能够完整管理从假设生成到线上实验的全生命周期。第二,证明了 LLM 智能体能够进行超越数值调参的语义发现,包括新颖架构组件和面向长期用户满意度的多目标奖励函数。第三,显著提升了实验吞吐量:传统人工工作流每周可完成 θ(1)–θ(10) 次实验,而智能体工作流可完成 θ(100) 次实验,每个实验的工程成本降为零小时。第四,框架具备跨推荐业务面的泛化能力,在特征模式、训练数据和模型配置完全不同的另一个 YouTube 业务面上仍能快速适应并提升北极星指标。
从应用价值来看,该系统在六个月内产生的 LLM token 费用约为 20,000 美元,仅占一名全职 MLE 成本的极小比例。更重要的是,该方法将“从想法到数据”的周期显著缩短,使得团队能够探索人工工程师因带宽限制而无法覆盖的配置空间长尾。研究还总结出若干关键经验:基于差异(delta)的配置生成比完整配置文件生成更可靠,且能显著降低上下文长度;必须在提示中显式平衡探索、利用与创新,否则智能体会退化为保守的微小超参数调整;实验日志的密度是提名优质配置的基础,需要热启动(warm start)来引导推理;在成熟系统中,结构性突变和语义创新带来的杠杆效应远高于纯数值调节。
总体而言,这项研究展示了 LLM 智能体在工业级推荐系统模型优化中的可行性与优越性。它不仅在多个线上业务指标上超过了人工设计的基线,还将实验速度提升了一个数量级。该工作为推荐系统工程提供了一种新的范式,即将人类 MLE 的认知带宽从重复性代码生成、编译和实验编排中解放出来,转而专注于战略约束、伦理边界和长期技术愿景的定义。该研究还表明,这种自进化框架优化的并非某个特定数据集上的结果,而是发现过程本身,这对更广泛的推荐系统家族具有重要的推广意义。