分享自:

R3:基于强化学习的端到端推理规划用于多步逆合成

期刊:Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

关于R3框架的学术报告:基于强化学习的端到端生成式推理用于多步逆合成规划

第一作者与发表信息

本研究的主要作者为Yifei Wang(王逸飞)、Qizhi Pei(裴启智)、Jiangtao Feng(冯江涛)等,通讯作者为Lijun Wu(吴俪军)和Hao Zhou(周浩)。研究团队来自清华大学人工智能产业研究院(Institute for AI Industry Research, Tsinghua University)、上海人工智能实验室(Shanghai Artificial Intelligence Laboratory)以及中国人民大学高瓴人工智能学院(Gaoling School of Artificial Intelligence, Renmin University of China)。该论文发表于第64届计算语言学协会年会(Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, Volume 1: Long Papers),会议时间为2026年7月2日至7日,论文页码为37618至37632。

学术背景与研究目的

逆合成分析(retrosynthesis)是有机化学和药物发现领域的核心策略之一,其目标是将复杂的靶标分子系统性地分解为更简单的、商业可得的起始原料(building blocks, 构建砌块)。该任务通常分为两个层级:单步逆合成(single-step retrosynthesis)旨在为给定靶标分子找到一组能够通过一步化学反应生成它的直接反应物;而多步逆合成规划(multi-step retrosynthetic planning)则试图找到一条完整的、顺序化的反应路径,将靶标分子递归地转化为一组商业可得的起始原料。传统的人工智能驱动方法通常将多步规划建模为启发式搜索问题,例如蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)或A*搜索,并通过增强单步模型的预测精度或训练价值网络来引导搜索。然而,这些搜索中心范式往往存在计算开销大、可解释性差等“黑箱”问题,且其性能受限于单步模型的精度上限。近年来,大语言模型(Large Language Models, LLMs)在复杂推理任务中展现出卓越能力,但在逆合成领域的应用多局限于单步任务或需与搜索算法集成,未能充分发挥LLM的生成式推理潜力。

针对上述问题,本研究提出了一种名为R3(Reinforced Reasoning Retrosynthesis,强化推理逆合成)的新型框架,旨在将多步逆合成规划从“搜索”范式转变为“生成式推理”范式。R3通过模拟化学家的问题解决逻辑,端到端地直接生成完整的合成路径,从而摆脱了对搜索树遍历的依赖。

研究方法的详细工作流程

R3的训练流程由三个阶段构成,其基础模型为Qwen3-8B-base。

第一阶段:领域知识注入的持续预训练(Continual Pretraining, CPT)

该阶段旨在为模型建立化学领域的基础知识和表征对齐能力,分两步进行。第一步的目标是注入通用生物分子与科学知识。训练语料来自PubChem、PubMed、bioRxiv以及FineFineWeb的生物学与化学子集,同时引入了FineWeb-Edu的通用数据以保持模型的通用能力。此步骤采用标准的无监督预训练目标,在整个文本序列上计算损失。第二步则专门用于增强逆合成领域的特定知识以及分子表示的对齐。研究团队利用了来自开放反应数据库(Open Reaction Database, ORD)和美国专利商标局(USPTO)的大量化学反应数据,并整合了IUPAC名称与SMILES(Simplified Molecular Input Line Entry System,简化分子线性输入规范)字符串之间的双向翻译任务。这种表征对齐对于后续推理过程至关重要,因为模型在文本链式思维(Chain-of-Thought, CoT)中经常需要通过IUPAC名称来引用分子片段和官能团。该阶段的训练损失仅计算在输出token上。

第二阶段:结构化链式思维蒸馏(Structural CoT Distillation, SFT)

多步逆合成本质上要求模型在推理过程中维持并导航一颗复杂的搜索树。然而,自由生成的长链式思维往往冗长且缺乏结构,不利于模型学习底层的化学逻辑。为此,R3引入了结构化推理协议,将推理轨迹定义为一个步骤序列,每一步被建模为一个五元组,包括转化(transformation)、反应类型(reaction type)、关键断键(key disconnection)、策略依据(strategic rationale)和可用性检查(availability check)。推理数据的构建则利用了RetroBench的训练集,并通过Retro*算法扩充了多样化的有效路径。研究团队以Intern-S1作为教师模型(teacher model),在蒸馏阶段向教师模型提供真实路径以生成高质量的推理轨迹;而在学生模型(student model)的SFT阶段,提示仅包含靶标分子,确保模型学会无答案条件下的自主规划。SFT的损失函数为负对数似然。

第三阶段:端到端强化学习(Reinforcement Learning, RL)

在SFT的基础上,R3采用群体序列策略优化(Group Sequence Policy Optimization, GSPO)算法进行端到端的策略优化。GSPO是GRPO的一种变体,其奖励函数为二元结果监督(outcome-supervised)形式:只有当生成路线中所有中间产物的SMILES均化学有效,且叶子节点集合与真实起始原料的InChIKey完全匹配时,奖励才为1,否则为0。GSPO的目标函数利用基于群体的标准化优势(advantage)和序列级重要性比率(importance ratio),以稳定训练过程。

主要实验结果与数据支撑

在RetroBench基准上,R3取得了43.7%的top-1准确率,达到了最先进水平(state-of-the-art, SOTA),显著超越了最强的搜索基线RetroInText(42.1%)和融合方法FusionRetro(37.5%)。在top-k指标上,R3同样全面领先,top-2为50.4%,top-5达到58.7%。这一显著的top-k增益证明了R3的测试时扩展(test-time scaling)能力:通过增加推理时的采样预算,模型能够有效解决更多复杂问题。此外,通用LLM基线如GPT-5和Gemini-3-Pro的准确率极低(低于7%),表明仅凭通用推理能力而缺乏专门的化学知识注入与对齐,无法解决复杂的逆合成逻辑。

在不同路线深度(2至8)的分析中,R3几乎在所有深度上均优于所有基线。尤其在深度为8时,R3仍能保持超过41%的准确率,而FusionRetro则大幅下降至约14%。这表明生成式推理范式能有效捕捉全局结构依赖,避免了搜索算法中常见的误差传播问题。

在计算效率方面,R3生成5个样本的平均吞吐量为3.44分子/秒,相比FusionRetro+Retro*(0.028分子/秒)实现了120倍的加速。这是因为R3在单次自回归生成中直接输出完整路线,GPU利用率可维持在90%以上;而搜索算法因迭代遍历组合树且受CPU-GPU通信瓶颈影响,GPU利用率仅约35%。推理扩展效率图进一步显示,R3在计算预算与性能之间建立了更优的帕累托前沿(Pareto frontier):当采样预算增加至k=100时,覆盖率提升至69.7%,总延迟约5.7秒/分子,仍远低于搜索基线。

消融实验揭示了三个训练阶段的协同依赖关系。基础模型Qwen3-8B-base的准确率为0.0%,表明其完全无法解决逆合成任务。仅进行SFT(无结构化CoT)时准确率仅为4.0%,验证了结构化推理协议的必要性——自由形式的CoT容易导致逻辑漂移和泛化性能差。加入CPT后,模型在SFT+RL基础上从29.2%提升至43.7%,证明CPT提供了不可或缺的领域知识储备。RL则在CPT增强的基座上带来了10.6%的巨大提升(从33.1%到43.7%),验证了RL作为性能催化剂的作用。RL训练动态显示,具备CPT的模型在验证准确率和平均奖励上均稳步上升,而无CPT的模型停滞不前。

模型对构建砌块的感知能力分析通过分类探针数据集进行了量化。Qwen3-8B在判别分子是否属于商业可得的起始原料时,pass@1准确率为82.0%,pass@3为94.3%,表明基础模型已在预训练中学习了商业可得的化学空间,这对于避免生成不可用的起始原料至关重要。

结论与研究价值

本研究提出了R3框架,将大语言模型成功应用于多步逆合成规划,实现了从搜索范式到生成式推理范式的根本转变。其科学价值在于证明了端到端生成模型能够有效捕捉长程依赖和全局结构,避免了搜索算法中的组合爆炸和误差传播问题,并展示了强化学习在复杂科学推理任务中解锁模型潜能的能力。在应用价值上,R3在保证高准确率的同时实现了120倍的推理加速,使得高通量场景下的快速逆合成规划成为可能,对于药物发现和有机合成路线设计具有重要的实际意义。

研究亮点

本研究的核心亮点包括:其一,提出了结构化链式思维蒸馏方法,通过五元组推理协议解决了自由形式CoT在树结构规划任务中的逻辑漂移问题,显著提升了可解释性和泛化性能;其二,将群体序列策略优化算法应用于端到端多步规划,以结果监督奖励直接优化整个规划策略,实现了长期目标的对齐;其三,发现了CPT阶段注入的领域知识为RL优化提供了必要的知识基础,形成了“知识—形式—策略”三位一体的训练范式。这些创新为LLM在复杂科学推理与规划任务中的应用提供了新的方法论视角。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com