分享自:

EvoSR-LLM:由大型语言模型引导的进化符号回归

期刊:IEEE Transactions on Evolutionary ComputationDOI:10.1109/tevc.2026.3689815

本文提出了一种名为 EvoSR-LLM 的新型符号回归方法,由西安电子科技大学人工智能学院的李宇晨和 Handing Wang(王晗丁,通讯作者)以及西湖大学工学院的 Yaochu Jin(金耀初,IEEE Fellow)共同完成。该研究已被 IEEE Transactions on Evolutionary Computation 接收发表(DOI: 10.1109/TEVC.2026.3689815),并于2026年9月7日上线。研究得到了中国国家自然科学基金(项目号:62376202)的部分资助。本文属于单一原创性研究(类型a)。

学术背景

符号回归(Symbolic Regression, SR)旨在从数据中发现简洁且有效的数学方程,从而揭示数据背后的基本物理规律。与黑盒预测模型不同,符号回归生成的方程具有可解释性,因此在物理学、化学和医学等领域被广泛用于自动化科学发现。然而,符号回归的搜索空间随方程长度呈指数增长,属于NP难问题。现有方法主要包括基于遗传编程(Genetic Programming, GP)的进化搜索方法和基于深度学习的方法。GP类方法依赖显式设计的符号编码,引入了固有的归纳偏置;深度学习方法虽然性能较强,但计算成本高,难以在端到端生成过程中显式平衡复杂度与精度。近年来,大语言模型(Large Language Model, LLM)被引入符号回归,例如 LLM-SR 和 DRSR,它们将符号回归建模为程序搜索,利用LLM的领域知识生成方程。然而,这些方法计算资源消耗大,且生成有效方程的效率较低。此外,LLM的有限可解释性使得精炼过程和其背后的先验知识不透明。为了解决上述问题,本文提出了 EvoSR-LLM,将进化算法与LLM相结合,通过自适应提示引导LLM生成更有效的方程。

详细工作流程

EvoSR-LLM 采用模因计算(Memetic Computing)框架,将全局进化搜索与局部优化相结合。进化循环负责探索符号结构,而 BFGS(Broyden–Fletcher–Goldfarb–Shanno)算法用于优化每个候选方程中的常数。整体框架包含初始化、评估与选择、以及方程生成三个阶段。

在初始化阶段,使用LLM随机生成初始方程种群,并创建一组操作指令(operation instructions)。这些指令结合了手工设计的策略和LLM生成的策略。初始操作指令集包含四条:知识整合(knowledge integration)、见解多样化(insight diversification)、代码重组(code recombination)以及由LLM根据随机选择的元提示(meta-prompt)生成的新指令。

每个候选解并非单纯的数学公式,而是一个由三个协调组件组成的复合对象:(1)关于领域科学知识的自然语言描述;(2)通过推理得出的科学见解的自然语言描述;(3)符合预定义格式的方程代码。代码中的常数以符号 c 表示,其具体数值由 BFGS 在训练集上优化得到。该表示方法称为“知识-见解-代码”(knowledge-insight-code)结构,旨在增强搜索过程的可解释性和可追溯性。

在评估与选择阶段,每个方程的适应度(fitness)由均方误差(MSE)和复杂度惩罚项共同决定。适应度函数定义为:fitness(e) = 1 / ( Σ (e(xi, c*) − yi)² + λ exp(o(e)/l) ),其中 o 是表达式树的节点数,l 为最大节点数(设为80),λ 是平衡拟合精度与复杂度的超参数。λ 每20次迭代根据当前种群性能动态更新,以确保在不同数据集上惩罚项与MSE尺度一致。环境选择中,将子代与父代合并,按适应度排序后保留前 n 个方程。

在方程生成阶段,每个提示(prompt)由三部分组成:操作指令 o、从当前种群中选出的高质量父代方程(数量 b=2)、以及格式指令 i。操作指令 o 被设计为具有两部分结构:目标组件(指示主要修改方程的知识、见解或代码中的哪一部分)和操作方法(描述具体的变换,如扩展、重组、重构)。LLM 根据提示生成一个子代方程。为了严格保证格式有效性,采用重新提示机制对不符合格式约束的输出进行重新生成。

自适应机制的核心在于动态管理操作指令集。每 t=120 次迭代评估一次每条操作指令的性能。评估方法是:在该窗口内收集所有由所有活动指令生成的子代方程到一个全局池中,计算每条指令生成的子代在全局池中的平均适应度排名。得分越低表示指令越有效。随后,用LLM根据元提示生成的新指令替换得分最差的指令。元提示分为三类:元知识提示(MKP)、元见解提示(MIP)和元代码提示(MCP),分别引导LLM生成针对知识、见解或代码组件的新操作指令。这种机制避免了单一提示文本迭代优化可能导致的搜索路径收窄问题。

实验设置方面,研究使用了来自 OES 基准和 LSR-Synth(来自 LLM-SRBench)的共12个科学基准问题,涵盖物理、生物、化学和材料科学。每个数据集划分为训练集、分布内(In-Distribution, ID)测试集和分布外(Out-of-Distribution, OOD)测试集。使用 GPT-3.5-turbo 和 GPT-4o-mini 两种LLM骨干模型。所有基于LLM的方法(FunSearch、LLM-SR、DRSR、EvoSR-LLM)的终止条件统一为生成 3.0×10³ 个候选方程,并共享相同的 BFGS 预算(最多10次迭代)。非LLM基线(GPlearn、DSR、UDSR、PySR)的最大计算预算为 2×10⁶ 次结构搜索的适应度评估。

主要结果

在 OES 基准上(表I),EvoSR-LLM 在振荡器1、振荡器2和大肠杆菌生长数据集上均显著优于所有基线方法。使用 GPT-4o-mini 时,EvoSR-LLM 在振荡器1的 ID 和 OOD 测试集上分别取得 2.90×10⁻⁸ 和 2.49×10⁻⁴ 的 NMSE,显著低于其他方法。在应力-应变数据集上,LLM-SR (GPT-3.5-turbo) 取得最佳 ID 结果,但 EvoSR-LLM 在 OOD 上仍具竞争力。统计检验显示 EvoSR-LLM 在大多数比较中显著优于基线。

在八个 LSR-Synth 数据集上(表II),EvoSR-LLM 同样表现出色。以 po1 的 OOD 数据集为例,EvoSR-LLM (GPT-4o-mini) 的 NMSE 仅为 2.75×10⁻⁷,比所有基线低数个数量级。相比之下,LLM-SR 在部分数据集上不稳定,DRSR 在 bpg0 OOD 上的误差高达 1.48×10²,FunSearch 的方差也较大。

搜索效率方面(图4和图5),EvoSR-LLM 在搜索早期即表现出快速的 NMSE 下降,并能在后续阶段持续改进。相比之下,LLM-SR 在约250次评估后进展停滞,FunSearch 和 DRSR 在部分问题上几乎停滞。

方程复杂度方面(图6),EvoSR-LLM 发现的方程在多个数据集上具有更低的表达式树节点数。例如在大肠杆菌生长问题上,EvoSR-LLM 重构了真实方程中的核心项 μ_max·b·(s/(K_s+s)) 和 exp(−|pH−pH_opt|),且未引入冗余结构,而 LLM-SR 得到的方程则包含更繁琐的项。

消融实验表明,移除知识和见解组件会显著降低性能(例如振荡器1的 OOD NMSE 从 1.86×10⁻⁴ 升至 0.0369);移除自适应提示策略会导致搜索停滞,无法生成足够复杂的方程;移除复杂度惩罚虽然改善了 ID 拟合,但 OOD 泛化能力下降,表明复杂度惩罚对防止过拟合至关重要。

结论与价值

EvoSR-LLM 通过将进化算法与LLM结合,并采用知识-见解-代码表示和自适应提示引导机制,在多个科学基准上超越了现有最优的符号回归方法。其科学价值在于提出了一种新的可解释且可追溯的LLM引导进化搜索范式,使LLM从简单的文本生成器转变为执行特定搜索操作的算子。应用价值在于该方法能够以更少的评估次数发现精度更高、泛化能力更强、复杂度更低的方程,适用于物理、化学、生物和材料科学等领域的自动化科学发现。此外,通过动态归一化的复杂度惩罚,该方法在不同问题间实现了精度与复杂度的一致性权衡。

研究亮点

本研究的亮点包括:(1)提出知识-见解-代码三部分方程表示,增强了LLM推理过程的可解释性和可追溯性;(2)提出自适应提示引导的方程生成方法,通过元提示和基于性能的替换机制动态优化操作指令,提高了搜索效率并减少了对人工提示工程的依赖;(3)设计了包含动态归一化复杂度惩罚的适应度函数,有效防止过拟合并促进简洁方程的生成;(4)在12个科学基准问题上验证了方法的优越性,特别是在 OOD 泛化能力上显著优于现有方法。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com