大型语言模型的高效编辑:SERAC——基于记忆的半参数化方法
主要作者及发表信息
本研究由斯坦福大学计算机科学系的 Eric Mitchell、Charles Lin、Christopher D. Manning 和 Chelsea Finn,以及瑞士洛桑联邦理工学院(EPFL)的 Antoine Bosselut 共同完成。该论文发表于第 39 届国际机器学习大会(ICML 2022),会议地点为美国马里兰州巴尔的摩。
研究背景与目标
大型神经网络,特别是语言模型,在部署后通常以静态模型的形式存在,其行为很难在无需重新训练的情况下进行修改。然而,现实世界在不断变化,例如新的国家领导人上任、公众对特定议题的情绪演变,或者是模型在原始训练数据上出现过拟合或欠拟合,这些情况都要求模型能够快速、有针对性地更新其行为。模型编辑(model editing)作为一个新兴的研究领域,旨在实现对预训练基础模型行为的快速、数据高效且局部性的更新,而同时不损害模型在其他输入上的性能。
现有的模型编辑方法,如可学习模型编辑器(learnable model editors),通常通过预测基础模型权重的更新来实现行为改变。尽管这些方法展现出潜力,但它们存在几个关键缺陷:首先是表达性不足,难以精确建模编辑的预期范围(edit scope),即受编辑影响的样本集合,导致对于与编辑示例松散相关的测试输入产生不准确的预测;其次是容量有限,在多次编辑后常常完全失效。此外,现有编辑器通常为特定基础模型训练,更换基础模型则需要重新训练,其计算成本随基础模型大小而增加。本研究假设这些问题源于现有方法依赖于编辑示例标签相对于预编辑模型参数的梯度(gradient),而梯度信号对于模型编辑而言可能不够充分。
为解决上述挑战,本研究提出了一种名为 SERAC(Semi-parametric Editing with a Retrieval-Augmented Counterfactual model,检索增强反事实模型的半参数化编辑)的全新方法,旨在实现更具表达性、更高容量且更高效的模型编辑。
研究方法与流程
SERAC 的核心思想是不直接修改基础模型参数,而是将其“封装”起来,通过一个显式的记忆缓存(edit memory)和一个辅助的神经网络系统来实现编辑。整个系统由三个关键组件构成: 1. 编辑缓存(Edit Memory):直接存储用户提供的编辑描述符(edit descriptor, (ze)),对于语言模型而言,这些描述符可以是任意的输入-输出对(如“英国的首相是谁?鲍里斯·约翰逊”)或文本表述(如“话题:爵士乐 情绪:正面”)。 2. **范围分类器(Scope Classifier, (g\phi))**:一个可训练的神经网络,用于判断一个新的测试输入 ((x’)) 是否落入了缓存中某个编辑示例的预期范围(scope)内。 3. 反事实模型(Counterfactual Model, (h_\psi)):另一个可训练的神经网络,根据最相关的编辑示例和新的测试输入,预测在编辑所描述的反事实世界下的正确输出。
SERAC 的工作流程分为两步:首先,当接收到一个经过一次或多次编辑的测试输入 (x’) 时,范围分类器会评估该输入落入缓存中每个编辑示例范围的概率。其次,如果分类器判定输入落入某个编辑的范围(概率最高且超过阈值0.5),则将该编辑描述符与测试输入一起传递给反事实模型,并由反事实模型生成最终预测。如果输入被判定为所有编辑的范围之外,则直接使用未修改的基础模型((f_{base}))进行预测。这种设计将“何时需要修改预测”和“如何修改预测”这两个子问题分别委托给了范围分类器和反事实模型,从而减少了两者之间的干扰。
在训练阶段,SERAC 的编辑器和基础模型完全解耦,无需访问基础模型的参数或梯度。训练通过一个编辑数据集(edit dataset, (D^e))以监督学习的方式进行,该数据集指定了编辑描述符,并定义了如何采样其范围内样本((I(z_i^e; D^e)))和范围外样本((O(zi^e; D^e)))。范围分类器被训练为解决一个二分类问题,最大化范围内样本的相关性概率,最小化范围外样本的相关性概率。反事实模型则被训练为根据编辑描述符和范围内样本输入,最大化生成正确标签 (y{in}) 的概率。
为了更严格地评估模型编辑器的性能,本研究还引入了三个全新的、更具挑战性的语言模型编辑任务,这些任务基于问答(QA)、事实核查(FC)和对话生成(Convsent): * QA & QA-hard:基于 zsRE 问答数据集。QA-hard 通过自动化技术生成了测试逻辑蕴涵(logically-entailed)事实的“困难范围内”样本(如根据“谁是美国首相?鲍里斯·约翰逊”推断“鲍里斯·约翰逊在哪里当首相?”),以及通过语义相似度检索出的“困难范围外”样本。基础模型为在 Natural Questions 上微调的 T5-large。 * FC:基于 VitaminC 事实核查数据集。每个证据(evidence)被用作编辑描述符,其范围内样本是相应的声明(claim),范围外样本则是来自同一维基百科页面的其他声明或其他所有声明。基础模型为在 FEVER 数据集上训练的 BERT-base。 * Convsent:评估编辑器修改对话智能体对特定话题的情感倾向的能力。编辑描述符不是输入输出对,而是如“话题:香蕉 情绪:负面”的明确行为指令。基础模型为 90M 参数的 BlenderBot。
评估指标包括编辑成功率(Edit Success, ES)和性能衰减(Drawdown, DD)。ES 衡量编辑后模型在范围内输入上的行为与期望行为的一致性;DD 衡量编辑后模型在范围外输入上与原始模型预测的差异程度。好的编辑器应有高 ES 和低 DD。对于对话情感编辑任务,ES 通过结合情感准确性和话题一致性的复合指标 (ES_{sent}) 来衡量,DD 则使用 KL 散度来衡量。
主要实验结果
研究通过将 SERAC 与多个基线方法(微调 FT、可编辑神经网络 ENN、模型编辑网络 MEND、缓存查找 LU、检索提示 RP)进行对比,得出了关键结果。
在整体性能方面,所有问题均在应用了 10 次同时编辑的设定下进行。在基础 QA 任务和 QA-hard 任务中,SERAC 均展现出远超其他方法的性能(QA 中 ES 高达 0.986,DD 低至 0.009),而 MEND 和 ENN 在多次编辑后性能显著下降。在极具挑战性的 FC 任务中,除 SERAC 外,所有方法的编辑成功率均接近随机水平(SERAC 的 ES 为 0.877),尽管其 DD(0.051)略高于某些基线,但其在编辑成功上的巨大提升远超其性能衰减的增加。在 Convsent 任务中,仅有 SERAC 能够实现有意义的编辑(ES 为 0.991),且实现了零性能衰减(DD 为 0),成功地将显式的编辑描述符转化为期望的模型行为,而其他基于梯度的学习方法在此任务上完全失效。
在编辑规模扩展性上,研究发现,当同时应用高达 75 次编辑时,SERAC 的编辑性能几乎没有下降,而 ENN 和 MEND 的性能则随编辑数量增加而急剧衰退,在 75 次编辑时几乎完全失效。此外,对于 SERAC,顺序编辑和批处理编辑的结果具有一致性,因为它们只是简单地被追加到编辑记忆中,这是梯度类方法不具备的优势。
在误差分析中,SERAC 允许将编辑错误解耦为分类器错误和反事实模型错误。在 QA-hard 上,主要挑战在于范围估计,特别是对困难范围内样本的分类。在 FC 任务上,性能瓶颈则在于范围分类器在处理困难范围外样本时的精度。此外,通过更换不同的分类器架构(如交叉注意力 Cross-attention 与嵌入 Embedding)的实验表明,交叉注意力在需要精确捕捉细节差异的任务(如 FC)中尤其有效。
结论与价值
SERAC 作为一种新型的半参数化模型编辑器,通过在外部记忆中存储编辑而非直接修改模型参数,成功解决了现有方法在表达性、编辑容量和计算效率上的不足。其在多项挑战性基准测试中显著优于现有方法,特别是在需要复杂逻辑推理和大量编辑的场景下表现出色。
SERAC 的科学价值在于它提出了一种全新的模型编辑范式,将编辑问题解耦为范围判别和反事实预测两个独立的子问题,并用专门的模型解决,这为未来模型编辑的研究开辟了新方向。其应用价值体现在几个方面:第一,SERAC 在训练和使用编辑器的过程中完全不需要访问基础模型的参数或计算梯度,这使得它可以像“黑盒”一样封装任何模型,从而能快速、低成本地编辑多种不同架构的预训练模型,无需针对每个模型重新训练编辑器。第二,它可以接受自然语言形式的编辑指令,而不仅限于输入输出对,这极大地拓展了模型编辑的应用场景。第三,其编辑能力强大且稳健,能够在大规模编辑下保持高性能,使模型在实际部署中持续适应世界变化成为可能。论文中还讨论了对该技术被滥用于恶意操纵模型观点(如放大特定政治宣传)的担忧,并提出了通过周期性自蒸馏(self-distillation)来限制记忆缓存无限增长的未来方向。
研究亮点
本研究的主要亮点包括: * 创新性方法:提出了首个梯度无关、基于记忆的半参数化模型编辑框架 SERAC,从根本上解决了梯度信号贫乏和编辑间干扰的问题。 * 高度解耦的设计:将模型编辑器与基础模型完全解耦,使其成为一个可复用的封装器,大大降低了计算成本和跨模型编辑的门槛。 * 挑战性基准的建立:为了精确衡量模型编辑器的进展,研究不仅使用了现有数据集,还创建了三个全新的、更贴近真实世界复杂性的编辑任务(QA-hard, FC, Convsent),这些基准将极大地促进该领域的后续研究。 * 强大的性能表现:SERAC 在所有三个新基准任务上均一致性地、以显著优势超越了所有现有方法,尤其是在同时处理大量(高达75次)编辑时展现出卓越的稳定性和可扩展性,这是以往方法所不具备的。