分享自:

释放数据海啸的力量:语言模型指令微调数据评估与选择的综合综述

期刊:Transactions on Machine Learning Research

本文发表于《Transactions on Machine Learning Research》(12/2024),主要作者来自腾讯优图实验室及上海交通大学,包括Yulei Qin、Yuncheng Yang、Pengcheng Guo、Gang Li、Hang Shao、Yuchen Shi、Zihan Xu、Yun Gu、Ke Li与Xing Sun。本文是一篇综合性综述(survey),系统梳理了面向大语言模型指令微调(instruction tuning)的数据评估与数据选择方法。

随着GPT、LLaMA、Mistral等大规模语言模型(LLMs)的迅速发展,指令微调已成为对齐人类偏好的关键环节。虽然开源指令数据集数量庞大,但简单地将所有数据用于训练既不高效也不一定最优。在这一背景下,数据评估与选择方法应运而生,用于识别对模型训练最有价值的样本,从而在降低训练成本的同时提升模型性能。本文的目标是弥合通用数据选择方法与指令微调场景之间的知识缺口,统一地梳理数据评估的指标体系和选择机制。

本文的核心贡献在于提出了一种统一、细粒度的分类体系。作者将适用于指令微调的数据评估与选择方法划分为三大类:基于质量(quality-based)、基于多样性(diversity-based)和基于重要性(importance-based)的方法。需要指出的是,在以往研究中,“质量”“多样性”“重要性”三个概念常常被混用或未加严格区分,而本文从数据自身的属性出发,对三者给出了明确界定:质量关注数据本身的内在价值,包括指令是否清晰、准确、显式,以及回答是否正确、连贯、与指令相关;多样性关注数据集的丰富性和差异性,要求覆盖不同知识领域、任务定义和输入输出约束,并强调去除同质或近似重复的样本;重要性则关注单个数据点对模型性能的具体影响,涉及指令难度、模型能力、数据集规模等因素。三者之间既相互独立又存在耦合,共同构成数据选择策略的设计基础。

在方法层面,本文按照统一框架展开。对于基于质量的评估,论文梳理了四类技术路径:手工设计指标(hand-crafted indicators)、基于模型的指标(model-based indicators)、GPT评分(GPT score)和人工评估(human evaluation)。手工设计指标源于传统的语言学和可读性研究,包括词汇多样性、句法特征、语义相似度等,如DQI(数据质量指标)、可读性公式以及AFLite等方法。这类指标能够识别不通顺、无意义或不连贯的样本,但无法有效检测指令与回答之间的不匹配。基于模型的指标则借助可训练模型来预测数据质量,主要包括困惑度(perplexity)、EL2N、记忆排名(memorization ranking)、指令跟随难度(IFD)、学习复杂度(learning complexity)、奖励模型评分以及基于不确定性的方法。此类方法中,小规模代理模型(proxy model)常被用来降低计算成本。GPT评分利用ChatGPT等闭源大模型作为评判者,通过设计提示模板(prompt)对指令与回答在有用性、准确性等维度进行打分,具有较高的与人类偏好一致性,但成本较高。人工评估虽然成本最高,但在偏好对齐数据构建中具有不可替代的地位,例如OpenAssistant数据集即通过人工标注质量、创造性和无害性等多个维度来构建。

在多样性评估与选择中,本文同样从手工设计指标和基于模型的指标入手,并重点讨论了基于几何的核集采样(geometry-based coreset sampling)和双层优化核集采样(bilevel optimization-based coreset sampling)。手工多样性指标主要包括词法多样性度量,如类型-标记比(TTR)、VOCD-D、MTLD、HD-D等,以及基于嵌入空间的K近邻距离(KNN)度量。基于模型的多样性指标则从熵(如香农熵、Rényi熵)、辛普森指数(Simpson’s index)、Vendi评分(Vendi Score)等角度出发,对数据集整体的多样性进行衡量。几何核集采样是最直观的多样性导向选择方法,其核心思想是控制所选子集中任意两个样本之间的最小距离,以避免冗余信息。典型方法包括K-Center Greedy、Herding Greedy、基于聚类的采样(如D4采样、ClusterClip采样)以及质量-多样性联合选择算法(QDIT、DEITA等)。这些方法在嵌入空间中通过贪心迭代逐步挑选异质性最高的样本,以最大限度地代表完整数据集。双层优化方法则将数据选择视为一个外层优化问题,模型参数优化作为内层问题,通过交替优化选择权重或掩码与模型参数,从而在子集上近似完整数据集的表现。代表方法包括GLISTER、RETRIEVE、ScaleBio等,这些方法往往引入验证集和梯度匹配机制,以提高选择的鲁棒性和效率。

在重要性评估与选择方面,论文讨论了手工设计指标(如指令难度、回答长度等)、基于模型的指标(如IFD、学习复杂度、遗忘度等)、基于损失和误差的核集采样(如EL2N、遗忘事件)以及基于梯度的核集采样(如梯度匹配)。重要性导向方法的核心逻辑是衡量每个样本对模型学习过程的贡献,例如高IFD样本可能表示指令无法有效帮助模型生成目标回答,这类样本在数据清洗中通常被滤除;而学习复杂度较高的样本在数据充足的场景下往往更具训练价值。

文章进一步讨论了现有方法的局限性。首先,质量、多样性和重要性三个维度之间存在权衡,过度强调某一维度可能损害其他维度。例如,单纯追求多样性可能导致低质量样本被选入;而只按质量排序可能使所选子集在领域覆盖上失衡。其次,许多方法依赖代理模型(如GPT-3.5、GPT-4或较小的开源模型)进行打分,这引入了代理模型自身偏差和成本问题。此外,方法之间的可比性不足,因为不同研究使用了不同的基础模型、训练设置和评测基准,且许多论文并未报告完整的实验细节,导致系统性比较困难。作者特别指出,现有数据选择方法大多忽略偏误与公平性问题,虽然已经有一些工作开始关注指令数据中的性别、种族、宗教等偏见,但这些技术尚未被整合进统一的选择分类体系中。

在开放挑战方面,本文提出若干未来研究方向。第一,如何结合质量、多样性与重要性三类属性进行联合优化,设计更稳健的选择机制,避免单一维度的偏颇。第二,降低评估成本,例如通过少量GPT标注样本训练开源质量评分模型,再将其推广到大规模数据集。第三,建立更统一的评测协议和基准,使不同方法可以在相同条件上比较。第四,将数据选择与公平性和去偏技术结合,降低指令微调后模型可能出现的社会偏见。第五,发展更具可解释性的数据评估方法,以理解所选子集为何带来性能提升。

本文的学术价值在于首次以统一视角,对面向指令微调的数据评估与选择方法进行了系统分类和细致梳理,特别是厘清了质量、多样性、重要性三个概念的边界,并给出形式化定义。在此基础上,总结了手工指标与模型指标、几何采样与双层优化等不同技术路线的内在联系。从应用价值来看,本文为研究人员和工程师提供了数据选择方法选型的参考框架,有助于在资源有限的条件下构建更高效、更有效的指令微调数据流水线。同时,文章配套的GitHub仓库也为后续研究提供了丰富的相关资源索引。整体而言,这是一篇体系完整、结构清晰、兼具理论梳理与实践指导意义的综述性工作。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com