分享自:

解释模型预测的统一方法

期刊:31st conference on neural information processing systems (nips 2017), long beach, ca, usa.

Scott M. Lundberg 与 Su-In Lee 来自 University of Washington 的 Paul G. Allen School of Computer Science(其中 Su-In Lee 同时隶属于 Department of Genome Sciences),在 2017 年 Neural Information Processing Systems(NIPS 2017)会议上发表了题为 “A Unified Approach to Interpreting Model Predictions” 的研究。该研究提出了 SHAP(SHapley Additive exPlanations,Shapley 加性解释)框架,统一了解释机器学习模型预测的多种方法,并从博弈论角度为特征重要性分配提供了唯一且具有理论保证的解。

理解模型为何做出某一预测,在许多应用中与预测精度本身同样重要。然而,现代大规模数据上的最高精度往往由集成模型或深度学习模型等复杂模型取得,这类模型即使对专家而言也难以解释。这种准确性与可解释性之间的张力,促使研究者提出了 LIME、DeepLIFT、Layer-wise Relevance Propagation 等多种局部解释方法,但这些方法之间的关系以及何种情况下应优先使用哪种方法一直不够清晰。针对这一问题,本文作者提出了一个统一框架 SHAP,其核心是引入加性特征归因方法(additive feature attribution methods)这一解释模型类别,并证明在该类别中存在唯一满足局部准确性、缺失性与一致性三项理想性质的解,即 Shapley 值。

具体而言,作者首先将所有解释模型视为原始模型的可解释近似。定义 1 给出加性特征归因方法的形式:解释模型 g 是二元变量 z′ 的线性函数,即 g(z′) = φ0 + Σ φi z′i。该框架统一了六种已有方法:LIME 通过局部加权线性回归近似模型;DeepLIFT 利用参考值将输入差异映射到输出差异;Layer-wise Relevance Propagation 可视作参考激活为零的 DeepLIFT;Shapley regression values 通过在所有特征子集上重训模型计算边际贡献;Shapley sampling values 用采样近似 Shapley 方程;Quantitative Input Influence 也独立提出了几乎相同的采样近似。这种统一揭示了一个此前未被重视的事实:这些方法共享同一解释模型结构,因此面临着共同的约束与选择空间。

在此基础上,作者从经典博弈论出发,提出了加性特征归因方法应当满足的三项性质。性质 1 为局部准确性(local accuracy),要求解释模型在简化输入 x′ 对应原始输入 x 时,其输出完全等于 f(x)。性质 2 为缺失性(missingness),规定若简化输入中某特征缺失,则其归因值 φi 必须为零。性质 3 为一致性(consistency),要求当模型发生变化、使某个简化输入的贡献在所有其他输入条件下都不减少时,该输入的归因值也不应降低。定理 1 证明,在定义 1 的类中,唯一满足这三项性质的解就是 Shapley 值:φi(f, x) = Σ_{z′⊆x′} [|z′|!(m−|z′|−1)!/m!] [f_x(z′)−f_x(z′\i)]。该结论来自合作博弈论中 Young 的单调解公理体系,但作者指出性质 2 是将 Shapley 证明适配到加性特征归因类所必需的关键条件。由此,LIME 与 DeepLIFT 等方法由于并非基于 Shapley 值,会在某些情况下违反局部准确性或一致性。

为进一步将理论转化为可计算方法,作者将 Shapley 值条件期望形式定义为 SHAP values:即令 f_x(z′) = f(h_x(z′)) = E[f(z) | z_S],其中 S 为 z′ 中非零下标集合。这样,SHAP 值解释的是在已知特征集合 S 的条件下,模型预测期望相对于完全未知时的变化。针对精确计算 SHAP 值代价过高的问题,作者提出了若干近似方法。在模型无关方法中,若假设特征独立,可用 Shapley sampling values 直接估计;而作者新提出的 Kernel SHAP 通过定理 2 给出了一个加权线性回归形式,其权重核为 π_x′(z′) = (m−1)/(C(m,|z′|)|z′|(m−|z′|)),损失为加权平方误差,正则化项为零。在该设置下求解方程 2,即可精确恢复 Shapley 值。与 LIME 的启发式核相比,Kernel SHAP 的核在 |z′| 接近 0 或 m 时趋于无穷,从而强制满足局部准确性。由于回归估计比逐特征采样更高效,Kernel SHAP 在相同模型调用次数下可获得更高估计精度。在模型特定方法中,作者提出了 Linear SHAP(对线性模型直接由系数与特征偏移给出闭式解)、Low-order SHAP、Max SHAP(利用排序输入将 max 函数的 Shapley 值计算从 O(m2^m) 降至 O(m²))以及 Deep SHAP。Deep SHAP 通过将 Shapley 值与 DeepLIFT 的反向传播乘子相结合,将小型网络组件的 Shapley 值递归组合为整个深度网络的近似 SHAP 值,从而避免了 DeepLIFT 对非线性组件线性化规则的启发式选择。

实验部分从计算效率与人类直觉一致性两个方面验证了 SHAP 的优势。在计算效率实验中,作者在稠密与稀疏决策树模型上比较了 Kernel SHAP、Shapley sampling values 与 LIME。结果显示,Kernel SHAP 在较少模型评估次数下即可收敛到真实 Shapley 值附近,且加入去偏 Lasso 正则后可进一步提高稳定性;而 LIME 的估计值与 Shapley 值存在显著偏差,且不会随采样量增加而收敛到局部准确且一致的解。在人类直觉一致性实验中,作者通过 Amazon Mechanical Turk 招募被试,比较 LIME、原始 DeepLIFT、SHAP 与人类解释的一致性。在第一个“疾病评分”场景中,当发烧与咳嗽同时出现时得分为 2,仅出现一种症状时得分为 5,否则为 0;在第二个“三人收益分配”场景中,三人收益取决于答对题目最多者的分数。结果显示,SHAP 与人类平均解释的一致性显著高于 LIME 与原始 DeepLIFT,尤其对于 max 函数分配问题,SHAP 克服了 DeepLIFT 在 max pooling 上归因不合理的缺陷。在 MNIST 手写数字分类实验中,作者利用与 DeepLIFT 原文相同的卷积网络,将图像从数字 8 切换为 3 时,按各方法给出的特征重要性遮蔽 20% 像素。结果表明,越接近 Shapley 值的估计方法,log-odds 变化越大,说明其更有效地识别了类别差异的关键像素。该实验还展示了由 SHAP 理论指导改进后的 new DeepLIFT 优于原始 DeepLIFT。

本研究的主要结论是:SHAP 框架通过识别加性特征重要性方法的统一类,证明了 Shapley 值是唯一同时满足局部准确性、缺失性与一致性的特征归因解;这一理论统一了 LIME、DeepLIFT、Layer-wise Relevance Propagation、Shapley regression values、Shapley sampling values 与 Quantitative Input Influence 六种方法,并为设计新方法提供了原则性指导。其科学价值在于首次从公理化角度澄清了多种局部解释方法之间的理论关系,为解释模型的可信度建立了统一标准;其应用价值在于所提出的 Kernel SHAP 与 Deep SHAP 等方法可直接用于任意黑箱模型与深度网络,提供更高效且更符合人类直觉的特征重要性解释。亮点主要包括:证明唯一性定理、发现 Shapley 值可通过加权线性回归恢复、为 DeepLIFT 提供 Shapley 理论基础并改进深度模型归因,以及在用户研究中证实 SHAP 解释与人类判断的一致性优于已有方法。未来方向包括开发更少假设的模型特定快速估计、引入博弈论中的交互效应估计,以及定义新的解释模型类别。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com