← ClaudeAtlas

ml-explainability-xailisted

黑箱模型的解释技术选型与正确用法。当用户问"LIME/SHAP/saliency 怎么选"、"特征重要性 为什么互相矛盾"、"模型为什么这样预测"、要向监管/客户解释黑箱决策、或想把事后解释当 因果证据用时激活。动作:按动机定要求(信任/调试/合规)→内在可解释vs事后解释选型→全局 重要性找数据问题、个案解释做申诉复核→高保真vs高可用权衡。不适用于本身透明的模型 (ml-rule-learning)、因果归因(ml-causal-inference)。触发词: explainability 可解释性, LIME, SHAP, saliency, feature importance 特征重要性, 解释黑箱
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 可解释性方法论 — 先问"解释给谁看、干什么用",再挑工具 ## R — 原文 (Reading) > (转述)Ribeiro 等指出:人们对模型的信任有两个层面——相信它在预测,与相信它能被部署;全局指标掩盖不了单个样本上不可理喻的行为。他们主张用局部忠实:在待解释样本邻域内拟合一个可理解的线性代理,以此近似黑箱在该点附近的决策依据(LIME)。 > > — Marco Ribeiro 等, ""Why Should I Trust You?": Explaining the Predictions of Any Classifier" (KDD 2016) > (转述)Lundberg 等把 Shapley 值从合作博弈论引入特征归因:把预测视为各特征的联合产出,按公理化公平原则(有效性/缺失性/一致性)将贡献唯一地分派给每个特征(SHAP),并给出与多种既有归因方法的统一视角。 > > — Scott Lundberg & Su-In Lee, "A Unified Approach to Interpreting Model Predictions" (NeurIPS 2017) > (转述)显著性图类方法(对输入求梯度并可视化)成为视觉模型解释的主流直觉工具;但后续研究反复提醒:梯度饱和、平滑选择等实现细节会让同一模型对同一样本给出截然不同的"解释",解释的稳定性本身需要检验。 > > — saliency map 方法族的社区共识(Simonyan 2014 起源;Adebayo 2018 等健全性检验) --- ## I — 方法论骨架 (Interpretation) 可解释性不是一个属性,是三种不同的需求,混着谈必然选错工具: - **信任动机**(用户/业务方愿不愿意采纳):要的是"这个决定讲得通",个案级故事即可; - **调试动机**(开发者找模型哪里学坏了):要的是暴露异常模式——重要性排序里冒出不可能的特征(如病历号),就是数据泄漏或管道 bug 的信号; - **合规审计动机**(监管要求可申诉的决策):要的是稳定、有文档、可复现的解释,且方法本身经得起质证——这里事后解释的随意性是大问题。 **选型的第一刀**:内在可解释 vs 事后解释。若可解释是硬约束且精度代价可承受(信贷规则、医疗筛查初筛),直接用透明的模型族(线性/树/规则),解释即模型本身,无忠实度问题;若必须用黑箱(精度差距不可放弃),才进入事后解释工具箱。 **事后解释三件套**: - **LIME**: 在目标样本邻域扰动采样、拟合稀疏线性代理——快、直观、任意模型可用,但每次结果有随机波动,适合快速个案侦查; - **SHAP**: 博弈论分派的公理化归因——理论性质好(加和一致)、有统一实现,但计算贵、且"分派公平"不等于"特征在现实中起因果作用"; - **saliency/反事实解释**: 视觉场景看热力图,或问"改动哪个输入最少能翻转预测"——后者特别适合申诉场景("收入再高两万就会通过")。 **正确用法与误用的分界线**:全局重要性排序用于找数据与管道问题、校验模型是否依赖合理证据;个案解释用于申诉复核与人机协同。误用是把事后解释读成因果声明——"SHAP 说年龄贡献最大"只说明模型用了年龄,不说明改年龄会改变真实结果。**高保真 vs 高可用的权衡**贯穿全程:越忠实的解释往往越难懂(完整 SHAP 交互矩阵没人看得懂),越易懂的代理越可能失真——选型时必须声明你牺牲了哪一头。 --- ## A1 —