什么是 LIME?

LIME(Local Interpretable Model-agnostic Explanations)是一种事后解释方法,在目标样本附近生成加权扰动,用简单可解释代理模型拟合黑箱输出,以解释该次预测。

快速了解

全称Local Interpretable Model-agnostic Explanations
规范文档官方规范

工作原理

定义可解释的局部邻域

选择待解释样本、目标输出、可解释特征、扰动过程、距离与 Kernel。文本可以开关词语,图像可以开关 Superpixel,表格数据则需要尊重类型和依赖的分布。LIME 原始论文把解释定义为带复杂度惩罚、在目标附近忠实的可解释模型。

查询黑箱并拟合稀疏代理

生成扰动样本,获取黑箱分数而不只读取硬标签,计算接近度权重,再拟合加权线性模型、浅层树或其他明确的可解释模型族。特征选择与正则化在可读性和局部忠实性之间权衡。所得系数解释的是可解释表征下的拟合邻域,不是原模型的全局参数。

测量忠实性、稳定性与合理性

报告目标附近加权留出误差,重复随机种子,扫描 Kernel Width 和样本数,并比较替代扰动生成器。检查合成样本是否合理,以及代理能否保留相关决策边界附近的黑箱行为。独立的 LIME 方法指南展示了 Kernel、距离、采样与不稳定性如何改变解释。

主要特点

  • 用加权局部邻域中拟合的简单模型解释一次预测
  • 只需预测查询,无需模型梯度或内部状态
  • 使用可能不同于原模型特征的可解释表征
  • 在代理模型复杂度与实测局部忠实性之间权衡
  • 依赖扰动采样、距离、Kernel Width 与随机种子
  • 可能从不现实局部样本生成看似合理的系数

常见用途

  1. 用稀疏局部线性模型解释单个表格预测
  2. 标出影响一次文本分类分数的词语
  3. 选择与指定图像预测相关的 Superpixel
  4. 比较模型发布前后目标样本附近的行为
  5. 审计解释对随机种子和邻域定义的不稳定性

示例

loading...
Loading code...

常见问题

LIME 中的模型无关是什么意思?

LIME 只要求可调用的预测接口,不依赖梯度、权重或架构专用内部信息,因此能包装多种模型。模型无关不等于没有假设;可解释表征、扰动分布、距离、Kernel、目标输出和代理模型族仍共同定义最终解释,这些选择都必须记录。

LIME 提供的是局部解释还是全局解释?

标准 LIME 解释只针对一个样本及其采样与 Kernel 定义的合成邻域,系数不能当成全局模型行为。选择若干代表样本可以汇总多个局部解释,但不会把其中任何一个代理自动升级为全局模型,也不能证明遗漏人群具有同样规律。

为什么重复运行 LIME 会得到不同解释?

LIME 通常随机采样扰动,还可能执行稀疏特征选择,因此种子、样本数、相关变量、Kernel Width 与局部拟合病态性都可能改变入选特征和权重。应重复运行并报告离散程度,测试邻近输入,对忠实性或特征集合不稳定的解释拒绝下结论。

怎样检查 LIME 邻域是否合理?

先验证特征类型与约束,检查扰动是否可能出现在真实领域,用一部分加权样本测量留出局部忠实性,并扫描 Kernel Width;有真实近邻时应同步比较。文本删词或图像遮挡还要确认产生的伪影没有主导黑箱输出。

LIME 系数可以解释因果效应吗?

不能。它描述的是生成邻域中拟合出的预测代理,系数受采样、权重、表征和相关特征影响,样本组合甚至可能在现实中不可发生。因果解释需要明确干预、识别假设和领域有效数据,不能把局部线性权重直接当成可操作的现实原因。

相关术语