什么是 排列特征重要性(PFI)?
排列特征重要性(PFI)是一种模型检查方法,通过在选定数据集上打乱一个特征的取值,测量已拟合模型评估指标的变化。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
先定义模型依赖实验
冻结训练后的模型与预处理流程,选择具有代表性的带标签评估数据,并声明损失或评分。计算基准后,只打乱一个特征,保留其他列,再计算指标。模型依赖研究形式化了排列重要性,并强调依赖程度属于某个具体预测模型,而不是变量本身。
重复排列并保持指标方向一致
应使用可复现的多次排列,报告分布而不只给排名。对于越低越好的损失,重要性为排列损失减基准损失;对于越高越好的分数,减法方向相反。衡量泛化依赖时优先使用留出集或交叉拟合,并保留原始单位,方便把重要性同基准性能比较。
诊断依赖与冗余信息
边际排列同时破坏特征与目标的关系及其同其他输入的依赖。相关替代变量可能让性能保持不变,即使模型实际使用了被检查特征;不合理组合也可能夸大下降。应先检查模型质量与依赖结构,按有意义的特征组排列、分群计算,或在需要衡量独有信息时采用经过验证的条件采样器。
主要特点
- 通过破坏一个特征来测量已拟合模型的指标变化
- 适用于任何能在带标签评估集上评分的模型
- 同时反映目标特征对性能的主效应与交互贡献
- 需要重复排列以量化蒙特卡洛波动
- 随指标、评估人群、模型和排列方案而变化
- 可能低估冗余特征,或评估相关特征的不合理组合
常见用途
- 排序部署模型在留出性能上依赖的输入特征
- 比较模型版本、业务群体或时间窗口中的特征依赖
- 发现只改善训练拟合、却不支持泛化的特征
- 评估编码变量或相关特征族的分组重要性
- 筛选值得继续用 PDP、ALE、SHAP 或领域评审分析的特征
示例
Loading code...常见问题
排列特征重要性实际测量什么?
它测量在特定评估数据上打乱一个特征后,固定模型的选定指标改变多少。下降越大,说明模型越依赖此次排列所破坏的信息。它不表示特征在所有模型中的普遍价值,也不直接说明现实因果作用;结论必须绑定模型、数据、指标与排列定义。
PFI 应在训练集还是留出集上计算?
若问题是哪些特征支持泛化,应使用留出集或交叉拟合数据。训练集 PFI 衡量的是模型对已见样本拟合的依赖,可能把记忆的噪声判为有用。无论选择哪种数据,都应报告切分方式、人群、模型版本、指标、重复次数与不确定性。
为什么排列需要重复多次?
单次打乱只是一次随机重配,在小样本中可能碰巧造成很轻或很重的性能损失。使用固定随机种子或记录过的排列重复计算,再报告均值与离散程度,才能看出估计波动。重复只能量化随机性,不能修复分布偏移或特征依赖问题。
相关特征会怎样影响排列重要性?
相关变量可以在一个特征被打乱后继续提供相似信息,使两者看起来都不重要;边际打乱也可能制造联合分布中不存在的组合,夸大性能下降。分组、分层或条件排列回答的是不同问题,必须说明依赖模型、采样方式与最终估计对象。
PFI 与 SHAP 有什么区别?
PFI 需要真实标签,通过打乱信息后的全局性能损失衡量模型依赖。SHAP 则在声明的联盟价值和背景约定下,把一次选定预测分配给各特征,并可聚合成总体结果。两者的估计对象、输出单位、数据需求和依赖假设不同,排名不一致并不矛盾。