什么是 可解释人工智能(XAI)?
可解释人工智能(XAI)是为明确目的生成证据或表示,帮助特定受众理解 AI 系统部分输出、行为或内部机制的方法与实践领域。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
先定义解释契约
明确谁需要解释、解释哪个模型输出或机制、受众会据此执行什么动作,以及什么证据才算合格。NISTIR 8312区分解释证据、可理解性、解释准确性与知识边界。同一系统面对工程师、审计人员、受影响用户和领域专家时,所需术语与粒度可能不同。
按问题选择方法而不是追逐图形
内生可解释模型直接暴露可理解结构,事后方法则分析已经训练的模型;局部解释回答一次预测,全局解释概括声明人群上的行为。梯度归因、SHAP、LIME、Grad-CAM、示例、反事实、探针与机制干预提供不同证据,不能因为都叫 XAI 就互相替代。
分别评价解释与系统
解释应评测对模型的忠实性、跨种子和保义扰动的稳定性、预测变化时的敏感性、稀疏度或复杂度、覆盖度,以及真实用户任务中的有效性。可解释机器学习严谨评测研究区分应用型、人本型与功能型评价。模型准确率、校准、公平、隐私、稳健和安全仍是独立要求。
主要特点
- 从明确受众、问题、决策与模型输出出发
- 包含内生透明模型以及事后局部或全局解释方法
- 可面向输入特征、样本、概念、内部组件或行为
- 需要忠实性、稳定性、敏感性、覆盖度和可用性证据
- 把解释产物视为绑定模型与数据范围的版本化输出
- 本身不能使模型自动具备公平、因果、正确、安全或合规属性
常见用途
- 调试模型是否依赖预期信号或脆弱捷径
- 向操作人员、评审者或受影响用户解释具体预测
- 用稳定的解释与行为测试比较模型版本
- 为边界明确的决策流程提供审计证据
- 为数据修复、模型重构或因果实验生成待验证假设
示例
Loading code...常见问题
可说明性与可解释性有什么区别?
术语用法并不统一。一种实用区分是:可解释性描述人能直接理解模型或表征的程度,可说明性还包括为不透明系统生成理由或证据的过程。团队应明确自己的术语、受众和验收标准,不能只凭 XAI 标签推定所有人得到相同理解。
局部解释与全局解释有什么区别?
局部解释针对一次预测或很窄的邻域,例如说明某位申请人的特征贡献;全局解释概括声明人群上的整体行为,例如响应曲线或规则。聚合局部结果可以辅助全局分析,但它代表什么仍取决于抽样、特征交互、子群覆盖和解释器假设。
解释看起来直观就代表忠实吗?
不代表。热力图、规则或自然语言理由可能很有说服力,却对模型参数不敏感,或遗漏决定性交互。使用扰动、随机化、留出样本、多次种子、反事实和任务特定忠实性指标对照模型,才能判断解释是否反映真实计算而非视觉模式。
可解释人工智能能证明公平、安全或因果吗?
不能。解释可以暴露敏感特征、捷径或故障路径的候选线索,但公平需要子群与政策分析,安全需要危害和行为测试,因果需要满足识别条件的研究设计。特征归因解释的是配置后的模型输出,不一定是现实结果的成因,还需要独立验证。
应该如何选择 XAI 方法?
先确定决策和利益相关方真正要回答的问题,再选择假设与模型、数据、模态和访问权限相符的最窄方法。预先定义忠实性、稳定性、可用性、隐私、延迟和失败门槛,至少比较一种替代方法,并保留底层模型、结果证据与失败案例。