什么是 Hilbert-Schmidt 独立性准则(HSIC)?
Hilbert-Schmidt 独立性准则(HSIC)是一种 Kernel Dependence Measure,定义为两个配对随机变量的 RKHS Feature Map 之间 Cross-covariance Operator 的 Hilbert-Schmidt 范数平方。
快速了解
| 创建时间 | Gretton 等人于 2005 年提出这种 RKHS 依赖准则 |
|---|---|
| 规范文档 | 官方规范 |
工作原理
衡量 RKHS 交叉协方差
HSIC 是 X 与 Y 的 Feature Map 之间 Cross-covariance Operator 的 Hilbert-Schmidt 范数平方。对 n 个配对观测,常见 Biased Estimator 正比于 tr(KHLH),其中 K、L 是 Gram Matrix,H = I - 11^T/n 对两者执行中心化。
Kernel Independence Test 原论文围绕该统计量给出显著性检验。使用合适的 Characteristic Kernel 时,Population HSIC 为零当且仅当变量独立;任意 Kernel 可能漏掉特定依赖。
区分估计器与检验校准
Biased V-statistic 与 Unbiased U-statistic 具有不同的对角项、分母、有限样本取值范围和 Null Behavior。无偏估计可以为负;在实验之间更换公式会使分数不能直接比较。
Permutation Test 在 Exchangeability 成立时打乱一个变量相对于另一个变量的对应关系。配对时间序列、重复实体、空间样本、家庭组或匹配实验需要 Block、Cluster 或保留实验设计的 Permutation。应记录打乱单元、Kernel 参数、Estimator、重采样次数和随机种子。
解释依赖而不越界推断因果
Kernel Bandwidth 控制灵敏尺度:窄 Kernel 强调局部匹配,宽 Kernel 可能遗漏细粒度结构。高维距离、Outlier、不一致预处理与小样本会降低 Power 或增大方差,二次规模的 Gram Matrix 也限制数据量。
HSIC 阳性只说明检验设计下存在统计依赖,不能判断方向、机制或因果。隐藏共同原因可以制造依赖,Selection 与 Conditioning 也会扭曲结果。因果问题需单独引入结构假设与干预;Random Feature 或 Incomplete Statistic 则必须重新验证 Test Size 和 Power。
主要特点
- 衡量配对变量之间 RKHS 交叉协方差范数
- 使用合适 Kernel 可检测非线性和多变量依赖
- 通过中心化 Gram Matrix 计算而无需显式特征坐标
- 具有有限样本行为不同的 Biased 与 Unbiased Estimator
- 独立性检验需要尊重 Exchangeability 的校准
- 不能识别因果方向或自动消除 Confounding
常见用途
- 检验两个多变量之间的非线性依赖
- 筛选对预测目标具有统计依赖的候选特征
- 检查模型诊断中的残差依赖
- 比较不同网络层或训练运行的表示依赖
- 在额外假设下作为 Causal Discovery 的组成部分
示例
Loading code...常见问题
HSIC 具体衡量什么?
HSIC 衡量两个变量的 RKHS Feature Map 之间 Cross-covariance Operator 的范数平方。使用合适 Kernel 时,它能捕捉非线性、多变量依赖,但数值仍依赖 Kernel 与尺度。
HSIC 与 Pearson Correlation 有什么区别?
Pearson Correlation 衡量标准化后的线性关联;HSIC 比较中心化相似结构,能检测更广泛的非线性依赖。代价是需要选择 Kernel 与 Bandwidth、计算成本更高,并仍需校准统计推断。
HSIC 为零是否一定表示变量独立?
在 Population 层面,这一等价关系要求 Kernel 具备相关 Characteristic 或 Universality 性质,并满足正则条件。有限样本估计还可能因为低功效、不合适的 Bandwidth 或采样不足而接近零。
HSIC 能证明一个变量导致另一个变量吗?
不能。依赖可以来自任一方向、共同原因、Selection Effect 或反馈。HSIC 可以成为 Causal Discovery 方法的组件,但因果结论仍需额外结构假设与验证。
HSIC 如何突破二次规模 Gram Matrix 限制?
可以使用 Incomplete U-statistic、Block Estimator、Nyström Approximation 或 Random Feature。近似后必须重新验证 Type-I Error 与 Power;保留平均分数不代表一定保留检验决策。