什么是 Hilbert-Schmidt 独立性准则(HSIC)?

Hilbert-Schmidt 独立性准则(HSIC)是一种 Kernel Dependence Measure,定义为两个配对随机变量的 RKHS Feature Map 之间 Cross-covariance Operator 的 Hilbert-Schmidt 范数平方。

快速了解

创建时间Gretton 等人于 2005 年提出这种 RKHS 依赖准则
规范文档官方规范

工作原理

衡量 RKHS 交叉协方差

HSIC 是 X 与 Y 的 Feature Map 之间 Cross-covariance Operator 的 Hilbert-Schmidt 范数平方。对 n 个配对观测,常见 Biased Estimator 正比于 tr(KHLH),其中 K、L 是 Gram Matrix,H = I - 11^T/n 对两者执行中心化。

Kernel Independence Test 原论文围绕该统计量给出显著性检验。使用合适的 Characteristic Kernel 时,Population HSIC 为零当且仅当变量独立;任意 Kernel 可能漏掉特定依赖。

区分估计器与检验校准

Biased V-statistic 与 Unbiased U-statistic 具有不同的对角项、分母、有限样本取值范围和 Null Behavior。无偏估计可以为负;在实验之间更换公式会使分数不能直接比较。

Permutation Test 在 Exchangeability 成立时打乱一个变量相对于另一个变量的对应关系。配对时间序列、重复实体、空间样本、家庭组或匹配实验需要 Block、Cluster 或保留实验设计的 Permutation。应记录打乱单元、Kernel 参数、Estimator、重采样次数和随机种子。

解释依赖而不越界推断因果

Kernel Bandwidth 控制灵敏尺度:窄 Kernel 强调局部匹配,宽 Kernel 可能遗漏细粒度结构。高维距离、Outlier、不一致预处理与小样本会降低 Power 或增大方差,二次规模的 Gram Matrix 也限制数据量。

HSIC 阳性只说明检验设计下存在统计依赖,不能判断方向、机制或因果。隐藏共同原因可以制造依赖,Selection 与 Conditioning 也会扭曲结果。因果问题需单独引入结构假设与干预;Random Feature 或 Incomplete Statistic 则必须重新验证 Test Size 和 Power。

主要特点

  • 衡量配对变量之间 RKHS 交叉协方差范数
  • 使用合适 Kernel 可检测非线性和多变量依赖
  • 通过中心化 Gram Matrix 计算而无需显式特征坐标
  • 具有有限样本行为不同的 Biased 与 Unbiased Estimator
  • 独立性检验需要尊重 Exchangeability 的校准
  • 不能识别因果方向或自动消除 Confounding

常见用途

  1. 检验两个多变量之间的非线性依赖
  2. 筛选对预测目标具有统计依赖的候选特征
  3. 检查模型诊断中的残差依赖
  4. 比较不同网络层或训练运行的表示依赖
  5. 在额外假设下作为 Causal Discovery 的组成部分

示例

loading...
Loading code...

常见问题

HSIC 具体衡量什么?

HSIC 衡量两个变量的 RKHS Feature Map 之间 Cross-covariance Operator 的范数平方。使用合适 Kernel 时,它能捕捉非线性、多变量依赖,但数值仍依赖 Kernel 与尺度。

HSIC 与 Pearson Correlation 有什么区别?

Pearson Correlation 衡量标准化后的线性关联;HSIC 比较中心化相似结构,能检测更广泛的非线性依赖。代价是需要选择 Kernel 与 Bandwidth、计算成本更高,并仍需校准统计推断。

HSIC 为零是否一定表示变量独立?

在 Population 层面,这一等价关系要求 Kernel 具备相关 Characteristic 或 Universality 性质,并满足正则条件。有限样本估计还可能因为低功效、不合适的 Bandwidth 或采样不足而接近零。

HSIC 能证明一个变量导致另一个变量吗?

不能。依赖可以来自任一方向、共同原因、Selection Effect 或反馈。HSIC 可以成为 Causal Discovery 方法的组件,但因果结论仍需额外结构假设与验证。

HSIC 如何突破二次规模 Gram Matrix 限制?

可以使用 Incomplete U-statistic、Block Estimator、Nyström Approximation 或 Random Feature。近似后必须重新验证 Type-I Error 与 Power;保留平均分数不代表一定保留检验决策。

相关术语

相关文章