什么是 核均值嵌入(KME)?

核均值嵌入(KME)把概率分布表示为其样本特征映射在再生核希尔伯特空间中的期望,从而通过 Kernel Evaluation 计算期望与分布比较。

快速了解

全称Kernel Mean Embedding
创建时间现代框架由 Smola、Gretton、Song 与 Schölkopf 于 2007 年系统提出
规范文档官方规范

工作原理

把分布期望转换为内积

对具有 Feature Map phi 的正定 Kernel k,均值嵌入定义为 mu_P = E_P[phi(X)]。满足所需可积条件时,任意 RKHS 函数都有 E_P[f(X)] = <f, mu_P>;独立的 X ~ P 与 Y ~ Q 还满足 <mu_P, mu_Q> = E[k(X,Y)]。

Kernel Mean Embedding 综述系统说明了边缘与条件 Embedding、理论假设和应用。Characteristic Kernel 才能在指定定义域上令概率测度到 Embedding 的映射为单射;只有 Positive Definiteness 并不能保证这一点。

无需显式构造 RKHS 即可估计

给定 n 个观测,mu_P 的经验估计为 mu_hat = (1/n) sum_i k(x_i, .)。该对象可以是无限维的,但它在 Probe 上的值、与另一个 Embedding 的内积或范数,都能化成有限 Kernel Sum。

估计默认样本能够代表目标总体。Survey Weight 不等、时间依赖、Clustered Observation、Censoring、重复记录或 Adaptive Collection 都需要相应估计器与不确定性分析;把每一行静默当作 IID 会改变 Estimand。

审计可识别性、不确定性与计算成本

有限维或非 Characteristic Kernel 可能只保留部分矩,因此相同 Embedding 不一定表示分布相同。即便使用 Characteristic Kernel,较小的经验距离也可能来自低检验功效、不合适的 Bandwidth 或有限支持范围,而不是具有业务意义的等价。

精确 Gram Matrix 操作通常需要二次存储或计算。只有在目标统计量上测量近似误差后,才能采用 Block Computation、Low-rank Method 或显式 Random Feature;若 Embedding 参与模型选择,还要隔离 Train、Calibration 与 Evaluation Sample。

主要特点

  • 把概率测度映射为 RKHS 中的期望特征表示
  • 通过 Kernel Evaluation 计算期望与分布内积
  • 只有满足 Characteristic-kernel 条件时才能识别分布
  • 经验平均的不确定性取决于真实采样机制
  • 直接连接 MMD、HSIC、条件嵌入与分布学习
  • 未经近似时 Kernel 计算可能具有二次成本

常见用途

  1. 把 Bag、Cohort 或分布作为下游模型输入
  2. 构建非参数两样本与独立性统计量
  3. 监控参考特征分布与线上特征分布的变化
  4. 无需密度拟合地比较生成器、模拟器或实验总体
  5. 在明确假设下支持条件分布与因果推断方法

示例

loading...
Loading code...

常见问题

核均值嵌入保留了分布的哪些信息?

它保留所选 RKHS 函数的期望。如果 Kernel 在相关定义域上是 Characteristic,Population Embedding 能唯一识别分布;若 Kernel 较弱,不同分布可能得到相同 Embedding。

核均值嵌入就是普通特征均值吗?

它确实是 Feature Map 的期望,但 Feature Space 可以是无限维且隐式存在。实际计算通常使用 Kernel Identity,而不是构造坐标;有限维 Explicit Feature Approximation 会改变表示并引入近似误差。

核均值嵌入与 MMD 有什么关系?

MMD 是两个 Mean Embedding 之间的 RKHS 距离。Embedding 负责表示每个分布,MMD 把两种表示之差变成统计量或 Discrepancy;若要做显著性判断,还必须校准零假设分布。

经验嵌入距离为零能证明两个分布相同吗?

不能。精确可识别性是 Population 层面的结论,还要求合适的 Kernel。有限样本结果可能因低功效、Bandwidth、依赖、权重或采样噪声而接近零,必须同时报告不确定性和检验设计。

核均值嵌入如何扩展到大数据集?

可以使用 Block Kernel Computation、Subsampling、Nyström Method 或 Random Feature。每种近似都会改变方差、偏差或实际表示的 Kernel,应先在代表性子集上对照精确结果,并固定推理时使用的映射。

相关术语

相关文章