什么是 核均值嵌入(KME)?
核均值嵌入(KME)把概率分布表示为其样本特征映射在再生核希尔伯特空间中的期望,从而通过 Kernel Evaluation 计算期望与分布比较。
快速了解
| 全称 | Kernel Mean Embedding |
|---|---|
| 创建时间 | 现代框架由 Smola、Gretton、Song 与 Schölkopf 于 2007 年系统提出 |
| 规范文档 | 官方规范 |
工作原理
把分布期望转换为内积
对具有 Feature Map phi 的正定 Kernel k,均值嵌入定义为 mu_P = E_P[phi(X)]。满足所需可积条件时,任意 RKHS 函数都有 E_P[f(X)] = <f, mu_P>;独立的 X ~ P 与 Y ~ Q 还满足 <mu_P, mu_Q> = E[k(X,Y)]。
Kernel Mean Embedding 综述系统说明了边缘与条件 Embedding、理论假设和应用。Characteristic Kernel 才能在指定定义域上令概率测度到 Embedding 的映射为单射;只有 Positive Definiteness 并不能保证这一点。
无需显式构造 RKHS 即可估计
给定 n 个观测,mu_P 的经验估计为 mu_hat = (1/n) sum_i k(x_i, .)。该对象可以是无限维的,但它在 Probe 上的值、与另一个 Embedding 的内积或范数,都能化成有限 Kernel Sum。
估计默认样本能够代表目标总体。Survey Weight 不等、时间依赖、Clustered Observation、Censoring、重复记录或 Adaptive Collection 都需要相应估计器与不确定性分析;把每一行静默当作 IID 会改变 Estimand。
审计可识别性、不确定性与计算成本
有限维或非 Characteristic Kernel 可能只保留部分矩,因此相同 Embedding 不一定表示分布相同。即便使用 Characteristic Kernel,较小的经验距离也可能来自低检验功效、不合适的 Bandwidth 或有限支持范围,而不是具有业务意义的等价。
精确 Gram Matrix 操作通常需要二次存储或计算。只有在目标统计量上测量近似误差后,才能采用 Block Computation、Low-rank Method 或显式 Random Feature;若 Embedding 参与模型选择,还要隔离 Train、Calibration 与 Evaluation Sample。
主要特点
- 把概率测度映射为 RKHS 中的期望特征表示
- 通过 Kernel Evaluation 计算期望与分布内积
- 只有满足 Characteristic-kernel 条件时才能识别分布
- 经验平均的不确定性取决于真实采样机制
- 直接连接 MMD、HSIC、条件嵌入与分布学习
- 未经近似时 Kernel 计算可能具有二次成本
常见用途
- 把 Bag、Cohort 或分布作为下游模型输入
- 构建非参数两样本与独立性统计量
- 监控参考特征分布与线上特征分布的变化
- 无需密度拟合地比较生成器、模拟器或实验总体
- 在明确假设下支持条件分布与因果推断方法
示例
Loading code...常见问题
核均值嵌入保留了分布的哪些信息?
它保留所选 RKHS 函数的期望。如果 Kernel 在相关定义域上是 Characteristic,Population Embedding 能唯一识别分布;若 Kernel 较弱,不同分布可能得到相同 Embedding。
核均值嵌入就是普通特征均值吗?
它确实是 Feature Map 的期望,但 Feature Space 可以是无限维且隐式存在。实际计算通常使用 Kernel Identity,而不是构造坐标;有限维 Explicit Feature Approximation 会改变表示并引入近似误差。
核均值嵌入与 MMD 有什么关系?
MMD 是两个 Mean Embedding 之间的 RKHS 距离。Embedding 负责表示每个分布,MMD 把两种表示之差变成统计量或 Discrepancy;若要做显著性判断,还必须校准零假设分布。
经验嵌入距离为零能证明两个分布相同吗?
不能。精确可识别性是 Population 层面的结论,还要求合适的 Kernel。有限样本结果可能因低功效、Bandwidth、依赖、权重或采样噪声而接近零,必须同时报告不确定性和检验设计。
核均值嵌入如何扩展到大数据集?
可以使用 Block Kernel Computation、Subsampling、Nyström Method 或 Random Feature。每种近似都会改变方差、偏差或实际表示的 Kernel,应先在代表性子集上对照精确结果,并固定推理时使用的映射。