什么是 最大均值差异(MMD)?

最大均值差异(MMD)是一种积分概率度量,它衡量所选函数类上的最大期望差;当函数类是 RKHS 单位球时,它等于两个 Kernel Mean Embedding 之间的距离。

快速了解

全称Maximum Mean Discrepancy
创建时间Gretton 等人在 2006 至 2012 年间将其发展为 Kernel Two-sample Method
规范文档官方规范

工作原理

区分差异度量与假设检验

Population Discrepancy 为 sup_{||f||_H <= 1} |E_P[f] - E_Q[f]|,等价于 ||mu_P - mu_Q||_H。使用 Characteristic Kernel 时,它为零当且仅当指定定义域上的两个总体分布相同。

Kernel Two-sample Test 原论文使用经验 MMD Statistic 并校准拒绝阈值。较大分数本身不是 P-value,未拒绝零假设也不能证明两个分布具有业务意义上的等价性。

明确估计器与零假设校准

Biased V-statistic 包含 Kernel Matrix 对角项且保持非负。Unbiased U-statistic 移除样本内对角项,对 Population MMD Squared 无偏,但有限样本结果可以为负。Linear-time 与 Incomplete Estimator 用更多方差换取较低计算成本。

Permutation Calibration 依赖零假设下的 Exchangeability。时间序列、重复用户、配对样本、Cluster、Survey Weight 或 Adaptive Window 都不允许直接打乱数据行。应采用保留设计的 Bootstrap 或 Permutation,并报告 Estimator、重采样单元、次数与随机种子。

验证 Kernel、统计功效与监控策略

Kernel Bandwidth 决定检验能够感知的差异尺度。过窄 Kernel 强调近重复样本,过宽 Kernel 则接近粗粒度均值比较。Median-distance Heuristic 只能作为起点,不能证明对目标变化具有足够灵敏度。

应在具有实际意义的合成变化上估计 Power,加入 No-change Control,并通过校正或预定义聚合规则检查多个 Bandwidth。漂移监控还需处理 Repeated Testing、Reference-window Reuse、Delayed Label、Alert Cooldown,以及检测到的变化是否真正影响模型效用。

主要特点

  • 衡量两个 RKHS 均值嵌入之间的距离
  • 无需显式估计概率密度
  • 只有合适的 Characteristic Kernel 才能识别任意分布差异
  • 具有 Biased、Unbiased、Linear-time 与 Incomplete 估计器
  • 形成统计检验时需要校准零假设分布
  • 对 Bandwidth、预处理、依赖关系与样本量敏感

常见用途

  1. 检验两个独立样本是否来自相同分布
  2. 监控多变量特征或 Embedding 漂移
  3. 将生成或模拟样本与参考总体比较
  4. 在 Domain Adaptation 中定义分布对齐损失
  5. 在密度估计不可行时比较实验 Cohort

示例

loading...
Loading code...

常见问题

最大均值差异具体衡量什么?

MMD 衡量所选 RKHS 单位球上的最大期望差,等价于两个 Kernel Mean Embedding 的距离。它只能检测 Kernel 所支持结构与尺度上的差异,不能脱离 Kernel 解释。

MMD 是距离还是统计检验?

Population MMD 是 Discrepancy,在 Characteristic Kernel 下可构成分布上的 Metric。经验 MMD 只有在明确零假设、Estimator、阈值校准、显著性水平与采样假设后,才构成完整检验。

为什么无偏 MMD Squared 可能为负?

Unbiased U-statistic 会移除对角 Self-similarity,使其期望等于 Population MMD Squared。有限样本波动仍可能令估计值为负,尽管总体量非负;统计推断前不应静默截断为零。

MMD 的 RBF Bandwidth 应如何选择?

应围绕真正重要的变化尺度选择,并在预定义范围内做敏感性分析。Median Heuristic 是基线,但在高维或异质数据上可能失去功效;不能根据 Test Outcome 反复选带宽而不做校正。

只用 MMD 能诊断有害模型漂移吗?

不能。MMD 能发现分布差异,却不能解释原因或业务影响。还需结合 Feature Slice、模型性能或标签分析、Reference Quality、重复检验控制,以及与运营风险绑定的响应策略。

相关术语

相关文章