什么是 最大均值差异(MMD)?
最大均值差异(MMD)是一种积分概率度量,它衡量所选函数类上的最大期望差;当函数类是 RKHS 单位球时,它等于两个 Kernel Mean Embedding 之间的距离。
快速了解
| 全称 | Maximum Mean Discrepancy |
|---|---|
| 创建时间 | Gretton 等人在 2006 至 2012 年间将其发展为 Kernel Two-sample Method |
| 规范文档 | 官方规范 |
工作原理
区分差异度量与假设检验
Population Discrepancy 为 sup_{||f||_H <= 1} |E_P[f] - E_Q[f]|,等价于 ||mu_P - mu_Q||_H。使用 Characteristic Kernel 时,它为零当且仅当指定定义域上的两个总体分布相同。
Kernel Two-sample Test 原论文使用经验 MMD Statistic 并校准拒绝阈值。较大分数本身不是 P-value,未拒绝零假设也不能证明两个分布具有业务意义上的等价性。
明确估计器与零假设校准
Biased V-statistic 包含 Kernel Matrix 对角项且保持非负。Unbiased U-statistic 移除样本内对角项,对 Population MMD Squared 无偏,但有限样本结果可以为负。Linear-time 与 Incomplete Estimator 用更多方差换取较低计算成本。
Permutation Calibration 依赖零假设下的 Exchangeability。时间序列、重复用户、配对样本、Cluster、Survey Weight 或 Adaptive Window 都不允许直接打乱数据行。应采用保留设计的 Bootstrap 或 Permutation,并报告 Estimator、重采样单元、次数与随机种子。
验证 Kernel、统计功效与监控策略
Kernel Bandwidth 决定检验能够感知的差异尺度。过窄 Kernel 强调近重复样本,过宽 Kernel 则接近粗粒度均值比较。Median-distance Heuristic 只能作为起点,不能证明对目标变化具有足够灵敏度。
应在具有实际意义的合成变化上估计 Power,加入 No-change Control,并通过校正或预定义聚合规则检查多个 Bandwidth。漂移监控还需处理 Repeated Testing、Reference-window Reuse、Delayed Label、Alert Cooldown,以及检测到的变化是否真正影响模型效用。
主要特点
- 衡量两个 RKHS 均值嵌入之间的距离
- 无需显式估计概率密度
- 只有合适的 Characteristic Kernel 才能识别任意分布差异
- 具有 Biased、Unbiased、Linear-time 与 Incomplete 估计器
- 形成统计检验时需要校准零假设分布
- 对 Bandwidth、预处理、依赖关系与样本量敏感
常见用途
- 检验两个独立样本是否来自相同分布
- 监控多变量特征或 Embedding 漂移
- 将生成或模拟样本与参考总体比较
- 在 Domain Adaptation 中定义分布对齐损失
- 在密度估计不可行时比较实验 Cohort
示例
Loading code...常见问题
最大均值差异具体衡量什么?
MMD 衡量所选 RKHS 单位球上的最大期望差,等价于两个 Kernel Mean Embedding 的距离。它只能检测 Kernel 所支持结构与尺度上的差异,不能脱离 Kernel 解释。
MMD 是距离还是统计检验?
Population MMD 是 Discrepancy,在 Characteristic Kernel 下可构成分布上的 Metric。经验 MMD 只有在明确零假设、Estimator、阈值校准、显著性水平与采样假设后,才构成完整检验。
为什么无偏 MMD Squared 可能为负?
Unbiased U-statistic 会移除对角 Self-similarity,使其期望等于 Population MMD Squared。有限样本波动仍可能令估计值为负,尽管总体量非负;统计推断前不应静默截断为零。
MMD 的 RBF Bandwidth 应如何选择?
应围绕真正重要的变化尺度选择,并在预定义范围内做敏感性分析。Median Heuristic 是基线,但在高维或异质数据上可能失去功效;不能根据 Test Outcome 反复选带宽而不做校正。
只用 MMD 能诊断有害模型漂移吗?
不能。MMD 能发现分布差异,却不能解释原因或业务影响。还需结合 Feature Slice、模型性能或标签分析、Reference Quality、重复检验控制,以及与运营风险绑定的响应策略。