什么是 高斯混合模型(GMM)?

高斯混合模型(GMM)是把观测分布表示为多个带权高斯成分之和,并为每条观测计算对各成分后验责任度的概率密度模型。

快速了解

规范文档官方规范

工作原理

用 EM 交替更新责任度与参数

Dempster、Laird 与 Rubin系统化了不完整数据似然下的 Expectation-Maximization。对 GMM,E-step 计算每条样本对各成分的后验 Responsibility,M-step 再用加权观测更新权重、均值和协方差。似然不会下降,但过程可能停在局部最优或 Stationary Point。

在协方差奇异前设置约束

某个成分可能收缩到极少样本,使协方差行列式趋近 0,并让似然趋向无界奇点。生产拟合需要 Covariance Regularization、最小有效成分质量、有限值检查、多次初始化,以及明确的 Spherical、Diagonal、Tied 或 Full Covariance Family。

分别选择成分数并验证密度

当前 scikit-learn 文档区分多种协方差结构,并支持在各自假设下使用 AIC 或 BIC 选择成分数。还应比较留出 Log Likelihood、责任度校准、稳定性与下游用途。Label Switching 在数学上无害,但跨版本监控前必须完成成分匹配。

主要特点

  • 把概率密度建模为有限个带权高斯成分之和
  • 为每个样本输出总和为 1 的后验责任度
  • 使用 EM 或其他估计器处理潜在成分归属
  • 支持球形、对角、共享或完整协方差结构
  • 可能收敛到局部解或出现协方差奇异
  • 区分概率成分与可选的硬聚类标签

常见用途

  1. 在归属存在歧义时执行软聚类
  2. 估计连续多变量观测的概率密度
  3. 建模具有不同协方差结构的椭圆分组
  4. 生成基于似然的异常候选
  5. 为 K-Means 提供概率模型对照基线

示例

loading...
Loading code...

常见问题

高斯混合模型如何为样本分配成分?

它根据成分权重与高斯密度,为每条样本计算对每个成分的后验责任度,这些概率之和为 1。硬 Cluster Label 只是可选的 `argmax` 决策,会丢弃其余不确定性。

GMM 与 K-Means 有什么区别?

K-Means 最小化平方距离并输出最近质心硬分配;GMM 建模概率密度,估计混合权重和协方差,并输出软责任度。只有在球形、等协方差等限制条件下,两者行为才可能接近。

EM 能保证找到最佳高斯混合模型吗?

不能。EM 不会降低似然,但可能停在由初始化决定的局部最优或 Stationary Point。应执行多次初始化,记录收敛状态,比较留出证据,并拒绝坍缩或不稳定成分。

为什么高斯混合似然会出现奇异问题?

某个成分可以收缩到一条或极少样本,使协方差行列式趋近 0、密度任意增大。必须使用协方差下限或先验、最小成分质量和有限值检查进行约束。

高斯成分数量应如何选择?

在预先声明的范围内比较留出 Log Likelihood、AIC 或 BIC 及其假设、责任度质量、稳定性和下游用途。拟合出的高斯成分数量不一定等于真实语义分组数量。

相关术语

相关文章