什么是 标准化互信息(NMI)?

标准化互信息(NMI)是把两套硬聚类分配之间的互信息除以已声明的熵函数,用于衡量划分信息一致性的对称指标。

快速了解

规范文档官方规范

工作原理

声明归一化、对数底和退化约定

采用算术平均归一化时,NMI=2I(U;V)/(H(U)+H(V));其他合法变体在有限样本上会得到不同结果。只有所有项使用相同底数时,对数底才会在比值中抵消。两套划分都只有一个簇时,两边熵都为 0,常见实现会把相同常量划分定义为 1。报告必须写明公式与库设置。

不要把归一化误认为机会校正

Vinh、Epps 与 Bailey系统分析了信息论聚类比较指标,并说明当样本量相对簇数较小时进行机会校正的重要性。NMI 只是缩放 MI,细粒度随机划分仍可能得到较高值;Adjusted Mutual Information 会在声明的随机模型下扣除期望 MI,回答的是另一问题。

NMI 与 ARI 分歧时检查列联表

当前 scikit-learn 文档提供算术、几何、最小与最大熵归一化,并确认对称性和标签置换不变性。NMI 衡量熵减少,ARI 统计样本对;把一个大类拆成多个纯子簇时,两者可能给出不同判断。列联表能揭示差异来自拆分、合并还是规模偏斜。

主要特点

  • 衡量两套对齐硬划分共享的信息量
  • 不受聚类标签值任意置换影响
  • 同一归一化方式下交换两套划分后分数不变
  • 必须声明熵归一化分母和退化情况约定
  • 通常位于 0 到 1,但没有进行机会校正
  • 不要求两边簇数相同或先做一对一标签匹配

常见用途

  1. 比较文档聚类与编辑分类体系
  2. 衡量不同社区发现划分之间的一致性
  3. 检查不同运行或数据扰动下的聚类稳定性
  4. 评估簇数不同的两套划分
  5. 与 ARI、AMI 一起报告信息论聚类指标

示例

loading...
Loading code...

常见问题

标准化互信息如何计算?

先为两套对齐划分构造列联表,根据联合概率与边缘概率计算互信息,再除以已声明的熵归一化分母。采用算术平均时,公式为 `2I(U;V)/(H(U)+H(V))`。

NMI 只有一种标准公式吗?

不是。常见实现会使用最小值、最大值、几何平均、算术平均或联合熵归一化 MI。这些变体整体行为相似,但返回值可能不同,因此比较时必须使用相同公式和实现。

NMI 与 AMI 有什么区别?

NMI 把互信息缩放到有界区间,但不会移除偶然一致。Adjusted Mutual Information 会在随机划分模型下扣除期望 MI;样本量较小或候选簇数不同的场景,AMI 通常更适合作为比较证据。

NMI 与调整兰德指数有什么区别?

NMI 衡量标签熵减少,ARI 衡量经过机会校正的样本对一致。两者都忽略标签名,但对拆分、合并和簇规模的权重不同。结果分歧时应同时报告并检查列联表。

高 NMI 能证明聚类语义正确吗?

不能。它只说明两套划分共享信息。参考划分可能有噪声或表达另一种合理分组,细粒度划分也可能抬高未校正 NMI。还需增加机会校正、稳定性、领域和下游效果证据。

相关术语

相关文章