什么是 标准化互信息(NMI)?
标准化互信息(NMI)是把两套硬聚类分配之间的互信息除以已声明的熵函数,用于衡量划分信息一致性的对称指标。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
声明归一化、对数底和退化约定
采用算术平均归一化时,NMI=2I(U;V)/(H(U)+H(V));其他合法变体在有限样本上会得到不同结果。只有所有项使用相同底数时,对数底才会在比值中抵消。两套划分都只有一个簇时,两边熵都为 0,常见实现会把相同常量划分定义为 1。报告必须写明公式与库设置。
不要把归一化误认为机会校正
Vinh、Epps 与 Bailey系统分析了信息论聚类比较指标,并说明当样本量相对簇数较小时进行机会校正的重要性。NMI 只是缩放 MI,细粒度随机划分仍可能得到较高值;Adjusted Mutual Information 会在声明的随机模型下扣除期望 MI,回答的是另一问题。
NMI 与 ARI 分歧时检查列联表
当前 scikit-learn 文档提供算术、几何、最小与最大熵归一化,并确认对称性和标签置换不变性。NMI 衡量熵减少,ARI 统计样本对;把一个大类拆成多个纯子簇时,两者可能给出不同判断。列联表能揭示差异来自拆分、合并还是规模偏斜。
主要特点
- 衡量两套对齐硬划分共享的信息量
- 不受聚类标签值任意置换影响
- 同一归一化方式下交换两套划分后分数不变
- 必须声明熵归一化分母和退化情况约定
- 通常位于 0 到 1,但没有进行机会校正
- 不要求两边簇数相同或先做一对一标签匹配
常见用途
- 比较文档聚类与编辑分类体系
- 衡量不同社区发现划分之间的一致性
- 检查不同运行或数据扰动下的聚类稳定性
- 评估簇数不同的两套划分
- 与 ARI、AMI 一起报告信息论聚类指标
示例
Loading code...常见问题
标准化互信息如何计算?
先为两套对齐划分构造列联表,根据联合概率与边缘概率计算互信息,再除以已声明的熵归一化分母。采用算术平均时,公式为 `2I(U;V)/(H(U)+H(V))`。
NMI 只有一种标准公式吗?
不是。常见实现会使用最小值、最大值、几何平均、算术平均或联合熵归一化 MI。这些变体整体行为相似,但返回值可能不同,因此比较时必须使用相同公式和实现。
NMI 与 AMI 有什么区别?
NMI 把互信息缩放到有界区间,但不会移除偶然一致。Adjusted Mutual Information 会在随机划分模型下扣除期望 MI;样本量较小或候选簇数不同的场景,AMI 通常更适合作为比较证据。
NMI 与调整兰德指数有什么区别?
NMI 衡量标签熵减少,ARI 衡量经过机会校正的样本对一致。两者都忽略标签名,但对拆分、合并和簇规模的权重不同。结果分歧时应同时报告并检查列联表。
高 NMI 能证明聚类语义正确吗?
不能。它只说明两套划分共享信息。参考划分可能有噪声或表达另一种合理分组,细粒度划分也可能抬高未校正 NMI。还需增加机会校正、稳定性、领域和下游效果证据。