什么是 谱聚类(Spectral Clustering)?

谱聚类(Spectral Clustering)是使用相似图拉普拉斯矩阵的特征向量嵌入样本,再对低维行向量进行划分的图聚类方法。

快速了解

规范文档官方规范

工作原理

把相似图视为主要模型

Ng、Jordan 与 Weiss构造 RBF Affinity Matrix,按节点度归一化,取主要特征向量,对各 Row 归一化后再聚类。近邻图是另一常见选择。Distance 不等于 Affinity:较大图权重必须表示更强相似性,孤立节点也必须有明确处理策略。

解释子空间与 Eigengap,而不是单独坐标轴

重复或近似重复特征值对应的 Eigenvector 可以旋转或改变符号,但表示的 Subspace 不变,因此单个坐标没有稳定语义。Eigengap 可以描述所选子空间与下一方向的分离程度,却不能证明相似图或目标簇数正确。

预算图构建、特征分解与推理成本

当前 scikit-learn 文档支持 RBF、近邻和预计算 Affinity,并提供多种最终标签分配方式。稠密 Affinity Matrix 需要二次存储,Eigensolver 可能主导运行时间,标准结果还是传导式的;新样本需要 Nyström 扩展、独立分类器或版本化重建。

主要特点

  • 把样本表示为带权相似图中的节点
  • 使用归一化邻接矩阵或图拉普拉斯的特征向量
  • 能暴露由局部相似性连接的非凸分组
  • 需要独立规则划分谱嵌入后的样本行
  • 高度依赖图构造与特征求解器选择
  • 通常是传导式方法,且可能需要二次图存储

常见用途

  1. 分离嵌套或流形形状的样本组
  2. 划分带权图与相似网络
  3. 基于稀疏近邻图聚类图像或文档
  4. 对比图方法、质心方法与密度方法
  5. 探索具有可靠 Affinity 的中小规模数据集

示例

loading...
Loading code...

常见问题

谱聚类如何工作?

先构造相似图,归一化其邻接矩阵或拉普拉斯矩阵,提取选定的特征子空间,并在需要时归一化样本行,最后划分这些 Row。每种图和归一化约定都定义了不同模型。

为什么谱聚类能发现非凸簇?

它根据相似图中的连通性分组,而不是只看原空间到单个质心的距离。特征向量嵌入可以把嵌套或弯曲的连通区域转换成更容易分开的群组。

Affinity Graph 应如何构造?

使用与任务一致的非负对称相似度,例如 RBF Kernel 或对称化近邻图。应在验证证据上选择 Kernel Width 或 Neighbor Count,并定义断开分量、重复边与孤立节点策略。

Eigengap 能确定真实簇数吗?

不能。它可以表明某种图构造下谱子空间较稳定,但图超参数也能制造或消除 Gap。还需组合扰动稳定性、候选划分、领域审查和下游结果。

谱聚类能为未见样本直接分配簇吗?

标准算法是传导式的,因为特征向量定义在拟合图上。新记录需要显式扩展方案,例如 Nyström Approximation、在谱标签上训练分类器,或执行版本化图重建。

相关术语

相关文章