什么是 扩散映射?
扩散映射是一种非线性降维方法,它把样本 Affinity 转换为 Markov Transition Operator,并使用按所选 Diffusion Time 加权的 Eigenfunction 表示样本。
快速了解
| 全称 | Diffusion Maps |
|---|---|
| 创建时间 | 由 Ronald Coifman 与 Stephane Lafon 于 2005 至 2006 年建立 |
| 规范文档 | 官方规范 |
工作原理
把局部 Affinity 转换为扩散算子
常见构造从 K_ij = exp(-||x_i-x_j||^2 / epsilon) 等正 Kernel 开始。可选的 Alpha Normalization 用来调整采样密度影响,随后按行归一化得到 Transition Matrix P。t 步矩阵 P^t 描述概率质量如何在样本图中传播。
原始扩散映射论文说明不同 Normalization 会逼近不同连续算子。把所有 Gaussian-kernel Eigendecomposition 都称为 Diffusion Map,会掩盖密度与算子定义之间的差别。
把 Diffusion Distance 与时间写进契约
Diffusion Distance 比较从两个样本出发,在 t 步后得到的完整转移分布,并按 Stationary Measure 加权。即使没有一条直接边占主导,多条高概率路径也能使两点接近。保留足够模态时,谱坐标 lambda_l^t psi_l(x) 可以复现该距离。
较小 t 强调细粒度局部结构,较大 t 会抑制快速衰减模态,突出更粗粒度的连通性。因此 Time 是分辨率参数,不只是迭代次数;应结合特征值衰减、Implied Timescale 与任务要求选择。
审计 Bandwidth、密度与扩展行为
Bandwidth 太小会使图碎裂,太大则会抹平 Barrier 并连接原本遥远的区域。应检查 Degree 和 Kernel Distribution、Connected Component、Stationary Mass、Eigenvalue Gap,以及不同 Bandwidth 和 Time 下的稳定性与留出关系的 Diffusion-distance Preservation。
datafold 等实现加入 Sparse Kernel 与 Out-of-sample Extension。Nyström 或 Geometric-harmonics Extension 依赖冻结的 Kernel 与已覆盖邻域,不能当成对漂移样本的可靠外推器。
主要特点
- 从局部 Kernel Affinity 构建 Markov Transition Operator
- 通过多步扩散路径分布度量样本相似性
- 用 Eigenvalue 控制尺度并以 Eigenvector 构造坐标
- 可通过明确的 Alpha 选择调整采样密度影响
- 强依赖 Metric、Bandwidth、图稀疏度与 Diffusion Time
- 处理新样本需要明确的扩展或重建策略
常见用途
- 发现含噪采样流形中的多尺度连通结构
- 表示分子、物理或生物过程的转移坐标
- 在聚类或回归前构建几何感知特征
- 比较随机游走连通性、最短路径与拉普拉斯表示
- 研究跨 Kernel Scale 是否存在稳定慢模态
示例
Loading code...常见问题
Diffusion Distance 衡量什么?
它比较从两个样本出发、经过指定步数后到达各图节点的概率分布。当两点通过相似的多条路径连接到图中其他区域时,即使它们的直接 Euclidean Distance 不小,Diffusion Distance 也可以很近。
Diffusion Time t 控制什么?
它控制表示分辨率。较小 Time 保留细粒度局部差异,较大 Time 则衰减较小 Eigenvalue 对应的模态,强调更慢、更粗的连通结构。应依据稳定尺度与任务证据选择,而不能当作视觉参数。
扩散映射与拉普拉斯特征映射有什么区别?
两者都分解图导出的算子。Laplacian Eigenmaps 直接最小化 Graph Dirichlet Energy;Diffusion Maps 则定义 Markov Process、Stationary Measure、Diffusion Time 与 Diffusion Distance,因此 Normalization 和坐标缩放可能表达不同几何。
如何选择 Kernel Bandwidth?
应在预先规定的范围内检查图连通性、Degree 与 Distance Distribution、Eigenvalue Stability、关系保留和下游指标。Variable-bandwidth Kernel 可缓解密度偏差,但也会增加一个估计量,且不能修复错误 Metric。
扩散映射等同于生成式扩散模型吗?
不等同。扩散映射是在观测样本图上构建 Markov Operator 的谱流形学习方法;生成式扩散模型学习逆向去噪过程来合成数据。两者共享随机过程词汇,但解决的问题完全不同。