什么是 局部线性嵌入(LLE)?

局部线性嵌入(LLE)是先用邻近样本重构每个点,再让一组共享低维坐标保持相同重构权重的非线性降维方法。

快速了解

创建时间2000 年由 Sam Roweis 与 Lawrence Saul 提出
规范文档官方规范

工作原理

先冻结局部重构权重再求 Embedding

对每个样本 x_i,LLE 选择近邻,并在权重之和为一的约束下最小化平方重构误差。该约束使权重对共同平移保持不变,并在标准欧氏定义下对旋转与统一缩放保持不变;接近奇异的局部协方差矩阵则需要显式正则化。

LLE 原始论文随后冻结这些权重,寻找最小化对应低维重构误差的坐标。其解来自 (I - W)^T(I - W) 最小的非平凡特征向量,并丢弃代表整体平移的常数零模式。

让邻域大小匹配局部维度与采样

邻居太少会形成噪声较大的局部片段或断连图;邻居太多会跨越曲率与折叠,或使局部协方差秩不足。输出维度还必须低于可用 Neighborhood Rank。应检查 Connected Component、邻居距离、重构权重、Condition Number,以及对 n_neighbors 和 Regularization 的敏感性。

当前 scikit-learn 文档提供 Standard、Modified、Hessian 与 Local Tangent Space Alignment 变体。它们处理的几何或正则问题不同,不能当作可随意互换的参数值。

区分重构质量与语义有效性

较小 LLE Reconstruction Error 只说明所选低维坐标保留了拟合得到的局部线性权重,不能证明可见分组就是类别、全局距离有意义,或流形假设能够外推到样本之外。

应组合邻域 Trustworthiness 与 Continuity、重构误差、重复拟合、图扰动和下游指标。Out-of-sample 方法通常用训练近邻重构新点,再组合其冻结坐标;当新点位于采样支持之外或分布漂移时,这种插值可能严重失真。

主要特点

  • 用局部近邻上的和为一权重表示每个样本
  • 在统一低维地图中保持这些重构权重
  • 通过稀疏特征问题求解并丢弃常数零模式
  • 借助权重约束对部分全局几何变换保持不变
  • 强依赖邻域尺度、采样密度、秩与正则化
  • 保留局部线性关系而非全局距离或类别标签

常见用途

  1. 展开局部近似线性且采样稠密的流形
  2. 把局部几何结果与 Isomap 和图 Embedding 比较
  3. 可视化受控姿态或关节变化
  4. 检查局部仿射重构能否经受降维
  5. 选择生产表示前测试邻域敏感性

示例

loading...
Loading code...

常见问题

局部线性嵌入究竟保留什么?

它保留每个训练样本由所选近邻重构时得到的和为一权重,不直接保留全部成对距离、密度、全局方向或类别边界。图形看起来相邻,只能说明拟合局部关系在该坐标中得到表达。

LLE 与 Isomap 有什么区别?

Isomap 用图最短路径估计全局测地距离,再嵌入整个距离矩阵;LLE 保留局部仿射重构权重并求解稀疏特征问题。两者都依赖 Neighbor Graph,但保持量和失效模式不同。

LLE 为什么需要正则化?

邻居冗余、维度采样不足或邻域过大时,局部协方差矩阵可能奇异或病态。按 Trace 缩放的正则项可以稳定权重求解,但它也改变了拟合的局部几何,因此必须记录并做敏感性检查。

LLE 的 n_neighbors 应如何选择?

邻居数要足以估计目标局部维度并维持连通,又不能大到跨越曲率或折叠。应在预先声明的范围内比较重构误差、Condition Number、连通分量、Trustworthiness 与重采样稳定性。

LLE 能把新点放进已有 Embedding 吗?

常见扩展先从训练集找到新点近邻,求出重构权重,再对这些近邻的已存低维坐标加权。该插值在采样支持之外并不可靠,而且必须复用冻结的预处理、Metric 与参考数据。

相关术语

相关文章