什么是 截断奇异值分解(Truncated SVD)?

截断奇异值分解(Truncated SVD)是只计算或保留矩阵最大的若干奇异值及其左右奇异向量,以构造有限秩近似的矩阵分解方法。

快速了解

全称Truncated Singular Value Decomposition
创建时间1936 年由 Eckart 与 Young 建立低秩近似定理;1990 年用于 LSA
规范文档官方规范

工作原理

区分数学目标与求解器

数学目标是由领先奇异三元组构成秩 k 近似。精确 Dense SVD、ARPACK 等 Krylov Eigensolver 与 Randomized Range Finding 是估计该目标的不同方法。随机化矩阵分解框架会先捕获近似 Range,把矩阵压缩到该子空间,再确定性地完成小矩阵分解。

应记录 Solver、Seed、Oversampling、Power Iteration、Tolerance、Component Sign 与 Rank。Spectrum 衰减缓慢时可能需要更多迭代或过采样;奇异值近似并列时,单个坐标轴会不稳定,但联合子空间仍可能可靠。

明确保留稀疏文本几何

当前 scikit-learn TruncatedSVD 文档强调该实现不会中心化输入,因此能高效处理 Sparse Matrix。它应用于 Term Count 或 TF-IDF Matrix 时,通常称为 Latent Semantic Analysis。

LSA 原始论文用 SVD 近似词项与文档关联。学得的 Factor 仍是由 Vocabulary、Weighting 与 Corpus Composition 决定的线性组合,不会自动成为语义连贯的 Topic,也不等同于现代上下文 Embedding。

用重构与任务证据选择 Rank

更大的 k 会降低训练重构误差,也会增加内存、延迟与弱信号或噪声暴露。未中心化转换上的 Explained Variance 字段属于实现诊断;如果没有核对定义,不能把它直接解释成 PCA 的中心化协方差结果。

Vocabulary、Weighting 与 Decomposition 都只能在训练数据上拟合。应检查留出集重构、检索或聚类指标、不同 Seed 与语料采样下的稳定性,以及低频词表现。将拟合 Projection 与 Vocabulary、预处理版本一起保存,确保新行进入同一空间。

主要特点

  • 只保留最大的若干奇异值与左右奇异向量
  • 精确结果在常用矩阵范数下提供最优有限秩近似
  • 常见实现不中心化输入,因此可高效处理稀疏矩阵
  • 支持精确、迭代或随机化 Solver,并有不同精度与复现控制
  • 输出线性潜在因子,其符号和近似并列坐标轴并不唯一
  • 必须结合留出重构与真实下游目标选择 Rank

常见用途

  1. 压缩稀疏 TF-IDF 文档矩阵并执行潜在语义分析
  2. 在聚类或检索实验前建立低秩基线
  3. 在明确缺失值语义后压缩用户与物品交互矩阵
  4. 为存储或后续数值计算近似稠密矩阵
  5. 检查 Spectrum 衰减和有效低秩结构

示例

loading...
Loading code...

常见问题

Truncated SVD 与 PCA 有什么区别?

PCA 会在特征中心化后执行 SVD 或特征分解。常见 Truncated SVD Transformer 直接分解未中心化输入,因此能保留稀疏存储,但成分含义不同。只有中心化与投影约定兼容时,两者才会一致。

为什么稀疏文本矩阵常用 Truncated SVD?

减去每列均值通常会把稀疏 Term-document Matrix 变成稠密矩阵。Truncated SVD 可以直接处理未中心化稀疏输入,在较低内存成本下得到用于潜在语义分析的线性低维表示。

Truncated SVD 的成分数量应该如何选择?

在留出集上比较多个 Rank 的重构误差和真实检索、聚类或预测指标,同时记录内存与延迟。Spectrum 衰减可作为背景,但固定 Explained Variance 阈值不能保证语义质量。

随机化 Truncated SVD 为什么每次结果可能不同?

随机化 Solver 会采样近似矩阵 Range,因此 Seed、Oversampling、Power Iteration 与 Spectrum 都会影响结果。应固定并记录这些设置,比较子空间和下游行为,而不是要求每个 Component 的符号完全相同。

Truncated SVD 就是潜在语义分析吗?

不是。Truncated SVD 是通用矩阵运算;LSA 是把它应用到加权 Term-document Matrix,并把低秩因子作为潜在关联的文本检索方法。这些因子不会自动形成有名称或语义连贯的 Topic。

相关术语

相关文章