什么是 支持向量机(SVM)?
支持向量机(SVM)是一种监督学习方法,它在类别之间选择具有较大间隔的决策边界,并把约束该间隔的训练样本作为支持向量。
快速了解
| 全称 | Support Vector Machine |
|---|---|
| 创建时间 | 1995 年由 Corinna Cortes 与 Vladimir Vapnik 提出 |
| 规范文档 | 官方规范 |
工作原理
按明确约定优化间隔目标
对取值为 {-1,+1} 的二分类标签 y_i,Functional Margin 为 y_i(w^T x_i+b)。Hard-margin Problem 要求所有间隔至少为一并最小化 ||w||^2;数据重叠或含噪声时,Soft-margin Form 会为违反约束的 Slack 增加惩罚。
原始支持向量网络论文给出了最大间隔与 Kernel 构造。不同 Library 对 Loss Normalization、Intercept Regularization、Class Weight 以及 C 乘以 Loss Sum 还是 Mean 的约定不同,脱离完整目标直接迁移参数没有意义。
由支持向量确定拟合边界
Karush-Kuhn-Tucker 条件表明,只有 Dual Coefficient 非零的样本会直接进入 Kernel Expansion。Linear Model 可以由这些 Coefficient 重建 Weight Vector;Nonlinear Model 的每次预测则需要对保留的 Support Vector 计算 Kernel。
较高的 Support-vector Fraction 可能来自类别重叠、Feature 较弱、Kernel 过于灵活或激进的正则化选择,也会增加推理延迟与模型体积。Support Vector 只是拟合目标下具有影响力的训练样本,不必然是错误标签或因果解释。
联合验证预处理、决策与运行成本
Feature Scale 会显著改变 Euclidean Distance、Dot Product 和 RBF Bandwidth。Scaling、Feature Selection、Kernel Parameter、C 与 Class Weight 都必须在每个 Training Fold 内拟合和选择;需要评估模型选择流程时,应使用 Nested 或从未参与调参的数据。
当前 scikit-learn SVM 指南指出,常见实现的训练成本至少随样本数二次增长。Decision Score 是有符号距离或 Kernel-expansion Value,不是概率;概率输出需要单独拟合校准步骤并在独立数据上验证。
主要特点
- 在惩罚允许违反约束的同时最大化几何间隔
- 通过支持向量表示拟合后的决策边界
- 支持线性核与有效的 Positive-semidefinite Kernel
- 用 C 平衡间隔正则化和训练惩罚
- 默认输出 Decision Score 而非校准概率
- 在大样本集上可能承担二次或更高训练成本
常见用途
- 分类高维文本或稀疏特征向量
- 在中小型数据上构建非线性分类器
- 在使用大型神经网络前建立最大间隔基线
- 通过验证后的 Sample Weight 或 Class Weight 处理不同错误成本
- 比较 Exact Kernel、Linear Model 与显式近似特征
示例
Loading code...常见问题
支持向量机最大化的是什么?
Binary SVM 在其 Hard-margin 或 Soft-margin Objective 下最大化几何分隔。常见 Soft-margin Form 在较小 Weight Norm 与间隔内或边界错误一侧样本的惩罚之间进行权衡。
支持向量机中的 C 控制什么?
C 在特定 Objective Convention 下控制训练违反项的相对代价。较大 C 通常更强地惩罚违反约束并产生更紧、更弱正则的拟合;较小 C 通常接受更多违反以换取更宽或更平滑的间隔。
为什么训练 SVM 前需要缩放特征?
数值尺度较大的 Feature 会主导 Dot Product 和距离型 Kernel,从而改变间隔与 Kernel Bandwidth。Scaler 只能在每个 Training Fold 上拟合,再原样应用到验证集与生产输入,并作为模型管线的一部分共同调参。
SVM 的 Decision Score 是概率吗?
不是。符号表示输入位于边界哪一侧,绝对值来自拟合后的间隔或 Kernel Expansion。需要概率时,应在不复用评测标签的前提下拟合 Calibration Model,并在代表性留出切片上检验 Reliability。
什么时候应使用线性模型代替 Kernel SVM?
样本很多、Feature 高维、延迟严格或非线性收益很小时,应优先比较 Linear Baseline。决策时要同时检查留出质量、Support-vector Count、内存、训练时间和预测延迟,而不能只看训练准确率。