什么是 合页损失(Hinge Loss)?
合页损失(Hinge Loss)是一种基于间隔的凸分类损失,二分类形式为 `max(0, 1-yf(x))`,它同时惩罚错误预测和仍处于目标间隔内的正确预测。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
用凸代理上界二分类错误
Zero-one Error 会在预测类别翻转时突变,难以直接优化。Binary Hinge Loss 上界 Mistake Indicator:若 yf(x) <= 0,样本错误或处于 Tie,Hinge Loss 至少为一;若 0 < yf(x) < 1,类别正确但安全间隔不足。
原始 SVM 形式把间隔约束与正则化结合起来。Loss Value 依赖 Decision-score Scale,因此只有同时声明 Model Norm、Regularizer 与 Objective Normalization,Hinge Loss 才具有可比较含义。
明确处理折点和多分类扩展
Signed Margin 小于一时,对 Score 的一个 Subgradient 为 -y;大于一时为零;恰好等于一时 Loss 不可微,可在合法区间内选择 Subgradient。Solver 可以采用 Subgradient、Coordinate、Dual 或 Smoothing Strategy。
Multiclass Hinge Loss 并非唯一公式。Crammer-Singer 构造惩罚最强竞争类别相对于真实类别的 Score 加 Margin,One-versus-rest 则训练多个独立 Binary Objective。比较数值前必须记录 Label Encoding 与 Reduction。
区分间隔训练与概率评测
Hinge Loss 奖励超过固定 Margin 的正确决策,但不会要求模型预测经过校准的 Class Probability。Score 可以用于排序或驱动边界,直接对任意 Margin 套 Sigmoid 却不会自动得到有效 Probability Model。
当前 scikit-learn 文档给出了 Binary 与 Crammer-Singer Evaluation Convention。应同时报告 Hinge Loss、Per-class Error、Precision/Recall、Margin Distribution 与 Regularization;下游需要概率时还要单独校准。
主要特点
- 只有二分类 Signed Margin 至少为一时才取零
- 在明确标签约定下上界 Zero-one Mistake
- 保持凸性,但在间隔边界处不可微
- 惩罚位于目标间隔内的正确预测
- 支持多个并不等价的 Binary 与 Multiclass Construction
- 优化 Decision Margin,而不是校准概率
常见用途
- 训练 Linear 或 Kernel Maximum-margin Classifier
- 评估正确预测是否具有足够间隔
- 优化高维稀疏文本分类器
- 实现 Structured 或 Multiclass Margin Objective
- 比较基于间隔和基于概率的分类损失
示例
Loading code...常见问题
二分类合页损失如何计算?
先把 Label 编码为 -1 与 +1,计算 Signed Margin `m=yf(x)`,再返回 `max(0,1-m)`。Margin 为 1.4 时 Loss 为零,0.2 时为 0.8,-0.6 时为 1.6。
为什么正确预测仍可能有非零 Hinge Loss?
预测符号正确只要求 Margin 为正,而零 Hinge Loss 要求 Margin 至少达到一。额外惩罚推动样本远离边界,Regularization 则防止模型通过无限放大 Score 逃避 Loss。
Hinge Loss 与分类错误率相同吗?
不同。Classification Error 只记录标签是否错误;Hinge Loss 还度量正确预测中的 Margin Violation,并在 Binary Convention 下上界错误,因此它是可优化的 Surrogate,而不是最终业务指标。
Hinge Loss 与 Log Loss 有什么区别?
Hinge Loss 面向 Decision Margin,超过目标间隔后归零;Log Loss 评估分配给真实类别的概率,并持续奖励更高概率。Log Loss 是 Proper Probability Score,Hinge Loss 不是。
Hinge Loss 可以训练多分类模型吗?
可以,但必须说明具体构造。Crammer-Singer 在一个 Joint Loss 中使用最强竞争类别,One-versus-rest 则拟合多个 Binary Loss。它们的 Score Scale、优化方式和报告 Loss Value 不能互换。