什么是 单类支持向量机(One-Class SVM)?

单类支持向量机(One-Class SVM)是一种无监督核方法,它围绕参考分布估计边界,并为新观测输出用于新颖性检测的有符号 Decision Score。

快速了解

全称One-Class Support Vector Machine
创建时间2001 年由 Bernhard Schölkopf、John Platt、John Shawe-Taylor、Alex Smola 与 Robert Williamson 提出
规范文档官方规范

工作原理

拟合 Kernel Level Set,而不是第二个类别

标准 ν-One-Class SVM 在 Feature Space 中优化带 Offset rho、Slack Variable 和参数 nu 的 Separating Hyperplane。Decision Function 形如 sum_i alpha_i k(x_i,x)-rho,只有 Coefficient 非零的训练样本成为 Support Vector。

原始支持估计论文把该构造与高密度子集估计联系起来,但不会证明学到的区域等于语义类别,也不会证明每个区域外样本都有危害。

在明确假设下解释 nu 与训练污染

对标准 ν Formulation,nu 在优化假设下控制与 Margin Error Fraction 和 Support-vector Fraction 有关的界。它不是预期生产异常率的简单设置;有限样本、重复观测、Solver Tolerance 或 Weighting 都会让经验值难以精确对应理论界。

Novelty Detection 假设 Reference Training Set 基本干净,模型训练后再评分新样本;Outlier Detection 则在训练集含污染时拟合。One-Class SVM 对污染 Reference 较敏感,因此要清洗数据、测试注入异常,并比较 Robust 或 Density-based Alternative。

校准决策策略并持续监控漂移

Scaling、Feature Extraction、Kernel Family、Bandwidth 与 nu 都必须在仅含训练数据的 Resampling 中拟合。应利用代表性正常数据、已知 Incident、Synthetic Challenge 或 Review Capacity 选择运行阈值,不能默认 Solver 的零边界刚好对应所需告警率。

当前 scikit-learn 异常检测指南区分 Novelty 与 Outlier Detection,并指出 One-Class SVM 的敏感性。上线后应监控 Score Distribution、Alert Volume、Support-vector Count、False Positive、Delayed Label 与 Reference Drift。

主要特点

  • 无需带标签异常样本即可学习 Acceptance Region
  • 通过 Kernel Evaluation 和 Support Vector 表示 Decision Function
  • nu 约束优化行为,而不是直接设置概率
  • 按具体实现约定返回有符号 Novelty Score
  • 对 Feature Scaling 和 Kernel Bandwidth 高度敏感
  • 可能被 Reference Training Set 中的污染扭曲

常见用途

  1. 根据健康参考时段筛查新的传感器观测
  2. 在确认欺诈标签稀缺时标记异常交易
  3. 发现新颖制造测量值并交给人工检查
  4. 监控 Embedding 是否偏离经过筛选的参考语料
  5. 与 Isolation Forest 或 Density Method 对照非线性新颖性基线

示例

loading...
Loading code...

常见问题

One-Class SVM 属于监督学习还是无监督学习?

它通常归为 Unsupervised Method,因为拟合不需要带标签异常或第二个类别。但完整工作流仍需要 Domain Rule、人工 Review、已知 Incident 或 Synthetic Test 来选择 Feature、调整阈值并评估告警。

One-Class SVM 中的 nu 表示什么?

Nu 是标准 Formulation 中与 Margin Error 和 Support-vector Fraction 理论界有关的优化参数。它不直接等于异常概率,也不能保证未来数据保持相同告警率,尤其是在 Distribution Drift 下。

One-Class SVM 的负分数是异常概率吗?

不是。它只按当前 Score Convention 表示样本位于拟合 Level-set Boundary 的哪一侧。应使用验证证据校准独立 Action Threshold,模型重训后也不能在未对齐时直接比较 Raw Magnitude。

One-Class SVM 可以使用含污染的数据训练吗?

可以拟合,但被污染的 Reference Point 可能拉动或分裂所学边界。应估计污染率、检查有影响力的 Support Vector、比较 Robust Alternative,并用留出的正常时段和已知或注入异常评测。

生产环境应该如何监控 One-Class SVM?

持续跟踪 Input 与 Score Drift、Threshold Exceedance Rate、Support-vector Count、延迟、Review Outcome 和延迟到达的 Incident Label。重训必须走版本化流程,禁止把已检测异常自动升级为可信 Reference。

相关术语

相关文章