什么是 多核学习(MKL)?

多核学习(MKL)是一类联合学习 Predictor 与组合多个 Kernel Function 所需权重或结构的方法。

快速了解

全称Multiple Kernel Learning
规范文档官方规范

工作原理

联合优化核权重与预测器

MKL 在正则化目标下交替或联合求解 Predictor Parameter 与 Kernel-combination Variable。Sparse Formulation 可以把许多 Kernel Weight 压到零,Non-sparse Norm 则会把权重分散到相关或互补 Kernel 上。

JMLR MKL 综述按学习形式、优化方法和应用组织了相关算法。MKL 不只是对 Kernel 求平均;Constraint、Regularizer、Localized Weight 与下游 Learner 共同决定模型实际学到什么。

解释权重前先归一化基础核

Kernel Matrix 的 Trace、Diagonal 或 Variance 可能相差很大。若不在 Training-only Data 上归一化,较大的数值尺度会支配 Mixture 或扭曲 Regularization。Centering 与 Normalization 不能使用 Validation 或 Test Label,并且必须能对新样本复现。

更大的 Learned Weight 不代表 Causal Feature Importance。冗余 Kernel 可以交换权重,相关 Modality 会相互遮蔽,Regularization 也会偏好 Sparse 或 Diffuse Solution。只有结合 Ablation、跨 Fold 不确定性与预测表现,权重才具有有限解释价值。

嵌套模型选择并约束 Gram Matrix 成本

在同一个 Evaluation Fold 上选择 Base Kernel、Bandwidth、Normalization、Sparsity 与 Regularization 会泄漏 Model-selection Information。所有 Kernel 和 Predictor 选择都应进入 Inner Loop,Outer 或未触碰 Split 只做最终评测,并对照每个 Single Kernel 与 Unweighted Average。

SimpleMKL展示了 Convex Kernel Mixture 的 Reduced-gradient Approach。对 n 个样本的 M 个 Dense Kernel,物化全部 Base 可能需要 O(Mn^2) 存储;预算不允许时应使用 Cache、Low-rank Factor、Block Product 或 Explicit Feature。

主要特点

  • 学习多个 Kernel-defined Similarity Geometry 的组合
  • 非负 Kernel Sum 保持 Positive Semidefiniteness
  • 可对 Kernel Weight 施加 Sparse 或 Non-sparse Regularization
  • 需要尺度兼容的 Kernel Matrix 才能进行有意义的优化
  • 把 Kernel Selection 与下游 Predictor Objective 联合起来
  • 可能按 Base Kernel 数量成倍增加 Gram Matrix 存储与计算

常见用途

  1. 在一个 Predictor 中组合文本、图像、Graph 或传感器 Modality
  2. 为预定义 Feature Group 分别构造 Kernel 并学习组合
  3. 在多个 RBF Bandwidth 之间学习而不固定单一 Geometry
  4. 整合生物 Sequence、Pathway 与 Expression Similarity
  5. 验证 Learned Kernel Fusion 是否优于 Single-kernel Baseline

示例

loading...
Loading code...

常见问题

为什么使用多核学习而不是单一核?

MKL 可以在一个 Predictive Objective 下组合 Feature Group、Modality 或 Bandwidth 的互补 Geometry 并学习权重。只有 Nested Validation 证明它优于每个 Single Kernel 和简单 Fixed Average 时,这种复杂度才有价值。

Kernel 的加权和仍然是有效核吗?

Positive-semidefinite Kernel 的非负加权和仍然 Positive Semidefinite。负权或 Data-dependent Combination 需要单独的数学论证;任意 Similarity Score 的混合不会自动成为有效 RKHS Kernel。

为什么 MKL 需要归一化基础核?

不同 Trace 或 Diagonal Scale 会让数值大小支配 Learned Weight 和 Regularization。应只用训练数据选择并拟合归一化,在推理时应用匹配的 Cross-kernel Transformation,并把该选择纳入验证。

MKL 权重可以表示特征重要性吗?

不能直接这样解释。Weight 受 Kernel Scale、Redundancy、Constraint、Regularization 与 Correlated Information 影响。必须结合 Held-out Ablation、Resample Stability 和领域检查,而且不能把它称为 Causal Importance。

多核学习如何扩展到大规模数据?

存储 `M` 个 `n by n` Dense Gram Matrix 在优化前就可能需要 `O(Mn²)` 内存。Kernel Cache、On-demand Block、Low-rank Approximation、Explicit Feature 和更小的已验证 Base Set 可以降低成本,但都要测量引入的权衡。

相关术语

相关文章