支持向量机 · 核函数直觉

换一种相似度,边界会怎样弯?

核函数规定样本之间怎样比较。先拿线性核做基线,再换多项式或 RBF:同一批二维点没有移动,模型能利用的关系却变了。

让同一组点接受三种相似度

先切换数据预设,再比较核。点图中的样本可选参照点;点空白处移动探针。键盘聚焦画布后,也能用方向键移动探针。

圆环数据
二维输入空间中的决策区域 浅蓝 / 浅红是预测区域,黑线是 f(x)=0
浏览器需要支持 Canvas 才能显示核边界图。
  • 正类圆点
  • 负类菱形
  • 决策边界
  • RBF 的 e⁻¹ 半径
训练误差0 / 0
估计边界长度0.0
复杂度读法
活跃样本权重0

拿一个样本做“相似度手电筒”

参照样本不变,移动探针 z。局部影响先看 K(xᵢ,z),再乘上训练得到的样本权重,才成为该样本对当前分数的贡献。

局部影响

参照样本 P1

坐标 (0.00, 0.00),类别 +1

欧氏距离0.00
核值 K(xᵢ,z)0.000
单样本贡献 αᵢK0.000

RBF 相似度只由距离决定,并随距离平方指数衰减。

核改变的是可用关系,不是数据本身

下面三张说明与当前核同步高亮。先问数据关系是什么,再决定是否值得引入弯曲边界。

边界条件

线性核

K(x,z)=xᵀz

直接使用原空间内积,边界保持线性。它是核实验的基线,也适合高维稀疏数据。

多项式核

K(x,z)=(γxᵀz+r)ᵈ

让有限阶交互进入线性模型。degree、gamma 与 coef0 会彼此耦合,数值范围也会快速放大。

RBF 核

K(x,z)=exp(−γ‖x−z‖²)

按欧氏距离衰减。gamma 很大时,每个样本的影响更局部,边界也更容易围着少量点转弯。

不要把这张图误读成“高维空间长这样”。

主图只显示原二维输入中的预测。核矩阵用样本对的内积替代显式特征坐标;可能很高维甚至无限维的 φ(x) 没有被逐轴画出,也没有必要逐轴画出。

为什么训练误差低不代表这个核更合适?

提高多项式次数或 RBF gamma 往往能让边界贴近训练点,也可能只是记住离群点和标签噪声。真实选择要把预处理放进交叉验证,并同时检查验证误差、边界稳定性、支持向量数与计算成本。