第 1 步 · 认识数据的几何容器
向量、范数与正交投影Vectors & Projections
向量不仅是数组,更是高维空间中的几何箭头。点积度量相似度与投影,范数勾勒空间等值面,而超平面则是机器学习一切分类决策的物理分界。
15 分钟
阅读 + 实操
3 个
交互演示
入门
难度
向量与空间几何 · 交互演示
点积 a·b0.00
夹角 θ0.0°
投影长度0.00
① 2D 向量自由探针:拖动青色向量 a 或紫色向量 b 的端点,观察内积、夹角与正交投影
② Lp 范数等值面与稀疏性:调节 p 值,观察单位球从菱形 (L1) 到圆形 (L2) 再到方形 (L∞)
③ 分类超平面与距离测量:调节偏置 b,观察超平面 w^T x + b = 0 及其正负决策半空间
为什么学这步?
机器学习里的每行数据,本质上都是高维向量空间里的一个几何点。权重向量 w、特征 x、分类边界超平面、甚至 Attention 里的 Query/Key 匹配,全部建立在向量内积与正交投影的基础之上。把空间几何看透,后续算法就由“公式死记”变成了“眼中看图”。
📌 发生了什么
- 点积度量两向量在同向上的重合程度
- L1 菱形尖角诱导权重稀疏(参数归零)
- 法向量 w 决定了超平面的空间法向倾角
⚠️ 常见陷阱
- 点积等于 0 并不代表向量为 0,而是两向量正交
- 余弦相似度只衡量方向,完全丢失了长度信息
- 点到面的真实几何距离必须除以法向量模长 ||w||
✅ 本章小结
- 正交投影公式:(a·b / ||b||²) · b
- L1 产生稀疏(Lasso),L2 整体收缩(Ridge)
- 超平面 w^T x + b = 0 将空间一分为二
📐 为什么 L1 产生稀疏解,而 L2 不会?
带正则化的优化目标可等价表述为约束优化:在参数范数球 ||w||_p ≤ C 的区域内,寻找使损失函数等值线最小的点。损失等值线通常呈现以未正则化最优解为中心的椭圆。当椭圆自内向外扩张时,首次接触正则化约束球的点即为最终解。
因为 L1 范数等值线在坐标轴上存在非光滑尖角(Vertex),其切线斜率在尖角处不连续,使得椭圆有压倒性的概率最先触碰到坐标轴上的尖角(此时某个维度的分量 w_i 恰好等于 0,形成稀疏解)。而 L2 范数是处处光滑的超球体,相切点几乎不可能恰好落在坐标轴上,因此 L2 只能让权重变小,无法让权重精确归零。
📏 点到超平面距离推导
设 x₀ 为空间任意一点,x_p 为其在超平面 w^T x + b = 0 上的正交垂足点。由于垂线平行于法向量 w:
将此代入超平面方程 w^T x_p + b = 0,展开即得垂直距离 d = (w^T x₀ + b) / ||w||₂。这是 SVM 支持向量机边距最大化推导的核心地基。
💻 向量投影与点积计算核心
// 点积
function dot(u, v) {
return u[0] * v[0] + u[1] * v[1];
}
// 向量 a 在 b 上的投影向量
function project(a, b) {
const bNormSq = dot(b, b);
if (bNormSq < 1e-12) return [0, 0];
const scale = dot(a, b) / bNormSq;
return [b[0] * scale, b[1] * scale];
}
📚 参考文献与延伸阅读
- Strang, Introduction to Linear Algebra, Ch. 1 & 4 「Vectors, Linear Combinations, and Projections」 — 经典的向量几何与子空间正交投影
- Hastie, Tibshirani & Friedman (2009), The Elements of Statistical Learning, §3.4 「Shrinkage Methods (Lasso & Ridge)」 — L1 菱形角点诱导稀疏性的严格几何证明
- Vaswani et al. (2017), Attention Is All You Need — Query 与 Key 的点积相似度在现代 Transformer 中的革命性应用
- 对照阅读 → ML 第 1 步 · 线性回归:特征点积的实际应用;ML 第 6 步 · 过拟合与正则化:L1 与 L2 惩罚项实操
📝 课后练习
检验你的理解——答对为止