条件概率、贝叶斯与最大似然 Conditional Probability, Bayes & MLE
贝叶斯法则教你如何根据新证据更新世界观;最大似然估计(MLE)则是把「概率分布建模」与「损失函数极小化」完美贯通的宏伟桥梁。从抛硬币到均方误差推导,一次搞懂机器学习的概率之源。
实验 ① · 医疗检测千人方阵:假阳性悖论与贝叶斯更新
拖动滑块体验「假阳性悖论」:即便检测准确率高达 95%,但因为健康人占了 99% 的绝对多数,10% 的误报所产生的虚惊人数(橙点)依然远超真正患病人数(红点)。这就是为什么不能把「检测为阳性」直接等同于「确诊」!
实验 ② · 抛硬币极大似然估计(MLE)寻峰器
似然函数 L(p) 度量了在硬币正面概率为 p 时,出现观测结果(k 次正面)的概率大小。拖动假设概率 p,当 p 恰好等于样本频率 k/n 时,曲线达到最高峰(此时对数导数恰好为 0)。
实验 ③ · 同屏联动:为什么「最大化似然」就是「最小化均方误差」?
左边画的是样本在高斯假设下的联合概率密度乘积(越高越好),右边画的是取负对数之后的损失函数碗形曲线(越低越好)。拖动参数 μ,观察两根垂直白线:似然最高的顶点,必然严丝合缝地对应着均方误差损失最低的碗底!
一、贝叶斯定理:用新证据更新你的世界观
在经典频率学派看来,概率是硬币投掷一万次后正面的频率;而在贝叶斯学派看来,概率代表的是**你在掌握有限信息时对某个命题的信任程度(Degree of Belief)**。当你获取了新的事实证据,你必须用它来校准你的初始信任。
| 公式符号 | 数学名称 | 生活直觉与机器学习落点 |
|---|---|---|
| $$P(A)$$ | 先验概率 (Prior) | 在看到任何新证据之前,你凭常识或经验对事件 A 的初始信念(如某种罕见病发病率 1%)。 |
| $$P(B \mid A)$$ | 似然度 (Likelihood) | 如果假设 A 确实发生,出现证据 B 的可能性有多大(如真正患病者被检出阳性的敏感度 95%)。 |
| $$P(B)$$ | 边际似然 / 归一化因子 | 证据 B 出现的全部概率:包含「真患病且阳性」和「假患病误报阳性」两部分之和。 |
| $$P(A \mid B)$$ | 后验概率 (Posterior) | 看到证据 B(检测呈阳性)之后,你综合修正得出的最终患病概率。 |
二、最大似然估计(MLE):为什么均方误差是自然推导出的?
在机器学习里,我们常常用直线或神经网络去拟合点云。为什么要把每个点的残差平方加起来(MSE)?答案来自**最大似然原理**:
- 假设噪声服从高斯分布:假设真实数据被均值为 0、方差为 $\sigma^2$ 的高斯白噪声污染:$y_i = f(x_i; w) + \epsilon_i$,其中 $\epsilon_i \sim \mathcal{N}(0, \sigma^2)$。
- 写出所有独立样本的联合概率(似然函数): $$L(w) = \prod_{i=1}^{N} \frac{1}{\sqrt{2\pi}\sigma} \exp\left( -\frac{(y_i - f(x_i; w))^2}{2\sigma^2} \right)$$
- 两边取对数(将难算的连乘化为求和): $$\ln L(w) = -\frac{N}{2}\ln(2\pi\sigma^2) - \frac{1}{2\sigma^2} \sum_{i=1}^{N} \left( y_i - f(x_i; w) \right)^2$$
- 取负号转化为损失极小化:前面的常数项与权重 $w$ 无关。因此,最大化 $\ln L(w)$ 严格等价于最小化负对数似然(Negative Log-Likelihood),也就**严格等价于最小化残差平方和 $\sum (y_i - f(x_i))^2$**!
三、三大认知陷阱 ⚠️
将 $P(\text{DNA匹配} \mid \text{无辜})$ 很小(如十万分之一),直接等同于 $P(\text{无辜} \mid \text{DNA匹配})$ 很小。在人口千万的大城市里,就算完全随机拉人,也会有一百个人的 DNA 特征纯属巧合匹配。永远不能遗漏基础人群先验!
似然函数是对数据评估参数的合适程度。虽然它的写法是 $P(D \mid \theta)$,但对参数 $\theta$ 积分并不等于 1。只有在乘以先验并归一化之后,后验概率 $P(\theta \mid D)$ 才是真正的概率分布。
如果你抛两次硬币都是正面,最大似然估计会得出 $\hat{p} = 2/2 = 1.0$(断言反面永远不会出现)。为了克制这种极端,最大后验估计(MAP)引入了先验分布,在数学上直接对应机器学习中的 L2/L1 正则化(权重衰减)。
四、在机器学习、深度学习与强化学习中的落点
- 机器学习 (`ml/ch01`, `ml/ch04`, `ml/ch06`):高斯噪声导出均方误差(MSE),伯努利分布导出逻辑回归交叉熵损失(BCE),高斯先验导出 L2 权重正则化。
- 深度学习 (`dl/ch05`, `dl/ch07`):变分自编码器(VAE)中先验与后验的对齐、Softmax 多分类的负对数似然损失。
- 强化学习 (`rl/ch01`, `rl/ch11`):多臂老虎机中著名的 Thompson Sampling 算法依靠 Beta-Binomial 贝叶斯更新平衡探索与利用;大语言模型 RLHF 阶段 Bradley-Terry 偏好模型直接基于负对数似然构建。
📚 参考文献与延伸阅读
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning, Springer, Ch. 1.2 & 2.1 — 贝叶斯推断与二项/高斯似然的经典推导。
- Goodfellow, Bengio & Courville, Deep Learning, MIT Press, Ch. 5.5「Maximum Likelihood Estimation」 — 极大似然与深度学习损失函数的严格等价性。
- Sutton & Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, Ch. 2.8「Thompson Sampling」 — 基于 Beta-Binomial 贝叶斯采样的老虎机探索算法。
- 对照阅读 → ML 第 1 步 · 线性回归与 MSE、ML 第 4 步 · 逻辑回归与交叉熵、RL 第 1 步 · 多臂老虎机。
理解检测 · 5 道双语自测题
检验你对先验、似然、后验以及极大似然到损失函数推导的理解深度: