Lecture 17: Conditional Probability & Bayes(条件概率与贝叶斯)

目录 · ← l17 · l19 →

Lecture 17: Conditional Probability & Bayes(条件概率与贝叶斯)

概述

L15 建立了概率的公理框架,L16 提供了计数的武器。但两者都默认一件事:我们只知道事件本身,不知道任何额外信息。本讲要问的是:当一条新信息(证据)到手后,概率应该如何修正?

答案是条件概率(conditional probability) $\Pr[A \mid B] = \Pr[A \cap B]/ \Pr[B]$,它的直观含义是”把样本空间 $\Omega$ 缩小到 $B$,然后在 $B$ 里重新归一化”。由条件概率可以推出三件互相缠绕的工具:乘法法则(乘积法则 / product rule)把交集的概率拆成一串条件概率的乘积;全概率法则(law of total probability)按划分把无条件概率拆成加权平均;贝叶斯法则(Bayes’ rule)把条件方向翻转,用”原因→结果”的概率反推”结果→原因”的概率。最后一条是机器学习、信号处理、医疗诊断、垃圾邮件过滤乃至司法推理的数学基础。

本讲在课程中的位置:它是 L15 概率公理的第一次实质性扩展,是 L18(独立性、事件组合)的直接铺垫(独立性就是把 $\Pr[A \mid B] = \Pr[A]$ 写成对称形式),也是 L19(随机变量)、L21(联合分布)、L26(条件期望、马尔可夫链)的必备语言。“条件化”是概率论中最重要的一把刀,本讲要把它磨透。

核心概念的直观解释

条件概率(Conditional Probability)

  • 定义:设 $A, B \subseteq \Omega$ 是同一概率空间中的事件,且 $\Pr[B] > 0$。则在 $B$ 发生的条件下 $A$ 发生的条件概率定义为 \(\Pr[A \mid B] = \frac{\Pr[A \cap B]}{\Pr[B]}.\) 读作”给定 $B$ 时 $A$ 的概率”。注意 $\Pr[B] = 0$ 时该式无定义(不允许”条件在不可能事件上”)。
  • 直观解释(”它是什么意思?”):这是样本空间的缩减(shrinking the sample space)。原来我们在整个 $\Omega$ 上谈概率;一旦知道 $B$ 已经发生,所有 $\omega \notin B$ 的可能性都被排除,世界只剩下 $B$。但 $B$ 内部原有的概率之和 $\Pr[B]$ 一般小于 1,不能直接当概率用(公理要求全空间概率为 1),所以必须把每个样本点的概率放大 $1/\Pr[B]$ 倍,重新归一化。
  • 关键术语:$\Pr[A \cap B]$ 是联合概率(joint probability)——”$A$ 与 $B$ 同时发生”;$\Pr[A \mid B]$ 是条件概率这两个量不同,且相差一个因子 $\Pr[B]$。混淆它们是 CS70 最高频的失分点之一。
================== 样本空间的缩减 ==================

                 Ω  (总面积 = 1)

      ┌───────────────────────────────────────┐
      │                                       │
      │        ┌───────────────┐              │
      │        │       B       │              │
      │        │   ┌───────┐   │              │
      │        │   │ A ∩ B │   │              │
      │        │   └───────┘   │              │
      │        └───────────────┘              │
      │                                       │
      └───────────────────────────────────────┘

  条件化前:  Pr[A]     = 面积(A) / 面积(Ω)
  条件化后:  世界只剩 B,把 B 重新拉伸到"总面积 = 1"

      ┌───────────────────────────────┐
      │            B (重新归一化)      │
      │   ┌───────────────────────┐   │
      │   │        A ∩ B          │   │   ← 关心的部分
      │   └───────────────────────┘   │
      └───────────────────────────────┘

  ∴  Pr[A | B] = 面积(A ∩ B) / 面积(B) = Pr[A ∩ B] / Pr[B]
  • 具体示例(两枚骰子):掷两枚公平骰子,$\Omega = \{(i,j) : 1 \le i,j \le 6\}$,$\vert \Omega\vert = 36$,均匀。设 $B$ = “点数和为 8”,$A$ = “至少有一枚是 3”。
    • $B = \{(2,6),(3,5),(4,4),(5,3),(6,2)\}$,$\vert B\vert = 5$。
    • $A \cap B = \{(3,5),(5,3)\}$,$\vert A \cap B\vert = 2$。
    • $\Pr[A \mid B] = \frac{2/36}{5/36} = \frac{2}{5} = 0.4$。
    • 脚本验算:$\vert B\vert = 5$,$\vert A \cap B\vert = 2$,比值 $0.4$。$\checkmark$ 注意 $\Pr[A] = 11/36 \approx 0.3056$,”和为 8”这条信息提高了”出现 3”的概率(正相关)。

乘法法则(Product Rule / Chain Rule)

  • 定义:对任意事件 $A, B$,$\Pr[A \cap B] = \Pr[A]\,\Pr[B \mid A] = \Pr[B]\,\Pr[A \mid B]$(当相应的条件概率有意义时)。更一般地,$\Pr\!\left[\bigcap_{i=1}^{n}A_i\right] = \Pr[A_1]\Pr[A_2 \mid A_1]\Pr[A_3 \mid A_1 \cap A_2]\cdots\Pr\!\left[A_n \mid \bigcap_{i=1}^{n-1}A_i\right]$。
  • 直观解释(”它是什么意思?”):这是逐步走路径的技巧。要求一件事同时发生,就把它拆成”先发生第一步,再在第一步已发生的前提下发生第二步……”。概率论里没有”同时”,只有”序贯”。想象一棵决策树:一条从根到叶的路径的概率等于沿途各边条件概率的乘积。
  • 具体示例:从 52 张牌中连抽 2 张(不放回),求两张都是 A 的概率。设 $A_1$ = “第 1 张是 A”,$A_2$ = “第 2 张是 A”。 \(\Pr[A_1 \cap A_2] = \Pr[A_1]\Pr[A_2 \mid A_1] = \frac{4}{52} \times \frac{3}{51} = \frac{12}{2652} = \frac{1}{221} \approx 0.004525.\) 脚本验算:$12/2652 = 0.00452489\ldots$,且 $\Pr[A_2 \mid A_1] = 3/51 = 1/17 \approx 0.0588 < \Pr[A_2] = 1/13 \approx 0.0769$。$\checkmark$

全概率法则(Law of Total Probability)

  • 定义:设 $B_1, \dots, B_n$ 是样本空间 $\Omega$ 的一个划分(partition),即 $B_1 \cup \cdots \cup B_n = \Omega$ 且 $B_i \cap B_j = \varnothing$($i \ne j$)。则对任意事件 $A$, \(\Pr[A] = \sum_{i=1}^{n}\Pr[A \cap B_i] = \sum_{i=1}^{n}\Pr[A \mid B_i]\,\Pr[B_i].\)
  • 直观解释(”它是什么意思?”):这是分情形(divide into cases)策略的概率版本。想知道”$A$ 会不会发生”,就先把世界按某个分类标准切成几块($B_1,\dots,B_n$),在每一块里分别算 $A$ 的概率,再按各块的”大小”($\Pr[B_i]$)做加权平均。特别地,$n=2$ 时就是 $\Pr[A] = \Pr[A \mid B]\Pr[B] + \Pr[A \mid B^c]\Pr[B^c]$。
  • 具体示例(网球比赛):你要和随机选出的对手 X 或 Y 比赛。已知 $\Pr[A \mid B_X] = 0.7$(对 X 胜率)、$\Pr[A \mid B_Y] = 0.3$(对 Y 胜率)、$\Pr[B_X] = 0.6$、$\Pr[B_Y] = 0.4$。则由全概率法则 \(\Pr[A] = 0.7 \times 0.6 + 0.3 \times 0.4 = 0.42 + 0.12 = 0.54.\) 脚本验算:$0.54$。$\checkmark$ 注意这个 $0.54$ 不是 $(0.7+0.3)/2 = 0.5$——加权平均必须用真实的权重(这里是 $0.6/0.4$ 而非 $0.5/0.5$)。

贝叶斯法则(Bayes’ Rule)

  • 定义:对事件 $A, B$ 且 $\Pr[A] > 0, \Pr[B] > 0$, \(\Pr[B \mid A] = \frac{\Pr[A \mid B]\,\Pr[B]}{\Pr[A]}.\) 若 $B_1,\dots,B_n$ 是 $\Omega$ 的划分,则对每个 $i$: \(\Pr[B_i \mid A] = \frac{\Pr[A \mid B_i]\,\Pr[B_i]}{\sum_{j=1}^{n}\Pr[A \mid B_j]\,\Pr[B_j]}.\)
  • 直观解释(”它是什么意思?”):贝叶斯法则解决一个方向问题。在实践中,我们往往只知道”从原因推结果的概率“(生病 → 检测阳性的概率、垃圾邮件 → 含某词的概率),但真正想知道的是”从结果反推原因的概率“(检测阳性 → 真的生病了的概率、含某词 → 是垃圾邮件的概率)。贝叶斯法则就是把后者用前者表达出来的唯一桥梁。原式中的分母 $\Pr[A]$ 之所以能算出来,正是因为全概率法则。
  • 术语(务必记住,L18 之后会反复出现):
    • 先验(prior) $\Pr[B]$:看到证据之前,我们对 $B$ 的信念。
    • 似然(likelihood) $\Pr[A \mid B]$:若 $B$ 为真,观察到证据 $A$ 的可能性有多大。
    • 后验(posterior) $\Pr[B \mid A]$:看到证据 $A$ 之后,修正过的信念。
    • 一句话口诀:后验 $\propto$ 似然 $\times$ 先验(分母只是归一化常数)。
  • 具体示例:见下方完整算例,那里会看到”$\Pr[\text{病} \mid \text{阳性}] \approx 9\%$ 而 $\Pr[\text{阳性} \mid \text{病}] = 99\%$”这种令人震惊的落差。

最大似然估计与最大后验估计(MLE vs MAP)

  • 定义:设数据 $A$ 已观测,参数取值 $B_1,\dots,B_n$。
    • 最大似然估计(Maximum Likelihood Estimate, MLE):选使似然最大的参数:$\hat{B}_{\text{MLE}} = \arg\max_i \Pr[A \mid B_i]$。
    • 最大后验估计(Maximum A Posteriori, MAP):选使后验最大的参数:$\hat{B}_{\text{MAP}} = \arg\max_i \Pr[B_i \mid A] = \arg\max_i \Pr[A \mid B_i]\Pr[B_i]$(分母与 $i$ 无关,可丢弃)。
  • 直观解释(”它是什么意思?”):MLE 是”只信数据“——哪种原因最能解释我看到的证据,就选哪个。MAP 是”数据 + 先验“——还要考虑”这种原因本身常见不常见”。当先验均匀(所有 $\Pr[B_i]$ 相等)时,两者完全一致,因为此时乘上同一个常数不改变谁最大。
  • 具体示例:见下文”两个罐子”算例,其中 MAP 与 MLE 的分歧阈值是 $\Pr[B_1] > 5/9$。

独立(Independence,预告)

  • 定义:事件 $A, B$ 称为独立(independent),若 $\Pr[A \cap B] = \Pr[A]\Pr[B]$。当 $\Pr[B] > 0$ 时等价于 $\Pr[A \mid B] = \Pr[A]$。
  • 直观解释(”它是什么意思?”)知道 $B$ 发生,不改变你对 $A$ 的信念。条件化前后概率不变,就是”无关”。注意独立性不是“互斥”——互斥事件($A \cap B = \varnothing$)在 $\Pr[A],\Pr[B]>0$ 时是强烈负相关的(知道 $B$ 发生就排除了 $A$)。
  • 具体示例:抛一枚公平硬币三次,$A$ = “第 1 次正面”,$B$ = “第 2 次正面”。$\Pr[A \mid B] = 1/2 = \Pr[A]$,独立。而 $A$ = “第 1 次正面”,$C$ = “第 1 次是反面”:$\Pr[A \mid C] = 0 \ne 1/2$,不独立(且互斥)。独立性将在 L18 展开,包括”两两独立但不相互独立”的经典陷阱。

完整证明与推导(核心)

定理 17.1(条件概率仍是合法的概率测度): 固定事件 $B$ 且 $\Pr[B] > 0$。定义映射 $\Pr[\cdot \mid B] : 2^{\Omega} \to \mathbb{R}$ 为 $\Pr[A \mid B] = \Pr[A \cap B]/\Pr[B]$。则 $\Pr[\cdot \mid B]$ 满足概率的三条公理:

  1. 非负性(Non-negativity):对任意 $A \subseteq \Omega$,$\Pr[A \mid B] \ge 0$。
  2. 规范性与可加性(Normalization & Additivity):$\Pr[\Omega \mid B] = 1$;且对任意互不相交的事件 $A_1, A_2, \dots$,$\Pr\!\left[\bigcup_i A_i \mid B\right] = \sum_i \Pr[A_i \mid B]$。

证明策略直接证明(把定义代进去,逐条核对)。之所以选这个策略,是因为命题本身就是”某个构造满足某组公理”的验证型命题。证明的意义不只是”这道题会做”,而是回答了一个更根本的问题:为什么条件概率要这样定义? 因为它必须是唯一能让”限制在 $B$ 上的概率”仍然合法的定义。

逐步推导

(公理 1) 对任意 $A$,$\Pr[A \cap B] \ge 0$(公理的非负性),且 $\Pr[B] > 0$,故商 $\ge 0$。$\checkmark$

(公理 2 前半:规范性) \(\Pr[\Omega \mid B] = \frac{\Pr[\Omega \cap B]}{\Pr[B]} = \frac{\Pr[B]}{\Pr[B]} = 1. \qquad \checkmark\)

(公理 2 后半:可加性) 设 $A_1, A_2, \dots$ 两两不交,即 $A_i \cap A_j = \varnothing$($i \ne j$)。

  1. 先看它们与 $B$ 相交后的集合:$(A_i \cap B) \cap (A_j \cap B) = A_i \cap A_j \cap B = \varnothing$。所以 $\{A_i \cap B\}_i$ 也是两两不交的。
  2. 于是对原空间用可加性:$\Pr\!\left[\bigcup_i (A_i \cap B)\right] = \sum_i \Pr[A_i \cap B]$。
  3. 另一方面,$\left(\bigcup_i A_i\right) \cap B = \bigcup_i (A_i \cap B)$(分配律)。
  4. 因此 \(\Pr\!\left[\bigcup_i A_i \mid B\right] = \frac{\Pr\!\left[\left(\bigcup_i A_i\right)\cap B\right]}{\Pr[B]} = \frac{\Pr\!\left[\bigcup_i (A_i \cap B)\right]}{\Pr[B]} = \frac{\sum_i \Pr[A_i \cap B]}{\Pr[B]} = \sum_i \Pr[A_i \mid B]. \qquad \checkmark\)
  5. 三条公理全部满足,故 $\Pr[\cdot \mid B]$ 是 $\Omega$ 上的一个合法概率测度。$\blacksquare$

【证明机制解说】:步骤 1 是唯一需要动脑的地方——它说明”与 $B$ 取交集”这个操作保持不交性。这是整个证明的枢纽:正因为不交性被保持,才能把原空间的可加性”搬运”到条件空间。至于唯一性:假设我们希望”限制在 $B$ 上的概率”既满足公理、又与原概率在 $B$ 内部各事件的相对比例保持一致(即 $A_1, A_2 \subseteq B$ 时 $\frac{\Pr[A_1 \mid B]}{\Pr[A_2 \mid B]} = \frac{\Pr[A_1]}{\Pr[A_2]}$),那么任何这样的测度 $Q$ 必须满足 $Q(A) = c \cdot \Pr[A]$(对 $A \subseteq B$),由 $Q(B) = 1$ 定出 $c = 1/\Pr[B]$。所以定义 $\Pr[A \mid B] = \Pr[A \cap B]/\Pr[B]$ 不是任意约定,而是被这三条要求逼出来的唯一选择。 这一点官方 Note 是用”若不除以 $\Pr[B]$,则 $\sum_{\omega \in B}\Pr[\omega \mid B] = \Pr[B] < 1$,不满足归一化”来说明的——完全等价的说法。


定理 17.2(乘法法则 / Product Rule,链式形式): 对任意事件 $A_1, \dots, A_n$ 且 $\Pr\!\left[\bigcap_{i=1}^{n-1}A_i\right] > 0$,

\[\Pr\!\left[\bigcap_{i=1}^{n}A_i\right] = \Pr[A_1]\cdot\Pr[A_2 \mid A_1]\cdot\Pr[A_3 \mid A_1 \cap A_2]\cdots\Pr\!\left[A_n \;\middle\vert \; \bigcap_{i=1}^{n-1}A_i\right].\]

特别地,$n = 2$ 时 $\Pr[A \cap B] = \Pr[A]\Pr[B \mid A] = \Pr[B]\Pr[A \mid B]$。

证明策略数学归纳法(induction on $n$)。这是 L03 归纳法的标准应用场景:命题天然带有参数 $n$,且”$n$ 个事件的交集”可以写成”前 $n-1$ 个的交集”与”第 $n$ 个事件”的两事件交集,从而套用 $n=2$ 的基础情形。为什么不用双计数或双射? 因为这里不涉及任何”数对象”,而是一个结构性的恒等式,归纳是它的自然语言。

逐步推导

(基础情形 $n = 1$) 命题退化为 $\Pr[A_1] = \Pr[A_1]$,恒真。$\checkmark$

(基础情形 $n = 2$,同时也是直接计算) 由条件概率定义,$\Pr[A_2 \mid A_1] = \dfrac{\Pr[A_1 \cap A_2]}{\Pr[A_1]}$。两边乘 $\Pr[A_1]$(且 $\Pr[A_1] > 0$ 保证除法合法)得 \(\Pr[A_1 \cap A_2] = \Pr[A_1]\Pr[A_2 \mid A_1].\) 交换 $A_1, A_2$ 的角色(同样要求 $\Pr[A_2] > 0$)得 $\Pr[A_1 \cap A_2] = \Pr[A_2]\Pr[A_1 \mid A_2]$。两个表达式相等,正说明 $\Pr[A]\Pr[B \mid A] = \Pr[B]\Pr[A \mid B]$——这正是贝叶斯法则的雏形。$\checkmark$

(归纳步骤) 设对某个 $n \ge 3$,命题对 $n-1$ 个事件成立(归纳假设): \(\Pr\!\left[\bigcap_{i=1}^{n-1}A_i\right] = \Pr[A_1]\cdot\Pr[A_2 \mid A_1]\cdots\Pr\!\left[A_{n-1} \;\middle\vert \; \bigcap_{i=1}^{n-2}A_i\right].\)

  1. 记 $C = \bigcap_{i=1}^{n-1}A_i$。由题设 $\Pr[C] > 0$。
  2. 两个事件 $A_n$ 与 $C$ 用基础情形: \(\Pr\!\left[\bigcap_{i=1}^{n}A_i\right] = \Pr[A_n \cap C] = \Pr\!\left[A_n \mid C\right]\Pr[C] = \Pr\!\left[A_n \;\middle\vert \; \bigcap_{i=1}^{n-1}A_i\right]\cdot\Pr\!\left[\bigcap_{i=1}^{n-1}A_i\right].\)
  3. 代入归纳假设替换 $\Pr[C]$: \(\Pr\!\left[\bigcap_{i=1}^{n}A_i\right] = \Pr\!\left[A_n \;\middle\vert \; \bigcap_{i=1}^{n-1}A_i\right]\cdot\Pr[A_1]\cdot\Pr[A_2 \mid A_1]\cdots\Pr\!\left[A_{n-1} \;\middle\vert \; \bigcap_{i=1}^{n-2}A_i\right].\)
  4. 这正是 $n$ 个事件的链式公式。由归纳法,命题对所有 $n \ge 1$ 成立。$\blacksquare$

【证明机制解说】:这个证明的”机制”是把长链条缩短一格。链式法则之所以对任意 $n$ 成立,是因为”交集”这个运算在结构上是可结合的:$\bigcap_{i=1}^{n}A_i = A_n \cap \left(\bigcap_{i=1}^{n-1}A_i\right)$。凡是遇到这种”可结合 + 带参数的恒等式”,归纳法几乎总是对的工具。

条件不能省:若 $\Pr\!\left[\bigcap_{i=1}^{n-1}A_i\right] = 0$,链条后半段的条件概率无定义,公式失去意义。具体反例:$n=2$,取 $A_1 = \varnothing$。则 $\Pr[A_1] = 0$,$\Pr[A_2 \mid A_1]$ 无定义;而 $\Pr[A_1 \cap A_2] = 0$。虽然”$0 = 0 \cdot \Pr[A_2 \mid A_1]$”在形式上还能凑出正确数值,但条件概率本身不存在,推导链是断的。

典型应用(Monty Hall 的交集概率):设 $C_i$ = “选手选门 $i$”,$P_i$ = “奖品在门 $i$”,$H_i$ = “主持人开门 $i$”。求 $\Pr[C_1 \cap P_2 \cap H_3]$。

  • $\Pr[C_1] = 1/3$(选手随机选)。
  • $\Pr[P_2 \mid C_1] = 1/3$(奖品位置与选手选择独立)。
  • $\Pr[H_3 \mid C_1 \cap P_2] = 1$:主持人不能开门 1(选手已选)、不能开门 2(那里有奖品),只剩门 3。
  • 由链式法则:$\Pr[C_1 \cap P_2 \cap H_3] = \frac13 \cdot \frac13 \cdot 1 = \frac19$。

对照:若错误地”把三个概率直接相乘”,会写成 $\frac13 \cdot \frac13 \cdot \Pr[H_3]$,而 $\Pr[H_3] = 1/3$,得到 $\frac1{27}$——错了 3 倍。原因正是忽略了条件:$\Pr[H_3] = 1/3$ 是无条件的,而这里需要的是 $\Pr[H_3 \mid C_1 \cap P_2]$。这个对比是”条件概率不是可选项”最有力的说明。


定理 17.3(全概率法则 / Law of Total Probability): 设 $B_1, \dots, B_n$ 是 $\Omega$ 的一个划分($B_i \cap B_j = \varnothing$ 对 $i \ne j$,且 $\bigcup_{i=1}^{n}B_i = \Omega$)。则对任意事件 $A$,

\[\Pr[A] = \sum_{i=1}^{n}\Pr[A \cap B_i] = \sum_{i=1}^{n}\Pr[A \mid B_i]\,\Pr[B_i].\]

(第二个等号要求 $\Pr[B_i] > 0$ 对所有 $i$;若某个 $\Pr[B_i] = 0$,则对应的 $\Pr[A \mid B_i]$ 无定义,但该项在第一个求和中本就为 0,可安全省略。)

证明策略直接证明(把 $A$ 按划分拆成不交并,再用可加性)。核心是集合论恒等式加一条概率公理。之所以说这是”直接证明”而非归纳,是因为无论 $n$ 是多少,论证格式完全相同。

逐步推导

  1. 拆 $A$:由 $B_1 \cup \dots \cup B_n = \Omega$, \(A = A \cap \Omega = A \cap \left(\bigcup_{i=1}^{n}B_i\right) = \bigcup_{i=1}^{n}(A \cap B_i),\) 其中第二步用的是分配律(L00 集合运算)。
  2. 验证这些块两两不交:对 $i \ne j$, \((A \cap B_i) \cap (A \cap B_j) = A \cap (B_i \cap B_j) = A \cap \varnothing = \varnothing,\) 因为 $B_i \cap B_j = \varnothing$。所以 $\{A \cap B_i\}_{i=1}^{n}$ 是一族两两不交的集合。
  3. 用可加性:既然 $A$ 是这些不交块的不交并,由概率的可加性公理(L15 的核心公理,本讲定理 17.1 也再次验证了它在条件化后保持), \(\Pr[A] = \Pr\!\left[\bigcup_{i=1}^{n}(A \cap B_i)\right] = \sum_{i=1}^{n}\Pr[A \cap B_i].\)
  4. 换成条件概率形式:对每个满足 $\Pr[B_i] > 0$ 的 $i$,由条件概率定义 $\Pr[A \cap B_i] = \Pr[A \mid B_i]\Pr[B_i]$(这等价于定理 17.2 的两事件情形)。代入即得 \(\Pr[A] = \sum_{i=1}^{n}\Pr[A \mid B_i]\,\Pr[B_i]. \qquad \blacksquare\)

【证明机制解说】:整个证明只有一步不太显然:步骤 2 的不交性。为什么”$B_i$ 两两不交”能推出”$A \cap B_i$ 两两不交”?因为与固定集合 $A$ 取交不会让两个不交的集合重新重叠——交运算只会让集合变小。这与定理 17.1 步骤 1 是同一个观察的两种应用。“取交保持不交性”是概率论中使用频率最高的集合论事实之一。

$n=2$ 的常见形式(最常用!):

\[\Pr[A] = \Pr[A \mid B]\Pr[B] + \Pr[A \mid B^c]\Pr[B^c].\]

因为 $\{B, B^c\}$ 永远是一个划分。官方 Note 中的疾病检测、网球比赛、双罐取球全都用这个二划分形式。

具体算例(双罐取球的一部分):罐 1 中白色球占 $2/5$,罐 2 中白色球占 $1/2$,随机等概率选罐再取一球。则”取到白球”的概率为 \(\Pr[f] = \Pr[f \mid B_1]\Pr[B_1] + \Pr[f \mid B_2]\Pr[B_2] = \frac25 \times \frac12 + \frac12 \times \frac12 = \frac{2}{10} + \frac{1}{4} = \frac{4}{20} + \frac{5}{20} = \frac{9}{20} = 0.45.\) 脚本验算:$2/5 \times 0.5 + 1/2 \times 0.5 = 0.45 = 9/20$。$\checkmark$

反例(划分必须完整,否则公式失效):在上面的双罐问题里,若漏掉罐 2(只计算 $\Pr[f \mid B_1]\Pr[B_1] = 2/10$),就会把 $\Pr[f]$ 严重低估为 $2/10 = 0.2$(正确值是 $0.45$)。更糟的是,用它做贝叶斯更新会得到 \(\Pr[B_1 \mid f] = \frac{2/10}{2/10} = 1,\) 即”必然来自罐 1”——一个荒谬的结论(正确答案是 $4/9 \approx 0.444$)。这清楚地说明:全概率法则的分母必须是”穷尽所有互斥情形”的和。漏掉任何一种情形,整个贝叶斯更新就崩了。 脚本验算对比:漏项版本给出 $1.0$,正确版本给出 $4/9 = 0.4444\ldots$。$\checkmark$

另一个反例(划分中的块必须互斥):若把 $B_1$ = “取到白球”,$B_2$ = “取到小球”当作划分(这两个事件可以同时发生),则 $\Pr[B_1] + \Pr[B_2]$ 可能超过 1,求和会重复计数。“划分”两个字里的”互斥”和”穷尽”两条要求同等重要。


定理 17.4(贝叶斯法则 / Bayes’ Rule): 设 $A, B$ 是事件,$\Pr[A] > 0, \Pr[B] > 0$。则

\[\Pr[B \mid A] = \frac{\Pr[A \mid B]\,\Pr[B]}{\Pr[A]}.\]

更一般地,设 $B_1, \dots, B_n$ 是 $\Omega$ 的划分且各 $\Pr[B_i] > 0$,则对每个 $i$:

\[\Pr[B_i \mid A] = \frac{\Pr[A \mid B_i]\,\Pr[B_i]}{\sum_{j=1}^{n}\Pr[A \mid B_j]\,\Pr[B_j]}.\]

证明策略直接证明(两次套用条件概率定义 + 一次全概率法则)。这个”定理”实际上没有独立的新内容——它是乘法法则与全概率法则的直接组合。把它单列为定理,是因为它在应用中的地位极高,值得作为一个可独立调用的公式。

逐步推导

  1. 由条件概率定义(用于 $\Pr[B \mid A]$):$\Pr[B \mid A] = \dfrac{\Pr[B \cap A]}{\Pr[A]}$。
  2. 由乘法法则(定理 17.2,交换角色):$\Pr[B \cap A] = \Pr[A \mid B]\Pr[B]$。
  3. 代入步骤 1:$\Pr[B \mid A] = \dfrac{\Pr[A \mid B]\Pr[B]}{\Pr[A]}$。这是基本形式,其中 $\Pr[A]$ 需要另外算。$\checkmark$
  4. 一般形式:用全概率法则(定理 17.3)把分母展开, \(\Pr[A] = \sum_{j=1}^{n}\Pr[A \mid B_j]\Pr[B_j],\) 代入步骤 3 即得 \(\Pr[B_i \mid A] = \frac{\Pr[A \mid B_i]\Pr[B_i]}{\sum_{j=1}^{n}\Pr[A \mid B_j]\Pr[B_j]}. \qquad \blacksquare\)
  5. 用以核验的一个好习惯:分母 $\Pr[A]$ 与 $i$ 无关,所以各后验 $\Pr[B_i \mid A]$ 之和为 \(\sum_i \Pr[B_i \mid A] = \frac{\sum_i \Pr[A \mid B_i]\Pr[B_i]}{\sum_j \Pr[A \mid B_j]\Pr[B_j]} = 1.\) 这提供了免费的自检:所有候选原因的后验概率必须加起来等于 1。 如果你算出来是 $0.8$ 或 $1.3$,一定哪里错了(通常是漏了划分中的某一项,或把 $\Pr[A \mid B_i]$ 与 $\Pr[B_i \mid A]$ 弄混)。

【证明机制解说】:贝叶斯法则的”机制”可以记成三步口诀:

========== 贝叶斯更新的三步流程 ==========

        先验 Pr[B]  ──────────────────────┐
                                        │
        似然 Pr[A|B] ───────────────────┤──→ 相乘 ──→ 联合 Pr[A ∩ B]
                                        │              (未归一化的后验)
                                        │                    │
                                        │                    ▼
        分母 Pr[A] = Σ_j Pr[A|B_j]Pr[B_j]  ─────────→ 归一化 (除以 Pr[A])
                                                             │
                                                             ▼
                                                   后验 Pr[B|A]

  口诀:  后验  ∝  似然 × 先验
         归一化常数 = Pr[A] = 所有 "似然 × 先验" 之和

要强调的核心问题:贝叶斯法则处理的方向翻转问题。现实中我们容易测量的是 $\Pr[\text{阳性} \mid \text{患病}]$(临床试验能设计出来),而临床真正需要的是 $\Pr[\text{患病} \mid \text{阳性}]$(拿到阳性报告后我到底有多大概率生病)。这两个数字可以相差一个数量级,见下文算例。这就是”检察官谬误(prosecutor’s fallacy)”的数学根源。

错误方向的反例($\Pr[A \mid B] \ne \Pr[B \mid A]$)

  • 取 $A$ = “检测阳性”,$B$ = “患病”。设患病率 $\Pr[B] = 1/1000$,灵敏度 $\Pr[A \mid B] = 0.99$,特异度 $= 0.99$(即假阳性率 $1\%$)。脚本验算:
    • $\Pr[A] = 0.001 \times 0.99 + 0.999 \times 0.01 = 0.00099 + 0.00999 = 0.01098$。
    • $\Pr[B \mid A] = 0.00099 / 0.01098 = 0.09016\ldots \approx 9.02\%$。
    • 而 $\Pr[A \mid B] = 99\%$。
  • 两个数相差约 11 倍。 把后者当成前者,就是 11 倍的错误(实际应用中足以让一个人做出完全错误的医疗决定)。
  • 极端反例:把患病率降到百万分之一($10^{-6}$),并让检测更准(灵敏度与特异度都是 $0.999$)。脚本验算:$\Pr[B \mid A] = 0.000998\ldots \approx 0.0998\%$。也就是说,即使检测准确率 99.9%,对一个百万人中才有一例的疾病,阳性报告只意味着约千分之一的患病概率。 这个结果近乎反直觉,但它完全正确:假阳性的绝对数量(约 999 人/百万)远超真阳性(约 1 人/百万)。贝叶斯法则不是”更精确的计算”,它是防止直觉犯错的唯一工具。

定理 17.5(均匀空间下的条件概率退化为计数比): 若概率空间均匀($\vert \Omega\vert = N$ 且每个样本点概率 $1/N$),则对任意事件 $A, B$ 且 $B \ne \varnothing$,

\[\Pr[A \mid B] = \frac{\vert A \cap B\vert }{\vert B\vert }.\]

证明策略直接证明。这条命题是 L16 与 L17 之间的桥梁:它说明条件概率在均匀情形下就是”在缩小的样本空间 $B$ 里做计数”。之所以值得单列,是因为它把 L16 的全部组合技巧直接搬到了条件概率中。

逐步推导

  1. 由均匀性,$\Pr[A \cap B] = \vert A \cap B\vert /N$,$\Pr[B] = \vert B\vert /N$。
  2. 代入定义:$\Pr[A \mid B] = \dfrac{\vert A \cap B\vert /N}{\vert B\vert /N} = \dfrac{\vert A \cap B\vert }{\vert B\vert }$($N$ 约掉)。$\blacksquare$
  3. 注意:$B \ne \varnothing$ 保证 $\vert B\vert > 0$,即 $\Pr[B] > 0$,条件概率有定义。

【证明机制解说】:这一步看似平凡,但它是大量 CS70 条件概率题的实际解法。$N$ 被约掉这个事实说明:在均匀空间里,条件化不需要重新算总样本空间的大小,只需要在 $B$ 内部数。这正是”样本空间缩减”的精确含义。

算例(球与箱):$m = 4$ 个有标号球投入 $n = 3$ 个有标号箱,均匀空间,$\vert \Omega\vert = 3^4 = 81$。设 $A$ = “1 号箱为空”,$B$ = “2 号箱为空”。

  1. 方法一(直接计数):$A \cap B$ = “1、2 号箱都空” = “4 个球全在 3 号箱”,只有 1 个样本点。$\vert B\vert $ = “4 个球都在 2、3 号箱” $= 2^4 = 16$。故 $\Pr[A \mid B] = 1/16 = 0.0625$。
  2. 方法二(定义式):$\Pr[A] = (2/3)^4 = 16/81$(”1 号箱为空”= 每球都落进另两个箱),$\Pr[B] = 16/81$,$\Pr[A \cap B] = 1/81$(全落 3 号箱),故 \(\Pr[A \mid B] = \frac{1/81}{16/81} = \frac{1}{16}.\)
  3. 脚本暴力枚举($3^4 = 81$ 种情形全跑一遍):总数 81,$\vert B\vert = 16$,$\vert A \cap B\vert = 1$,$\Pr[A \mid B] = 0.0625$。$\checkmark$
  4. 解读:$\Pr[A] = 16/81 \approx 0.1975$,而 $\Pr[A \mid B] = 0.0625$。知道 2 号箱空了,大大降低了 1 号箱也空的概率(因为球挤到更少的箱子里去了,”2 号也空着”这件事本身就暗示”球集中”)。这叫负相关(negatively correlated)

与经典问题的联系

一、医学检验悖论(Medical Test Paradox)——本讲最重要的算例

问题设置:某疾病在人群中的患病率(先验)为 $1/1000$。检验的灵敏度(sensitivity)为 $99\%$(患者中 $99\%$ 检出阳性),特异度(specificity)为 $99\%$(健康人中 $99\%$ 检出阴性,即假阳性率为 $1\%$)。问:一个人检测阳性,他真正患病的概率是多少?

数学建模:设 $D$ = “患病”,$\overline{D}$ = “健康”,$+$ = “检测阳性”,$-$ = “检测阴性”。已知 \(\Pr[D] = 0.001,\quad \Pr[+ \mid D] = 0.99,\quad \Pr[+ \mid \overline{D}] = 0.01.\) 要求 $\Pr[D \mid +]$。

求解(贝叶斯法则)

  1. 算分母(全概率法则): \(\Pr[+] = \Pr[+ \mid D]\Pr[D] + \Pr[+ \mid \overline{D}]\Pr[\overline{D}] = 0.99 \times 0.001 + 0.01 \times 0.999.\) 逐项:$0.99 \times 0.001 = 0.00099$(真阳性路径);$0.01 \times 0.999 = 0.00999$(假阳性路径)。 \(\Pr[+] = 0.00099 + 0.00999 = 0.01098.\)
  2. 算后验: \(\Pr[D \mid +] = \frac{\Pr[+ \mid D]\Pr[D]}{\Pr[+]} = \frac{0.00099}{0.01098} = 0.0901639\ldots \approx 9.02\%.\)
  3. 脚本验算:$0.00099/0.01098 = 0.09016393\ldots$;自然频率版本($10$ 万人中 $100$ 名患者,真阳性 $99$ 例,健康者 $99900$ 人产生假阳性 $999$ 例,阳性总数 $1098$,比例 $99/1098 = 9.0164\%$)与公式法一致。$\checkmark$

为什么只有 9%?(自然频率树状图)

========== 10 万人接受检测(自然频率树) ==========

                      100,000 人
                          │
        ┌─────────────────┴─────────────────┐
        │                                   │
     患病 0.1%                            健康 99.9%
      100 人                            99,900 人
        │                                   │
   ┌────┴────┐                        ┌─────┴─────┐
   │         │                        │           │
 阳性 99%  阴性 1%                 阳性 1%      阴性 99%
  99 人     1 人                  999 人      98,901 人
  (真阳性)                        (假阳性)
        └──────────────┬───────────────┘
                       ▼
              阳性总人数 = 99 + 999 = 1,098 人
                       │
        其中真患病者占比 = 99 / 1,098 = 9.02%   ← 后验

  关键对比:
     Pr[+ | D]  = 99/100    = 99%      (灵敏度,医生从说明书上看到的)
     Pr[D | +]  = 99/1098   ≈  9.02%   (后验,病人真正想知道的)
                        ↑ 相差约 11 倍!

解释”为什么”:疾病的稀有性(先验极低)把天平压向了假阳性。虽然检测本身很准(每 100 个健康人只有 1 个误报),但健康人的基数是患者的约 1000 倍,所以假阳性的绝对数量(999)是真阳性(99)的约 10 倍。后验概率取决于”路径的绝对大小”(似然 × 先验),而不只是似然。 这也是为什么对稀有病的筛查必须用高特异度检测,且阳性结果通常需要复查确认。

先验的影响(脚本验算的对照表):固定灵敏度 $=$ 特异度 $= 0.99$,只改先验:

患病率(先验)检测阳性后的后验
0.1%(1/1000)9.02%
1%50.00%
5%83.90%
10%91.67%
50%99.00%

(全部经脚本验算。)同一份检测报告,在不同先验下含义完全不同。 这就是”先验”在贝叶斯框架中不可或缺的原因,也是”只看似然”的 MLE 在稀有事件上会犯大错的原因。

二、官方 Note 的检验算例:5% 患病率、90% 灵敏度、80% 特异度

设置:$\Pr[A] = 0.05$(患病人群占比),$\Pr[B \mid A] = 0.9$(患者 $90\%$ 阳性),$\Pr[B \mid \overline{A}] = 0.2$(健康人 $20\%$ 阳性,即假阳性率 $20\%$,特异度 $80\%$)。

推导

  1. 分母:$\Pr[B] = \Pr[B \mid A]\Pr[A] + \Pr[B \mid \overline{A}]\Pr[\overline{A}] = 0.9 \times 0.05 + 0.2 \times 0.95 = 0.045 + 0.19 = 0.235$。
  2. 后验:$\Pr[A \mid B] = \dfrac{0.045}{0.235} = \dfrac{45}{235} = \dfrac{9}{47} \approx 0.1915$。
  3. 脚本验算:$0.045/0.235 = 0.19148936\ldots = 9/47$。$\checkmark$
  4. 解读:先验 $5\%$ 被更新到约 $19\%$——上升了约 4 倍但远不是”几乎确定”。这次”只有” $19\%$ 的原因同样是假阳性($0.19$ vs 真阳性 $0.045$,比值约 $4.2$)。这个例子告诉我:灵敏度高不代表后验高;关键在于”似然比” $\frac{\Pr[B\mid A]}{\Pr[B\mid \overline{A}]} = \frac{0.9}{0.2} = 4.5$ 与先验的乘积。

三、双罐取球(Bayes + 全概率 + MAP/MLE)

设置:两个罐子(官方 Note 中的图示:罐 1 含 2 白 3 黑,罐 2 含 1 白 1 黑)。等概率选一个罐子,再均匀随机取一球。取到白球(记作 $f$),问:来自罐 1 的概率是多少?

常见的错误直觉:”总共有 3 个白球,其中 2 个在罐 1,所以答案是 $2/3$。” 错在哪里:这个推理只数了球,没有数概率——它忽略了”罐 2 只有 2 个球,而罐 1 有 5 个球”,即罐 2 的白球更”浓缩”,被取到的概率更高。

正确解法(贝叶斯 + 全概率)

  1. 已知 $\Pr[f \mid B_1] = 2/5$,$\Pr[f \mid B_2] = 1/2$,$\Pr[B_1] = \Pr[B_2] = 1/2$。
  2. 分母(全概率法则):$\Pr[f] = \dfrac25 \times \dfrac12 + \dfrac12 \times \dfrac12 = \dfrac{2}{10} + \dfrac{1}{4} = \dfrac{9}{20} = 0.45$。
  3. 后验:$\Pr[B_1 \mid f] = \dfrac{(2/5)(1/2)}{9/20} = \dfrac{2/10}{9/20} = \dfrac{4}{9} \approx 0.4444$。
  4. 脚本验算:$(2/10)/(9/20) = 0.44444\ldots = 4/9$。$\checkmark$ 确实是 $4/9$ 而不是 $2/3$ —— 直觉错在”样本点的权重”。
  5. 自检:$\Pr[B_2 \mid f] = 1 - 4/9 = 5/9$。两个后验之和为 1。$\checkmark$

MLE vs MAP(同一算例)

  • MLE(只看似然,假设先验均匀):$\Pr[f \mid B_1] = 0.4 < \Pr[f \mid B_2] = 0.5$,故 $\hat{B}_{\text{MLE}} = B_2$(罐 2 更能产生白球)。
  • MAP(乘上先验):先验均匀时 $\Pr[f \cap B_1] = 0.2 < \Pr[f \cap B_2] = 0.25$,故 $\hat{B}_{\text{MAP}} = B_2$,与 MLE 一致。
  • 先验非均匀的情形:若 $\Pr[B_1] = p$,则 \(\Pr[f \cap B_1] = \frac25 p, \qquad \Pr[f \cap B_2] = \frac12(1-p).\) 令前者大于后者:$\frac25 p > \frac12(1-p) \Rightarrow 0.4p > 0.5 - 0.5p \Rightarrow 0.9p > 0.5 \Rightarrow p > \frac{5}{9}$。 脚本验算:阈值 $= 0.5/0.9 = 0.5555\ldots = 5/9$;取 $p = 0.6$ 得 $\Pr[f \cap B_1] = 0.24 > \Pr[f \cap B_2] = 0.2$,MAP 翻转为 $B_1$;取 $p = 0.5$(均匀)得 $0.2 < 0.25$,MAP 为 $B_2$。$\checkmark$
  • 结论当 $\Pr[B_1] > 5/9$ 时,MAP 选罐 1,而 MLE 永远选罐 2(因为 MLE 不看先验)。 这是”先验如何压倒数据”的最清晰示例。实践中的一般原则:有可靠的先验就用 MAP,先验不可靠或数据量很大(似然会主导)时用 MLE。

四、Monty Hall 用贝叶斯重做

设置:选手选门 1,主持人开了门 3(露出山羊)。求奖品在门 2 的条件概率 $\Pr[P_2 \mid C_1 \cap H_3]$。

求解

  1. 三个候选原因 $\{P_1, P_2, P_3\}$ 构成一个划分(奖品必在某一门后),各先验 $\Pr[P_i] = 1/3$。
  2. 似然(在选手已选门 1 的前提下):
    • 若奖品在门 1($\Pr[P_1 \mid C_1] = 1/3$),主持人可在门 2、3 中任选,$\Pr[H_3 \mid C_1 \cap P_1] = 1/2$。
    • 若奖品在门 2,主持人不能开门 1(选手选了)、不能开门 2(有奖品),只能开门 3,$\Pr[H_3 \mid C_1 \cap P_2] = 1$。
    • 若奖品在门 3,主持人绝不能开门 3,$\Pr[H_3 \mid C_1 \cap P_3] = 0$。
  3. 分母(全概率法则): \(\Pr[C_1 \cap H_3] = \Pr[C_1]\left[\Pr[P_1\mid C_1]\cdot\tfrac12 + \Pr[P_2\mid C_1]\cdot 1 + \Pr[P_3\mid C_1]\cdot 0\right] = \frac13\left(\frac16 + \frac13\right) = \frac13 \cdot \frac12 = \frac16.\) (用联合概率核对:$\Pr[C_1 \cap P_1 \cap H_3] = \frac13\cdot\frac13\cdot\frac12 = \frac1{18}$,$\Pr[C_1 \cap P_2 \cap H_3] = \frac13\cdot\frac13\cdot 1 = \frac19$,二者之和 $\frac1{18}+\frac2{18} = \frac3{18} = \frac16$。$\checkmark$)
  4. 后验: \(\Pr[P_2 \mid C_1 \cap H_3] = \frac{1/9}{1/6} = \frac{2}{3}, \qquad \Pr[P_1 \mid C_1 \cap H_3] = \frac{1/18}{1/6} = \frac{1}{3}.\)
  5. 脚本验算:$(1/9)/(1/6) = 0.6667$,$(1/18)/(1/6) = 0.3333$。$\checkmark$ 自检:$2/3 + 1/3 = 1$。$\checkmark$
  6. 与 L16 的树形计数法对照:L16 是通过枚举 12 个样本点、按 $i \ne j$ / $i = j$ 两类求和得到 $\frac69 = \frac23$;这里是在给定证据下重新分配概率质量。两种方法结果一致——条件概率不是新数学,它只是把”数样本点”换成了”按权重重新归一化”,后者在样本空间庞大或不可枚举时是唯一可行的办法。

五、其他经典场景

  • 连抽两张 A(乘法法则):见核心概念部分的算例,$\Pr = \frac{4}{52}\cdot\frac{3}{51} = \frac{1}{221}$。注意 $\Pr[A_2 \mid A_1] = 3/51 < \Pr[A_2] = 1/13$——不放回抽样导致负相关
  • 同花概率(乘法法则的另一条路径):$\Pr[\text{红心同花}] = \frac{13}{52}\cdot\frac{12}{51}\cdot\frac{11}{50}\cdot\frac{10}{49}\cdot\frac{9}{48}$,再乘 4 得全同花概率。这与 L16 的 $\frac{4\binom{13}{5}}{\binom{52}{5}}$ 完全一致(脚本验算 $0.00198079$)。两条路径互为验算。
  • 三骰子赌局(全概率 + 容斥):选一个数字,掷三枚骰子,至少一枚出现该数字则赢。$\Pr[\text{赢}] = 1 - (5/6)^3 = 1 - 125/216 = 91/216 \approx 0.4213$(用补集算最方便)。脚本暴力枚举 216 种结果:$91$ 种获胜,$91/216 = 0.42129629\ldots$。$\checkmark$ 赌场声称的”$3 \times 1/6 = 50\%$”是错的(把不互斥事件当互斥),正确值 $42.13\%$,赌场占了便宜。这个例子会在 L18 用容斥原理系统地重做。
  • 生日悖论中的条件视角:已知有 $n$ 个人,求”某两人的生日相同”的概率——不多说,L16 已给出 $1 - \frac{365\cdots(365-n+1)}{365^n}$。
  • 垃圾邮件过滤(朴素贝叶斯):$\Pr[\text{垃圾} \mid \text{含”中奖”}] = \frac{\Pr[\text{含”中奖”} \mid \text{垃圾}]\Pr[\text{垃圾}]}{\Pr[\text{含”中奖”}]}$。这正是本讲公式的工业级应用:先验来自历史邮件统计,似然来自词频统计,后验是过滤决策的分数。“朴素”之处在于它假设各词条件独立(L18 的内容)。

与其他讲次的关联

  • 与 L15(Probability Foundations):条件概率的定义直接建构在 L15 的公理体系上。本讲定理 17.1 就是把 L15 的三条公理逐条搬进缩小的样本空间 $B$,确认它仍是一个合法概率空间。没有 L15 的”事件 = 子集、概率 = 可加测度”,条件概率无从定义。
  • 与 L16(Combinatorial Proofs):定理 17.5 是本讲与 L16 的接口——均匀空间下 $\Pr[A \mid B] = \vert A \cap B\vert /\vert B\vert $,于是 L16 的全部组合论证(双计数、双射)都能直接用来算条件概率。反过来说,L16 中”取补集”的双射也解释了为什么 $\Pr[A^c \mid B] = 1 - \Pr[A \mid B]$。
  • 与 L18(Independence & Combination of Events):本讲的乘积法则与独立性的关系是:$\Pr[A \cap B] = \Pr[A]\Pr[B]$ 成立 $\iff$ $\Pr[A \mid B] = \Pr[A]$ $\iff$ $A$ 与 $B$ 独立。L18 会把独立性给成正式定义,并讨论两两独立但不相互独立(用抛两次硬币的 $A, B, C$ 例子)、条件独立 ≠ 独立等高阶陷阱。L18 还会把 L14/L16 的容斥原理改写成概率形式,用于处理 L17 已经出现的”三骰子赌局”这类并集问题。
  • 与 L19(Random Variables & Discrete Distributions):二项分布的构造依赖本讲:$\Pr[\text{恰 }r\text{ 个正面}] = \binom{n}{r}p^r(1-p)^{n-r}$ 之所以成立,是因为我们假设各次抛掷独立,从而 $\Pr[\text{某个特定含 }r\text{ 个正面的序列}] = p^r(1-p)^{n-r}$(L15 是直接”定义”了这个样本点概率,本讲用乘法法则证明了这样定义与独立性一致)。
  • 与 L20/L21(Expectations;Joint Distributions):L21 会用条件分布 $p_{X \mid Y}(x \mid y) = \frac{p_{X,Y}(x,y)}{p_Y(y)}$ 定义随机变量的条件化——这是本讲的直接推广(事件 → 随机变量取值)。L26 的条件期望 $\mathbb{E}[X \mid Y]$ 与马尔可夫链的转移概率 $P_{ij} = \Pr[X_{t+1} = j \mid X_t = i]$ 全都是条件概率。
  • 与 L22(Variance & Covariance):条件期望会导出全期望法则(law of total expectation)$\mathbb{E}[X] = \sum_i \mathbb{E}[X \mid B_i]\Pr[B_i]$——与本讲定理 17.3 完全平行。“按划分分情形”是贯穿 L17–L26 的统一技巧。
  • 与 L23(Concentration Inequalities):切尔诺夫界(Chernoff bound)的推导会用到”$\Pr[X \ge a] = \Pr[e^{tX} \ge e^{ta}]$”这类变换,其核心仍是条件化的思想(把事件限定在尾部)。而证明中反复出现 $\Pr[A \mid B] \le \Pr[A]/\Pr[B]$ 这类估计。
  • 与 L13(Computability)/L12(Countability):这些讲次讨论”不可判定”与”不可数”的硬边界,本讲讨论的是在信息不完全下如何做出最优(贝叶斯意义下)判断——这是 CS70 从”什么是可计算的”过渡到”什么是可合理相信的”的转折点。
  • 与 L02(Proof Techniques II):本讲大量使用”分情形”(定理 17.3 的划分)与”取补集”($\Pr[A] = 1 - \Pr[A^c]$)。证明技巧层面,本讲没有新工具;新的是”概率质量必须归一化”这一约束下如何组织这些技巧。

关键要点

  1. 条件概率的定义与三大推论

    名称公式用途
    定义$\Pr[A \mid B] = \dfrac{\Pr[A \cap B]}{\Pr[B]}$已知 $B$ 求 $A$
    乘法法则$\Pr[A \cap B] = \Pr[A]\Pr[B \mid A]$求交集;链式推广到 $n$ 个事件
    全概率法则$\Pr[A] = \sum_i\Pr[A \mid B_i]\Pr[B_i]$分母;分情形加权平均
    贝叶斯法则$\Pr[B \mid A] = \dfrac{\Pr[A \mid B]\Pr[B]}{\Pr[A]}$方向翻转;后验 $\propto$ 似然 × 先验

    记忆锚点:定义是”除以 $\Pr[B]$”;乘法法则是”定义式移项”;全概率法则是”按划分切块再相加”;贝叶斯法则是”乘法法则 + 全概率法则”。四条公式只有一条是新的(定义),其余全是组合。

  2. 样本空间缩减是唯一正确的直觉。条件化 = “世界只剩 $B$” + “把 $B$ 拉伸到总面积 1”。这个图像能一句话解释为什么必须除以 $\Pr[B]$(不除的话 $B$ 内部概率和只有 $\Pr[B] < 1$,不满足归一化公理)。

  3. 贝叶斯法则的核心用途是翻转方向:$\Pr[\text{原因} \mid \text{证据}] \leftarrow \Pr[\text{证据} \mid \text{原因}]$。现实中最容易测的是似然(临床试验、词频统计),最想要的是后验(诊断、分类)。先验(罕见的疾病、常见的垃圾邮件)会极大地放大似然的误导性。

  4. MLE vs MAP 一句话区分:$\hat{B}{\text{MLE}} = \arg\max \Pr[A \mid B_i]$(只信数据),$\hat{B}{\text{MAP}} = \arg\max \Pr[A \mid B_i]\Pr[B_i]$(数据 + 先验)。先验均匀时二者一致;先验差距足够大时,MAP 可以完全无视似然的排序(双罐例中阈值 $\Pr[B_1] > 5/9$)。

  5. 自检的两条”免费验算”
    • 划分自检:所有候选原因的后验必须加起来为 1,即 $\sum_i\Pr[B_i \mid A] = 1$。这能立刻逮住”划分漏项”的错误。
    • 量级自检:若先验很小时后验却接近 1,几乎肯定是漏掉了假阳性路径(分母少了一项)。先验 $\times$ 似然比 $\gg 1$ 才是后验高的条件。
  6. 数值计算的三条黄金率
    • 分母 $\Pr[A]$ 一定要由全概率法则算出,不能凭空假设。
    • 自然频率($10$ 万人中有多少)代替小数,能大幅减少直觉错误——疾病检测例子中 $99/(99+999)$ 比 $0.00099/0.01098$ 直观得多。
    • 先写联合概率(似然 × 先验)的每一项,最后再除以总和。逐项写出”路径大小”是避免漏项的机械办法。

常见误区与注意事项

  1. 混淆 $\Pr[A \mid B]$ 与 $\Pr[B \mid A]$(检察官谬误 / Prosecutor’s Fallacy)。这是本讲的头号错误,也是最严重的错误,因为它会导致司法与医疗上的灾难性判断。
    • 具体数值反例:$\Pr[\text{阳性} \mid \text{患病}] = 99\%$,而 $\Pr[\text{患病} \mid \text{阳性}] = 9.02\%$(患病率 $1/1000$、特异度 $99\%$)。两者相差约 11 倍。
    • 检察官谬误的经典形态:”DNA 匹配概率是百万分之一,所以被告无辜的概率只有百万分之一。”——错了。在 $1000$ 万人口的数据库中,无辜者匹配率百万分之一意味着期望约有 $10$ 个无辜者也会匹配,因此 $\Pr[\text{有罪} \mid \text{匹配}] \approx \frac{1}{1+10} \approx 9\%$(脚本验算:$0.0909$)。若匹配率降到十亿分之一,则假阳性期望约 $0.01$,$\Pr[\text{有罪} \mid \text{匹配}] \approx 99\%$(脚本验算:$0.9901$)。同一个”匹配率”,在不同数据库规模下含义完全不同。
    • 防范方法:写公式前先明确”我要求的是谁在竖线左边、谁在右边”,并用 $\Pr[A \mid B]\Pr[B] = \Pr[A \cap B] = \Pr[B \mid A]\Pr[A]$ 做一次交叉验算。
  2. 把条件概率算成了联合概率(忘记除以 $\Pr[B]$)。这是最”机械”的错误。
    • 具体数值反例:两枚骰子,已知和为 8,求”至少有一枚 3”的概率。正确答案是 $\Pr[A \mid B] = \vert A \cap B\vert /\vert B\vert = 2/5 = 0.4$。若误答 $\vert A \cap B\vert /\vert \Omega\vert = 2/36 = 0.0556$,就少了 $7.2$ 倍;若误答 $\Pr[A] = 11/36 = 0.3056$,也没有回答”已知和为 8”这个问题。脚本验算:$\vert B\vert = 5$,$\vert A \cap B\vert = 2$,$\vert A\vert = 11$,三个数字必须分清。
    • 防范方法:每个条件概率题第一句话就写下 $\Pr[\cdot \mid \cdot] = \frac{\Pr[\cdot \cap \cdot]}{\Pr[\cdot]}$ 的骨架,再把数字填进去。
  3. 把不互斥事件当互斥(滥用 $\Pr[A \cup B] = \Pr[A] + \Pr[B]$)
    • 具体数值反例:三枚骰子,至少一枚出现指定数字。错误算法 $3 \times 1/6 = 1/2$;正确答案 $1 - (5/6)^3 = 91/216 \approx 0.4213$。若按错误算法推广到六枚骰子会得到 $6 \times 1/6 = 1$(”必然获胜”),显然荒谬。脚本验算:$91/216 = 0.42129629\ldots$
    • 防范方法:求并集概率优先考虑补集($1 - \Pr[\text{全部不发生}]$,当各事件独立时最省事)或容斥原理(L14/L18)。互斥才可以直接相加。
  4. 在条件概率中错误地”缩小样本空间”(把 $\Pr[A \mid B]$ 当作”在 $B$ 里重新数,但忘了权重”)。
    • 具体数值反例:双罐取球,错误直觉”$3$ 个白球中 $2$ 个在罐 1,故答案是 $2/3$”。正确答案 $4/9 \approx 0.4444$。错因是罐 1 有 5 个球而罐 2 只有 2 个球,罐 2 的白球被抽中的概率更高——样本点的权重不同,不能只数个数。
    • 防范方法:样本空间缩减只在均匀空间下等价于纯计数(定理 17.5)。若非均匀,必须用 $\Pr[A \cap B]/\Pr[B]$ 的加权形式。
  5. 划分不完整(全概率法则漏情形)
    • 具体数值反例:双罐取球中只算罐 1 那一项,得 $\Pr[f] = 0.2$(正确 $0.45$),进而得 $\Pr[B_1 \mid f] = 1$(正确 $4/9$)——荒谬的确定性结论
    • 防范方法:写完划分 $\{B_1,\dots,B_n\}$ 后立刻验证 $\sum_i\Pr[B_i] = 1$ 且 $B_i$ 两两不交。做完贝叶斯更新后再验证 $\sum_i\Pr[B_i \mid A] = 1$。
  6. 把独立与互斥混为一谈
    • 互斥:$A \cap B = \varnothing$,故 $\Pr[A \cap B] = 0$,在 $\Pr[A], \Pr[B] > 0$ 时 $\Pr[A \mid B] = 0 \ne \Pr[A]$ —— 互斥事件(几乎)永远不独立,且是极端负相关。
    • 独立:$\Pr[A \cap B] = \Pr[A]\Pr[B]$,通常 $A \cap B \ne \varnothing$ —— 独立事件通常可以同时发生。
    • 具体例子:抛一枚公平硬币,$A$ = “正面”,$B$ = “反面”。$\Pr[A \cap B] = 0 \ne \frac12 \cdot \frac12 = \frac14$,互斥但不独立。反之掷两次骰子,”第一次是 1”与”第二次是 1”独立($\frac1{36} = \frac16 \cdot \frac16$)但不互斥(可以都发生)。“独立”讲的是概率的乘法关系,”互斥”讲的是集合的交集为空——两个完全不同的概念。
  7. 忽略条件独立性 ≠ 独立性(预告 L18)。两个事件在无条件意义下可能不独立,但在给定某个条件下却独立(反之亦然)。例如某疾病的两种症状在人群中相关(都因同一个病引起),但在”已确诊患该病”的条件下可能独立。在贝叶斯网络与朴素贝叶斯分类器中,这个区别是模型假设的核心。

思考题(带答案)

Q1.(纯计算) 掷两枚公平硬币。已知至少有一枚是正面,求两枚都是正面的概率。

答案 设 $A$ = "两枚都是正面" $= \\{HH\\}$,$B$ = "至少一枚正面" $= \\{HH, HT, TH\\}$。均匀样本空间 $\\Omega = \\{HH, HT, TH, TT\\}$,$\\vert \\Omega\\vert = 4$。 $$\Pr[A \mid B] = \frac{\Pr[A \cap B]}{\Pr[B]} = \frac{\vert A \cap B\vert /4}{\vert B\vert /4} = \frac{1}{4}\Big/\frac{3}{4} = \frac{1}{3}.$$ 脚本验算:$(1/4)/(3/4) = 0.3333\\ldots$。$\\checkmark$ **为什么不是 $1/2$?** 这是本讲最经典的陷阱。$\\Omega$ 有四个等可能样本点,知道"至少一枚正面"后,世界只剩 $3$ 个样本点($HH, HT, TH$),其中只有 $1$ 个是 $HH$,故是 $1/3$。 **为什么很多人答 $1/2$?** 因为他们错误地把"已知至少一枚正面"当成了"**已知第一枚是正面**"(后者确实给出 $\\Pr[\\text{两枚都正} \\mid \\text{第一枚正}] = 1/2$)。**两条信息不同,答案就不同。** 这个对比是"条件必须读准"的最好教材。 **推广(两孩问题)**:一个家庭有两个孩子,"已知至少一个是男孩,求两个都是男孩"的概率是 $1/3$;但"已知老大是男孩,求两个都是男孩"的概率是 $1/2$。**脚本验算:前者 $1/3$($3$ 种情形中 $1$ 种),后者 $1/2$($B$ 打头的 $2$ 种情形中 $1$ 种)。**

Q2.(纯计算,疾病检测的变体) 某病患病率 $1\%$。检测灵敏度 $99\%$,特异度 $99\%$。某人检测阳性,求他患病的概率。

答案 设 $D$ = 患病,$+$ = 阳性。 - 先验:$\\Pr[D] = 0.01$,$\\Pr[\\overline{D}] = 0.99$。 - 似然:$\\Pr[+ \\mid D] = 0.99$,$\\Pr[+ \\mid \\overline{D}] = 0.01$。 **第一步(全概率法则算分母)**: $$\Pr[+] = 0.99 \times 0.01 + 0.01 \times 0.99 = 0.0099 + 0.0099 = 0.0198.$$ **第二步(贝叶斯)**: $$\Pr[D \mid +] = \frac{0.0099}{0.0198} = 0.5 = 50\%.$$ **脚本验算**:$0.01\\times0.99/(0.01\\times0.99+0.99\\times0.01) = 0.5$。$\\checkmark$ **重要观察**:当**患病率恰好等于假阳性率**(都是 $1\\%$)时,真阳性路径与假阳性路径大小完全相同(都是 $0.0099$),后验恰为 $50\\%$。对比患病率 $1/1000$ 时的 $9.02\\%$,可以看到:**后验对先验极度敏感。** 下表(已脚本验算)总结了灵敏度与特异度都固定为 $99\\%$ 时的情形: | 先验患病率 | 后验 $\\Pr[D \\mid +]$ | |:---|:---| | 0.1% | 9.02% | | 1% | 50.00% | | 5% | 83.90% | | 10% | 91.67% | | 50% | 99.00% | **自然频率检验($10$ 万人)**:患者 $1000$ 人 → 真阳性 $990$;健康者 $99000$ 人 → 假阳性 $990$;阳性总数 $1980$;比例 $990/1980 = 50\\%$。$\\checkmark$ **结论**:**同一份检测报告在不同人群中的意义完全不同**——这就是为什么对高危人群筛查比对全人群普查更有价值(先验高 → 后验高)。

Q3.(概念理解 / 找错误) 下面的推理错在哪里?

“某罕见病患病率 $1/1000000$。检测灵敏度 $99.9\%$、特异度 $99.9\%$。张先生检测阳性,医生说’您患病的概率是 $99.9\%$’。”

答案 **错误:医生把似然 $\\Pr[+ \\mid D]$ 当成了后验 $\\Pr[D \\mid +]$。这是检察官谬误的医学版本。** 正确计算: - 先验:$\\Pr[D] = 10^{-6}$,$\\Pr[\\overline{D}] = 1 - 10^{-6}$。 - 似然:$\\Pr[+ \\mid D] = 0.999$,$\\Pr[+ \\mid \\overline{D}] = 0.001$(假阳性率)。 - 分母:$\\Pr[+] = 0.999 \\times 10^{-6} + 0.001 \\times (1 - 10^{-6}) \\approx 0.999\\times10^{-6} + 0.000999 \\approx 0.00099999\\ldots$ - 后验: $$\Pr[D \mid +] = \frac{0.999 \times 10^{-6}}{0.999\times10^{-6} + 0.001\times(1-10^{-6})} \approx 0.000998 = 0.0998\%.$$ **脚本验算**:$0.000998\\ldots$,即约 **$0.1\\%$**(不是 $99.9\\%$;两者相差约 1000 倍)。 **自然频率解释($1$ 亿人)**: - 患者约 $100$ 人 → 真阳性约 $99.9 \\approx 100$ 人。 - 健康者约 $99{,}999{,}900$ 人 → 假阳性约 $99{,}999.9 \\approx 100{,}000$ 人。 - 阳性总数约 $100{,}100$ 人,其中真患者只占约 $1/1000$。 **为什么?** 因为病太罕见了——健康人的数量是患者的约一百万倍,即使假阳性率只有千分之一,假阳性的**绝对数量**也是真阳性的约一千倍。**后验取决于"路径的绝对大小"(似然 × 先验),而不是似然的单独数值。** **注意(一点补充,避免矫枉过正)**:这个计算假设"随机从全人群中抽一个人做检测"。若张先生**因为出现了症状才去检测**,那么他的**先验**就应该是"有该症状者中患此病的比例",而不是全人群患病率——那个先验会高得多。**贝叶斯的结论依赖于先验的选择;先验错了,后验也会错。** 这也是"医生说 99.9% 是错的、说 0.1% 也可能是错的"的原因:关键在于**用对了哪个先验**。

Q4.(证明) 证明:若 $\Pr[A] > 0$ 且 $\Pr[B] > 0$,则 $A$ 与 $B$ 独立 $\iff$ $\Pr[A \mid B] = \Pr[A]$。并说明为什么这个等价在 $\Pr[B] = 0$ 时不成立。

答案 **证明策略**:双向蕴含,两个方向都是"定义式移项"。**($\\Rightarrow$)方向用定义,$(\\Leftarrow)$ 方向用乘法法则。** **($\\Rightarrow$)设 $A$ 与 $B$ 独立**,即 $\\Pr[A \\cap B] = \\Pr[A]\\Pr[B]$。因为 $\\Pr[B] > 0$,可以除以 $\\Pr[B]$: $$\Pr[A \mid B] = \frac{\Pr[A \cap B]}{\Pr[B]} = \frac{\Pr[A]\Pr[B]}{\Pr[B]} = \Pr[A]. \qquad \checkmark$$ **($\\Leftarrow$)设 $\\Pr[A \\mid B] = \\Pr[A]$**。由条件概率的定义, $$\frac{\Pr[A \cap B]}{\Pr[B]} = \Pr[A].$$ 两边乘 $\\Pr[B] > 0$,得 $\\Pr[A \\cap B] = \\Pr[A]\\Pr[B]$,即 $A$ 与 $B$ 独立。$\\checkmark$ 由对称性(交换 $A, B$ 并注意 $\\Pr[A] > 0$),同样可证 $\\Pr[B \\mid A] = \\Pr[B]$ 也是等价的。$\\blacksquare$ **为什么 $\\Pr[B] = 0$ 时不成立?** 两方面的原因: 1. **$\\Pr[A \\mid B]$ 根本无定义**——定义式要求除以 $\\Pr[B]$,不能除以零。所以"$\\Pr[A \\mid B] = \\Pr[A]$"这句话在 $\\Pr[B]=0$ 时连**是否为真**都谈不上。 2. **集合论/测度论的微妙之处**:若 $\\Pr[B] = 0$,则无论 $\\Pr[A \\cap B]$ 是多少(只能为 $0$,因为 $A \\cap B \\subseteq B$),独立性条件 $\\Pr[A \\cap B] = \\Pr[A]\\Pr[B]$ 都退化为 $0 = 0$,**恒真**。也就是说:**在独立性定义下,任何零概率事件都与所有事件"独立",但这并不意味着它在直觉上"无关"。** **具体例子**:抛一枚公平硬币两次。令 $B = \\varnothing$(空事件,$\\Pr[B] = 0$),$A = \\{HH\\}$。则 $\\Pr[A \\cap B] = 0 = \\Pr[A]\\cdot 0$,按定义独立。但"在 $B$ 发生的前提下 $A$ 的概率"这一说法毫无意义($B$ 不可能发生)。 **结论与防范**:独立性定义(乘积形式)在 $\\Pr[B] = 0$ 时仍然良定义并有意义,而条件概率的等价形式($\\Pr[A \\mid B] = \\Pr[A]$)只在正概率时可用。**两者不可互换使用,务必记住条件 $\\Pr[B] > 0$。** 这也是 CS70 官方 Note 在陈述"独立性 $\\iff$ 条件概率不变"时明确要求 $\\Pr[B] > 0$ 的原因。