Lecture 24: Continuous Probability & Distributions(连续概率与分布)

目录 · ← l24 · l26 →

Lecture 24: Continuous Probability & Distributions(连续概率与分布)

概述

到目前为止我们处理的一切概率对象都是离散的 (discrete):样本空间 $\Omega$ 要么有限、要么可数无限,随机变量只能取有限或可数个值,分布用概率质量函数 (PMF, probability mass function) $\Pr[X = a]$ 描述。但现实世界里我们想建模的量往往天然连续:粒子在盒子里的位置、某个事件发生的时刻、顾客到达的间隔、放射性原子衰变的时间、针落下时与桌缝的夹角。本讲把离散概率的整套工具箱搬到连续世界:点概率让位给密度 (density),求和让位给积分,而其余的一切(期望、方差、线性性、独立性)几乎原封不动地搬过来。

本讲的技术核心只有一条:连续情形下必须放弃”给每个样本点赋概率”这一想法(因为那必然导致所有点概率为 $0$),改为给区间赋概率。由此引出概率密度函数 (PDF) 与累积分布函数 (CDF) 这对孪生概念,并导出三类最重要的连续分布中的两个:连续均匀分布 (continuous uniform)指数分布 (exponential)。第三个(正态分布)留给下一讲。

核心概念的直观解释

连续概率空间 (Continuous Probability Space) 与”点概率为 0”的观念转变

  • 定义:考虑”命运之轮”实验:轮盘周长 $\ell$,无偏地旋转并记录指针停下的位置。样本空间是实数区间 $\Omega = [0, \ell]$。对任意 $0 \le a < b \le \ell$,定义 \(\Pr\big[[a,b]\big] = \frac{\text{区间长度}}{\text{总长度}} = \frac{b-a}{\ell}.\) 即概率正比于长度

  • 直观解释(”它是什么意思?”):先看能不能照抄离散做法。把轮盘离散化成 $m$ 个等距刻度 $\Omega_m = \{0, \tfrac{\ell}{m}, \tfrac{2\ell}{m}, \dots, \tfrac{(m-1)\ell}{m}\}$,每个刻度概率 $1/m$,这完全没问题。现在让 $m \to \infty$。如果试图给每个 $\omega \in [0,\ell]$ 赋一个概率 $p > 0$,那么因为 $[0,\ell]$ 中有不可数多个实数,全部概率之和会是 $\infty$,违反总概率为 $1$。所以只能让每个点概率都是 $0$。可是如果所有样本点概率都是 $0$,我们还怎么给事件赋概率?答案是:离散情形里”事件 = 样本点的集合,概率 = 逐点概率之和”这条路线在连续情形彻底走不通,必须改为把区间当作基本事件。

    类比:把概率想象成”质量”。离散情形是一堆小石子(每颗有确定质量);连续情形是一条连续的金属棒,某一点的”质量”毫无意义(质量为零),有意义的是一段区间的质量。密度就是”每单位长度的质量”。

  • 具体示例:取 $\ell = 1$,则 $\Pr[X \in [0.25, 0.75]] = 0.5$,$\Pr[X \in [0, 0.1]] = 0.1$。取 $\ell = 10$,则 $\Pr[X \in [2,5]] = (5-2)/10 = 0.3$(已用脚本验算)。

  • 关键推论:概率为 $0$ 的事件不一定不可能发生。 对每个具体的 $x \in [0,\ell]$,$\Pr[X = x] = 0$。但 $X$ 终究会取到某个值,而 $\Pr[X \in [0,\ell]] = 1$。这说明”概率为 $0$”与”不可能”在连续世界是两个不同的概念。技术上,这是因为概率的可数可加性 (countable additivity) 只对可数并成立: \(\Pr\Big[\bigcup_{n=1}^{\infty} A_n\Big] = \sum_{n=1}^{\infty}\Pr[A_n] \quad\text{(可数并)},\) 而对不可数并没有这条性质。$\{X = x\}$ 这些零概率事件有不可数多个,把它们并起来可以凑出概率为 $1$ 的大事件——这在离散世界是绝不会发生的。另一条推论:端点无关紧要,$\Pr[a < X < b] = \Pr[a \le X \le b]$,因为两端各自贡献 $0$。

概率密度函数 (Probability Density Function, PDF)

  • 定义:实值随机变量 $X$ 的概率密度函数是一个函数 $f:\mathbb{R}\to\mathbb{R}$,满足
    1. 非负性:$f(x) \ge 0$ 对一切 $x \in \mathbb{R}$;
    2. 总积分为 $1$:$\displaystyle\int_{-\infty}^{\infty} f(x)\,dx = 1$。

    并且 $X$ 的分布由 $f$ 通过积分给出: \(\Pr[a \le X \le b] = \int_a^b f(x)\,dx \quad \text{对一切 } a < b.\)

  • 直观解释(”它是什么意思?”):$f$ 扮演的角色相当于离散情形的直方图 (histogram):它告诉你”概率在实数轴上哪里密集、哪里稀疏”。但 $f(x)$ 本身不是概率! 它是”单位长度的概率“(probability per unit length)。真正对应概率的是面积: \(\Pr[x \le X \le x + dx] = \int_x^{x+dx} f(z)\,dz \approx f(x)\,dx.\) 也就是说 $f(x)\,dx$ 才近似是”落在 $x$ 附近极小邻域”的概率。这也是记号 $f(x)dx$ 里那个 $dx$ 的真正用途——它不是装饰,它是量纲。

  • 具体示例($f$ 可以大于 $1$,这必须牢记):取 $[0, \ell]$ 上的均匀分布,密度是常数 $c$。由归一化条件 \(1 = \int_0^{\ell} c\,dx = c\,\ell \implies c = \frac{1}{\ell}.\) 若取 $\ell = \tfrac12$,则 $f(x) = 1/(\tfrac12) = 2$ 在 $[0,\tfrac12]$ 上,大于 $1$。再取 $\ell = 0.1$,则 $f(x) = 10$。所以”密度 $\le 1$”完全是错的直觉(它是离散 PMF 习惯的错误移植)。密度大只说明”在这一点附近概率的堆积速度快”,只要它堆得快、范围窄,总面积仍可以是 $1$。

累积分布函数 (Cumulative Distribution Function, CDF)

  • 定义:连续随机变量 $X$ 的累积分布函数是 \(F(x) = \Pr[X \le x] = \int_{-\infty}^{x} f(z)\,dz.\) 反过来,在 $F$ 可导处有 $f(x) = F^{\prime}(x)$,即 $f = \dfrac{dF}{dx}$。

  • 直观解释:CDF 是”从左往右累积的面积”,它是一个单调不减、右连续、$\lim_{x\to-\infty}F(x)=0$、$\lim_{x\to\infty}F(x)=1$ 的函数。对概率密度做微分得到密度、对密度做积分得到 CDF,两者是一对互逆运算——这正好对应离散情形里”PMF 与 CDF 的差分/求和”关系。

  • 从离散过渡过来的自然路径:把实数轴切成宽 $dx$ 的小格 $x_k = k\,dx$($k \in \mathbb{Z}$)。则 $\Pr[x_k < X \le x_k + dx] \approx f(x_k)\,dx$,于是 \(F(x_i) = \Pr[X \le x_i] \approx \sum_{j \le i} f(x_j)\,dx.\) 右边是一个黎曼和 (Riemann sum)。令 $dx \to 0$,求和就变成积分 $F(x)=\int_{-\infty}^{x}f(z)dz$。“求和换积分”这条口号的全部内容就在这里

  • 具体示例(指数分布):$X \sim \mathrm{Exp}(\lambda)$ 时 $F(x) = 1 - e^{-\lambda x}$($x \ge 0$)。取 $\lambda = 2$:$F(0.5) = 1 - e^{-1} = 0.63212056$,$F(1) = 0.86466472$,$F(1.5) = 0.95021293$,$F(2) = 0.98168436$(脚本验算)。可以看到 $F$ 迅速逼近 $1$——等待时间几乎不可能很长。

连续随机变量的期望与方差

  • 定义:设连续随机变量 $X$ 的密度为 $f$。 \(\mathbb{E}[X] = \int_{-\infty}^{\infty} x f(x)\,dx, \qquad \operatorname{Var}(X) = \mathbb{E}\big[(X-\mathbb{E}[X])^2\big] = \mathbb{E}[X^2] - \mathbb{E}[X]^2,\) 其中 $\displaystyle\mathbb{E}[X^2] = \int_{-\infty}^{\infty} x^2 f(x)\,dx$。

  • 直观解释:离散情形 $\mathbb{E}[X] = \sum_a a\Pr[X=a]$,连续情形把”取值 $a$ 的概率 $\Pr[X=a]$”换成”落在 $x$ 附近的概率 $f(x)dx$”,求和换成积分:$\sum a\,\Pr[X=a] \to \int x f(x)dx$。这就是“加权平均重心”在连续世界的版本。表达式 $\mathbb{E}[X^2] - \mathbb{E}[X]^2$ 中的 $\mathbb{E}[X]^2$ 是 $(\mathbb{E}[X])^2$(先求期望再平方),不是 $\mathbb{E}[X^2]$——这是讲次 22 就强调过的经典陷阱,连续情形同样适用。

  • 具体示例对齐:均匀分布 $U[2,6]$ 的期望是 $(2+6)/2 = 4$,方差是 $(6-2)^2/12 = 16/12 \approx 1.3333$(脚本数值积分核对:$4.000000$ 与 $1.333333$)。

连续均匀分布 (Continuous Uniform Distribution)

  • 定义:$X$ 在区间 $[a,b]$($a<b$)上均匀分布,记为 $X \sim U[a,b]$,密度为 \(f(x) = \begin{cases}\dfrac{1}{b-a}, & a \le x \le b,\\[4pt] 0, & \text{其他}.\end{cases}\) 于是对任意子区间 $[c,d] \subseteq [a,b]$ 有 $\Pr[X \in [c,d]] = \dfrac{d-c}{b-a}$——概率只看长度比例

  • 直观解释:概率只看长度比例,不看位置。”每一段等长的区间概率相同”——这就是”均匀”的全部含义。类比:往一条均匀的线段上随机撒一个点。

  • 具体示例:$U[0,10]$ 上 $\Pr[X \in [2,5]] = 3/10 = 0.3$;$\Pr[X \in [0,1]] = 0.1$;$\Pr[X = 2] = 0$ 但 $X = 2$ 是可能发生的。

指数分布 (Exponential Distribution)

  • 定义:对参数 $\lambda > 0$,若连续随机变量 $X$ 的密度为 \(f(x) = \begin{cases}\lambda e^{-\lambda x}, & x \ge 0,\\[2pt] 0, & x < 0,\end{cases}\) 则称 $X$ 服从参数 $\lambda$ 的指数分布,记 $X \sim \mathrm{Exp}(\lambda)$。

  • 直观解释:指数分布是几何分布的连续时间版本。几何分布描述”抛硬币直到第一次正面所需的次数“;指数分布描述”等待某个事件发生所需的时间“。参数 $\lambda$ 是单位时间的事件发生率 (rate)。它在真实世界出现得极其频繁:顾客到达间隔、放射性衰变时间、机器无故障运行时间、电话通话时长——只要事件以恒定速率随机发生,等待时间就是指数的。

  • 具体示例:设 $\lambda = 2$(平均每单位时间发生 $2$ 次),则 $\mathbb{E}[X] = 0.5$,$\operatorname{Var}(X) = 0.25$,$\Pr[X > 1] = e^{-2} = 0.13533528$。若某客服平均每 $20$ 分钟接到一个电话($\lambda = 1/20$,单位:分钟),则等下一个电话超过 $15$ 分钟的概率是 $e^{-15/20} = 0.472367$,超过 $30$ 分钟的概率是 $e^{-30/20} = 0.223130$(脚本验算)。

联合密度 (Joint Density) 与独立性

  • 定义:两个连续随机变量 $X, Y$ 的联合密度是函数 $f:\mathbb{R}^2\to\mathbb{R}$,满足 $f(x,y) \ge 0$ 且 \(\int_{-\infty}^{\infty}\int_{-\infty}^{\infty} f(x,y)\,dx\,dy = 1,\) 且 $\displaystyle \Pr[a \le X \le b,\ c \le Y \le d] = \int_c^d\int_a^b f(x,y)\,dx\,dy$。

  • 直观解释:$f(x,y)$ 是”单位面积的概率“。类比:$\displaystyle\Pr[x\le X \le x+dx,\ y \le Y \le y+dy] \approx f(x,y)\,dx\,dy$。边缘密度由积分掉另一个变量得到:$f_X(x) = \int_{-\infty}^{\infty} f(x,y)\,dy$——这正是离散情形”对另一个变量求和得到边缘 PMF”的积分版。

  • 独立性 (Independence):连续随机变量 $X,Y$ 独立,当且仅当对一切 $a\le b, c \le d$, \(\Pr[a \le X \le b,\ c \le Y \le d] = \Pr[a \le X \le b]\cdot\Pr[c \le Y \le d].\) 等价地,联合密度分解为边缘密度之积:$f(x,y) = f_X(x)f_Y(y)$。

  • 具体示例(三角形上的联合密度):设 $(X,Y)$ 在三角形 $T = \{(x,y): x\ge 0, y \ge 0, x+y \le 1\}$ 上均匀分布。三角形面积是 $1/2$,故联合密度 $f(x,y) = 2$ 在 $T$ 上、否则为 $0$。总积分 $\int_0^1\int_0^{1-x}2\,dy\,dx = \int_0^1 2(1-x)dx = 1$ ✓。边缘密度 $f_X(x) = \int_0^{1-x}2\,dy = 2(1-x)$($0\le x\le 1$),它不是常数,所以 $X$ 不是 $U[0,1]$。期望 $\mathbb{E}[X] = \int_0^1 x\cdot 2(1-x)dx = 2(\tfrac12 - \tfrac13) = \tfrac13$(蒙特卡洛 $2\times 10^6$ 次抽样得 $0.33370$,接受率 $0.4998$,与理论 $\tfrac12$ 一致)。

完整证明与推导(核心)

定理 24.1(连续均匀分布的期望与方差):设 $X \sim U[a,b]$。则 \(\mathbb{E}[X] = \frac{a+b}{2}, \qquad \operatorname{Var}(X) = \frac{(b-a)^2}{12}.\)

证明策略:直接证明——从期望与方差的定义出发,把 $f(x) = 1/(b-a)$ 代进去做两项多项式积分。选择这个策略是因为均匀分布的密度是常数,积分是全课程中最干净的一类,正好用来把”定义怎么落地”演示清楚。先做特例 $[0,\ell]$(对应官方 Note 的 $\mathbb{E}[X]=\ell/2$、$\operatorname{Var}(X)=\ell^2/12$),再平移缩放得到一般 $[a,b]$。

逐步推导

先取特例 $X \sim U[0,\ell]$,$f(x) = 1/\ell$ 在 $[0,\ell]$,其余为 $0$。

第 1 步(期望):由定义, \(\mathbb{E}[X] = \int_{-\infty}^{\infty} x f(x)\,dx = \int_0^{\ell} x\cdot\frac1\ell\,dx = \frac{1}{\ell}\cdot\frac{x^2}{2}\bigg\vert _0^{\ell} = \frac{1}{\ell}\cdot\frac{\ell^2}{2} = \frac{\ell}{2}.\)

第 2 步(二阶矩): \(\mathbb{E}[X^2] = \int_0^{\ell} x^2\cdot\frac1\ell\,dx = \frac{1}{\ell}\cdot\frac{x^3}{3}\bigg\vert _0^{\ell} = \frac{\ell^2}{3}.\)

第 3 步(方差):用 $\operatorname{Var}(X) = \mathbb{E}[X^2] - \mathbb{E}[X]^2$, \(\operatorname{Var}(X) = \frac{\ell^2}{3} - \left(\frac{\ell}{2}\right)^2 = \frac{\ell^2}{3} - \frac{\ell^2}{4} = \frac{4\ell^2 - 3\ell^2}{12} = \frac{\ell^2}{12}.\)

第 4 步(推广到 $[a,b]$)。直接把 $[a,b]$ 上的密度 $1/(b-a)$ 代进去重做一遍积分,比对”平移缩放”更不容易出错: \(\mathbb{E}[X] = \frac{1}{b-a}\int_a^b x\,dx = \frac{1}{b-a}\cdot\frac{b^2-a^2}{2} = \frac{(b-a)(b+a)}{2(b-a)} = \frac{a+b}{2},\) \(\mathbb{E}[X^2] = \frac{1}{b-a}\int_a^b x^2\,dx = \frac{1}{b-a}\cdot\frac{b^3-a^3}{3} = \frac{b^2+ab+a^2}{3},\) \(\operatorname{Var}(X) = \frac{b^2+ab+a^2}{3} - \left(\frac{a+b}{2}\right)^2 = \frac{4(b^2+ab+a^2) - 3(a^2+2ab+b^2)}{12} = \frac{b^2 - 2ab + a^2}{12} = \frac{(b-a)^2}{12}.\)

代数细节核对:$(b^3-a^3)/(b-a) = b^2+ab+a^2$ ✓;$4(b^2+ab+a^2) - 3(a^2+2ab+b^2) = b^2 - 2ab + a^2 = (b-a)^2$ ✓。

脚本验算(Simpson 数值积分,$10^5$ 段;把 $[a,b]$ 代进公式与数值结果对照):

分布数值 $\mathbb{E}[X]$公式 $(a+b)/2$数值 $\operatorname{Var}$公式 $(b-a)^2/12$
$U[0,1]$$0.500000$$0.5$$0.083333$$1/12 = 0.083333$
$U[0,10]$$5.000000$$5$$8.333333$$100/12 = 8.333333$
$U[-2,3]$$0.500000$$0.5$$2.083333$$25/12 = 2.083333$
$U[2,6]$$4.000000$$4$$1.333333$$16/12 = 1.333333$

【证明机制解说】:这个证明没有技巧,全部价值在于把定义用熟。请注意三件事:(1) 期望的积分可以只在 $f$ 非零的区间上做(其余被积函数是 $0$);(2) 方差永远走 $\mathbb{E}[X^2]-\mathbb{E}[X]^2$ 这条短路,因为直接对 $(x-\mu)^2 f(x)$ 展开积分反而更麻烦;(3) 结果中 $1/12$ 这个因子不直观,但方差正比于 $\ell^2$ 这一点完全符合直觉——区间拉长一倍,波动放大到四倍(因为标准差正比于长度,即 $\sigma = (b-a)/\sqrt{12}$)。用 $U[0,10]$ 对照 $U[0,1]$:前者方差是后者的 $100$ 倍,正是 $10^2$。

反例(说明”密度的值”绝不能当作概率):$U[0,1/2]$ 的密度恒为 $2 > 1$。若把 $f(x)$ 读成”概率”,就会得出”$X$ 落在 $0.1$ 这一点的概率是 $2$”这种荒谬结论。真相是 $\Pr[X = 0.1] = 0$。同理 $U[0,0.1]$ 的密度是 $10$。判据只有一个:$\int f = 1$,而不是 $\max f \le 1$。

定理 24.2(指数分布是合法的概率密度):设 $\lambda > 0$,$f(x) = \lambda e^{-\lambda x}$($x\ge 0$),$f(x)=0$($x<0$)。则 $f$ 满足 PDF 的两条公设,特别地 \(\int_{-\infty}^{\infty} f(x)\,dx = \int_0^{\infty}\lambda e^{-\lambda x}\,dx = 1,\) 且 $\Pr[X > t] = e^{-\lambda t}$($t \ge 0$)。

证明策略:直接证明,用初等原函数 $e^{-\lambda x}$ 与反常积分的极限。关键在于”$\lambda$ 恰好是被自动定出来的归一化常数”。

逐步推导

第 1 步(非负性):$\lambda > 0$ 且 $e^{-\lambda x} > 0$ 对一切实数 $x$ 成立,故 $x \ge 0$ 时 $f(x) = \lambda e^{-\lambda x} > 0$;$x<0$ 时 $f(x) = 0$。所以 $f \ge 0$ ✓。

第 2 步(总积分):因 $x<0$ 段被积函数为 $0$, \(\int_{-\infty}^{\infty} f(x)\,dx = \int_0^{\infty}\lambda e^{-\lambda x}\,dx = \lambda \cdot \left[-\frac{1}{\lambda}e^{-\lambda x}\right]_0^{\infty} = \lambda\cdot\left(0 - \left(-\frac1\lambda\right)\right) = \lambda\cdot\frac1\lambda = 1.\) 这里用到 $\lim_{x\to\infty} e^{-\lambda x} = 0$($\lambda>0$)与 $e^0 = 1$。

第 3 步(尾概率):对 $t \ge 0$, \(\Pr[X > t] = \int_t^{\infty}\lambda e^{-\lambda x}\,dx = \left[-e^{-\lambda x}\right]_t^{\infty} = 0 + e^{-\lambda t} = e^{-\lambda t}.\)

第 4 步(CDF):由第 3 步,$\Pr[X \le t] = 1 - \Pr[X>t] = 1 - e^{-\lambda t}$($t\ge 0$);$t<0$ 时 $F(t)=0$。

[证明机制解说】:注意”归一化常数 $\lambda$”并不是外加的——指数分布的参数同时承担了两个角色:它既是衰减率(CDF 的形状参数),又是使总面积为 $1$ 的归一化因子。这不是巧合:$\int_0^\infty e^{-\lambda x}dx = 1/\lambda$,所以要让面积为 $1$ 就必须乘上 $\lambda$。这也是为什么”$\lambda$ 是速率”这个解释成立:速率越大,密度曲线越”瘦高”,质量越集中在 $0$ 附近。

反例/注意点:$\lambda$ 与概率 $p$ 不同,不受 $\lambda \le 1$ 约束。$\lambda = 10$ 完全合法(此时 $f(0) = 10$,密度大于 $1$,又是”密度不是概率”的一例)。几何分布的参数 $p$ 必须 $\le 1$,而指数分布的 $\lambda$ 可以是任意正数——这正是”连续化”带来的自由度(因为 $\lambda$ 的量纲是 $1/\text{时间}$)。

定理 24.3(指数分布的均值与方差):设 $X \sim \mathrm{Exp}(\lambda)$,$\lambda > 0$。则 \(\mathbb{E}[X] = \frac{1}{\lambda}, \qquad \operatorname{Var}(X) = \frac{1}{\lambda^2}.\)

证明策略:分部积分 (integration by parts),两次。选择分部积分的理由是:被积函数形如”多项式 × 指数”,把指数部分拿去当 $dv$ 积分后,多项式次数就降一次,两轮之后指数积分回到总积分本身,从而闭合。

逐步推导

第 1 步($\mathbb{E}[X]$)。取 $u = x$、$dv = \lambda e^{-\lambda x}dx$,则 $du = dx$、$v = -e^{-\lambda x}$。分部积分公式 $\int u\,dv = uv - \int v\,du$ 给出 \(\mathbb{E}[X] = \int_0^{\infty} x\cdot\lambda e^{-\lambda x}dx = \underbrace{\Big[-x e^{-\lambda x}\Big]_0^{\infty}}_{=:A} + \int_0^{\infty} e^{-\lambda x}dx.\)

第 2 步(计算边界项 $A$):在 $x = 0$ 处 $-x e^{-\lambda x} = 0$;在 $x\to\infty$ 处,$x e^{-\lambda x}\to 0$(指数衰减快于任何多项式增长——洛必达法则可得)。故 $A = 0 - 0 = 0$。

第 3 步(完成期望): \(\mathbb{E}[X] = 0 + \left[-\frac{1}{\lambda}e^{-\lambda x}\right]_0^{\infty} = \frac{1}{\lambda}.\) 直觉核对:若平均每秒发生 $2$ 次($\lambda = 2$),平均等待 $0.5$ 秒 ✓。$\lambda = 3$ 时平均等 $1/3$ ✓(脚本数值:$0.333333$)。

第 4 步($\mathbb{E}[X^2]$)。取 $u = x^2$、$dv = \lambda e^{-\lambda x}dx$,则 $du = 2x\,dx$、$v = -e^{-\lambda x}$: \(\mathbb{E}[X^2] = \Big[-x^2e^{-\lambda x}\Big]_0^{\infty} + \int_0^{\infty} 2x e^{-\lambda x}dx.\) 边界项同样为 $0$($x^2e^{-\lambda x}\to 0$)。

第 5 步(把二阶梯矩归约到一阶):注意 $\int_0^\infty 2x e^{-\lambda x}dx = \dfrac{2}{\lambda}\int_0^\infty \lambda x e^{-\lambda x}dx = \dfrac2\lambda \mathbb{E}[X]$。于是 \(\mathbb{E}[X^2] = \frac{2}{\lambda}\cdot\frac{1}{\lambda} = \frac{2}{\lambda^2}.\)

第 6 步(方差): \(\operatorname{Var}(X) = \mathbb{E}[X^2] - \mathbb{E}[X]^2 = \frac{2}{\lambda^2} - \frac{1}{\lambda^2} = \frac{1}{\lambda^2}.\)

脚本验算(对 $\lambda \in \{0.5, 1, 2, 3\}$ 用 Simpson 数值积分在 $[0,60]$ 上算):

$\lambda$$\int f$数值 $\mathbb{E}[X]$$1/\lambda$数值 $\operatorname{Var}$$1/\lambda^2$
$0.5$$1.00000000$$2.000000$$2$$4.000000$$4$
$1$$1.00000000$$1.000000$$1$$1.000000$$1$
$2$$1.00000000$$0.500000$$0.5$$0.250000$$0.25$
$3$$1.00000000$$0.333333$$1/3$$0.111111$$1/9$

另外单独核对分部积分的中间量:$\int_0^\infty x e^{-2x}dx = 0.250000 = 1/\lambda^2$ ✓,$\int_0^\infty x^2 e^{-2x}dx = 0.250000 = 2/\lambda^3$ ✓。

【证明机制解说】:这个证明的”灵光一现”在第 5 步——不要把 $\int 2xe^{-\lambda x}dx$ 重新分部积分一遍,而要认出它就是 $\frac{2}{\lambda}$ 倍的 $\mathbb{E}[X]$。这种”把新积分归约到已知积分”的手法在概率论里反复出现(下一讲算正态分布的方差时会再次用到,那里归约到的是高斯积分)。同时请注意一个漂亮的结构:$\operatorname{Var}(X) = 1/\lambda^2 = (\mathbb{E}[X])^2$,即指数分布的标准差恰等于它的均值。这是一种非常特殊的”波动与均值同量级”的性质,与均匀分布(标准差正比于区间长)形成对照。

定理 24.4(无记忆性 Memorylessness):设 $X \sim \mathrm{Exp}(\lambda)$,$s, t \ge 0$。则 \(\Pr[X > s + t \mid X > s] = \Pr[X > t] = e^{-\lambda t},\) 且这个条件概率与 $s$ 无关

证明策略:直接证明——用条件概率定义把条件概率展开成分式,再用定理 24.2 的尾概率公式 $e^{-\lambda t}$,指数律会自动消掉 $s$。这条推导只有三行,但它是整讲最重要的性质。

逐步推导

第 1 步(条件概率定义):设 $s \ge 0$,则 $\Pr[X > s] = e^{-\lambda s} > 0$,条件概率良定义: \(\Pr[X > s+t \mid X > s] = \frac{\Pr\big[(X > s+t)\cap(X>s)\big]}{\Pr[X>s]}.\)

第 2 步(化简分子)。因为 $s+t \ge s$,事件 $\{X > s+t\}$ 蕴含 $\{X > s\}$(尾事件的嵌套性),故交事件就等于 $\{X > s+t\}$: \(\Pr\big[(X>s+t)\cap(X>s)\big] = \Pr[X > s+t] = e^{-\lambda(s+t)}.\)

第 3 步(相除): \(\Pr[X>s+t \mid X>s] = \frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} = e^{-\lambda(s+t)+\lambda s} = e^{-\lambda t} = \Pr[X>t].\)

第 4 步(”与 $s$ 无关”的含义):上式右端不含 $s$。所以”已经等了 $s$ 分钟”这件事完全没有改变”还需要再等超过 $t$ 分钟”的概率。若把剩余等待时间记为 $R = X - s$(在 $\{X>s\}$ 条件下),则 $R \sim \mathrm{Exp}(\lambda)$,与 $X$ 同分布——系统在时刻 $s$ “重新开始”,就像什么都没发生过

第 5 步(与几何分布的平行)。讲次 19 的几何分布 $G(p)$ 有一条完全平行的性质:对整数 $s, t \ge 0$, \(\Pr[Y > s+t \mid Y > s] = \frac{(1-p)^{s+t}}{(1-p)^{s}} = (1-p)^t = \Pr[Y>t].\) 脚本验算:$p = 0.3$,$s = 3$,$t = 2$:$(1-p)^{5}/(1-p)^{3} = 0.49000000 = (1-p)^2$ ✓。

第 6 步(连续化验证:指数分布是几何分布的极限)。设每 $\delta$ 秒做一次试验,每次成功概率 $p = \lambda\delta$(”成功率正比于时间片长度”,对应恒定速率 $\lambda = p/\delta$)。则在 $t$ 秒内做 $k = t/\delta$ 次试验,从未成功的概率是 $(1-p)^k = (1-\lambda\delta)^{t/\delta}$。令 $\delta \to 0$: \((1-\lambda\delta)^{t/\delta} \longrightarrow e^{-\lambda t},\) 这正是指数分布的尾概率。脚本验算($\lambda = 2$,$t = 1.5$,目标 $e^{-3} = 0.04978707$):$\delta = 0.1$ 给 $0.03518437$,$\delta = 0.01$ 给 $0.04829602$,$\delta = 0.001$ 给 $0.04963773$,$\delta = 0.0001$ 给 $0.04977213$——收敛清楚可见

第 7 步(脚本验算无记忆性本身,$\lambda = 2$):

$s$$t$$\Pr[X>s+t\mid X>s]$ 数值$\Pr[X>t] = e^{-\lambda t}$
$1$$2$$0.0183156389$$0.0183156389$
$3$$0.5$$0.3678794412$$0.3678794412$
$10$$5$$0.0000453999$$0.0000453999$

【证明机制解说】:证明的全部力量来自尾事件的嵌套性:$\{X>s+t\}\subseteq\{X>s\}$,所以交事件可以直接化简。这一步之所以能成功,本质上是因为指数函数的乘法性质 $e^{-\lambda(s+t)} = e^{-\lambda s}e^{-\lambda t}$——“无记忆”就是”指数律”。反过来看,如果想让一个取值于 $[0,\infty)$ 的连续分布满足 $\Pr[X>s+t\mid X>s]=\Pr[X>t]$,解函数方程 $g(s+t)=g(s)g(t)$ 会逼出 $g(t)=e^{-\lambda t}$,所以指数分布是唯一具有无记忆性的连续分布(离散情形里对应地,几何分布是唯一的无记忆分布)。

反例(无记忆性不是普遍规律):设 $X \sim U[0,10]$,则 $\Pr[X > 8 \mid X > 7] = \tfrac{2/10}{3/10} = \tfrac23$,而 $\Pr[X>1] = 0.9$。均匀分布有记忆:已经等过去的每一分钟都在”消耗”剩余的等待时间。同理,人的寿命、灯泡寿命(会老化)都有记忆;而无记忆性恰恰是”元件不会老化、故障随机发生”的数学刻画。若一个”已用 10 年的灯泡”与”全新灯泡”在未来一年内损坏的概率相同,则该灯泡的寿命模型就是指数分布。

定理 24.5(期望的线性性对连续情形成立):设 $X, Y$ 是连续随机变量(可以相关),$a, b \in \mathbb{R}$。则 \(\mathbb{E}[aX + bY] = a\,\mathbb{E}[X] + b\,\mathbb{E}[Y].\)

证明策略:直接证明,把 $\mathbb{E}[aX+bY]$ 写成二重积分,用积分的线性性把 $a,b$ 提出来、把二重积分拆成两个。选择这个策略是为了展示”离散情形的证明一字不改地平移过来”。

逐步推导

第 1 步(用联合密度写期望)。设 $(X,Y)$ 的联合密度为 $f$,则 \(\mathbb{E}[aX+bY] = \int_{-\infty}^{\infty}\int_{-\infty}^{\infty} (ax+by)f(x,y)\,dx\,dy.\)

第 2 步(拆成两项): \(= a\int_{-\infty}^{\infty}\int_{-\infty}^{\infty} x f(x,y)\,dx\,dy + b\int_{-\infty}^{\infty}\int_{-\infty}^{\infty} y f(x,y)\,dx\,dy.\)

第 3 步(还原边缘密度):由 $f_X(x) = \int_{-\infty}^{\infty}f(x,y)dy$ 与 $f_Y(y)=\int_{-\infty}^{\infty}f(x,y)dx$, \(= a\int_{-\infty}^{\infty} x f_X(x)\,dx + b\int_{-\infty}^{\infty} y f_Y(y)\,dy = a\,\mathbb{E}[X] + b\,\mathbb{E}[Y].\)

第 4 步(注意:全程没有用到独立性)。第 1 步只用到”$(X,Y)$ 有联合密度”,第 3 步只用到边缘密度的定义。线性性对任意相关的 $(X,Y)$ 都成立,这一点与讲次 20 的离散版本完全一致。真正需要独立性的公式是方差可加($\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)$,讲次 22),或期望的乘法分解($\mathbb{E}[XY]=\mathbb{E}[X]\mathbb{E}[Y]$)。

【证明机制解说】:这条定理是连续概率里最实用的工具,因为它把”算一个复杂量的期望”降级成”算若干个简单量的期望之和”。它会在下一讲 CLT 的应用(置信区间、二项近似、负载均衡)以及 Buffon 投针的第二种证明里反复出场。

定理 24.6(独立连续随机变量的联合密度分解):设连续随机变量 $X, Y$ 独立,边缘密度分别为 $f_X, f_Y$。则联合密度满足 \(f(x,y) = f_X(x)\,f_Y(y) \quad \text{对一切 } x,y \in \mathbb{R}.\)

证明策略:直接证明,用”小方块”把独立性的定义(区间形式)转写成密度形式,再取极限。关键在于两边都除以 $dx\,dy$

逐步推导

第 1 步(小方块近似):由联合密度的意义, \(f(x,y)\,dx\,dy \approx \Pr[x \le X \le x+dx,\ y \le Y \le y+dy].\)

第 2 步(用独立性拆开):由 $X,Y$ 独立的定义(区间事件独立), \(\Pr[x \le X \le x+dx,\ y \le Y \le y+dy] = \Pr[x \le X \le x+dx]\cdot\Pr[y\le Y\le y+dy].\)

第 3 步(两边换成密度): \(= \big(f_X(x)\,dx\big)\cdot\big(f_Y(y)\,dy\big) = f_X(x)f_Y(y)\,dx\,dy.\)

第 4 步(相除取极限):把第 1 步与第 3 步的 $f(x,y)dxdy \approx f_X(x)f_Y(y)dxdy$ 两边除以 $dx\,dy > 0$,并令 $dx,dy\to 0$,得到 $f(x,y)=f_X(x)f_Y(y)$。

【证明机制解说】:这条定理的价值在于把独立性检查变成一次因式分解:看到联合密度能拆成”只含 $x$ 的因子 × 只含 $y$ 的因子”,就能立刻断定独立。用它一秒判定:三角形上均匀分布的密度 $f(x,y)=2\cdot\mathbf{1}\{x\ge0,y\ge0,x+y\le1\}$ 不能因式分解(因为指示函数里 $x+y\le1$ 把两个变量纠缠在一起),所以那个例子里的 $X,Y$ 不独立;而矩形 $[a,b]\times[c,d]$ 上均匀分布的密度 $=\frac{1}{b-a}\cdot\frac{1}{c-d}$ 是常数乘积,独立

定理 24.7(Buffon 投针 Buffon’s Needle):在画有间距为 $d$ 的平行线的木板上随机投掷一根长为 $L \le d$ 的针。则针与某条线相交的概率为 \(\Pr[\text{相交}] = \frac{2L}{\pi d}.\) 特别地取 $L = d$ 时 $\Pr[\text{相交}] = 2/\pi$。

证明策略:几何概率 (geometric probability)——把随机投掷翻译成两个连续随机变量 $(Y,\Theta)$ 的联合密度,把”相交”这个几何条件写成不等式 $Y \le \frac{L}{2}\cos\Theta$,然后在二维区域上积分。选择这个策略是因为它示范了“全概率=面积比例”这一几何思路,并且顺带给出一个估计 $\pi$ 的算法。

逐步推导

第 1 步(选随机变量)。针的落位完全由两个量决定:

  • $Y$ = 针的中点到最近一条平行线的距离,取值于 $[0, d/2]$;
  • $\Theta$ = 针与竖直方向的夹角,取值于 $[-\pi/2, \pi/2]$。

第 2 步(联合密度)。”完全随机地投掷”意味着 $(Y,\Theta)$ 在矩形 $[0,d/2]\times[-\pi/2,\pi/2]$ 上均匀分布,且 $Y$ 与 $\Theta$ 独立。该矩形面积为 $\frac{d}{2}\cdot\pi = \frac{\pi d}{2}$,故 \(f(y,\theta) = \frac{1}{\pi d/2} = \frac{2}{\pi d}, \qquad (y,\theta)\in\Big[0,\tfrac d2\Big]\times\Big[-\tfrac\pi2,\tfrac\pi2\Big].\)

第 3 步(归一化验证): \(\int_{-\pi/2}^{\pi/2}\int_0^{d/2}\frac{2}{\pi d}\,dy\,d\theta = \int_{-\pi/2}^{\pi/2}\frac{2}{\pi d}\cdot\frac d2\,d\theta = \int_{-\pi/2}^{\pi/2}\frac{1}{\pi}d\theta = \frac{1}{\pi}\cdot\pi = 1.\ ✓\)

第 4 步(把”相交”写成几何条件)。针的一个端点到中点的竖直位移是 $\frac{L}{2}\cos\Theta$(这个公式对 $\vert \Theta\vert \le\pi/2$ 保证余弦非负,所以不会出现符号问题)。于是 \(\text{针与线相交} \iff Y \le \frac{L}{2}\cos\Theta.\)

第 5 步(积分): \(\Pr[\text{相交}] = \int_{-\pi/2}^{\pi/2}\int_0^{(L/2)\cos\theta}\frac{2}{\pi d}\,dy\,d\theta = \frac{2}{\pi d}\int_{-\pi/2}^{\pi/2}\frac{L}{2}\cos\theta\,d\theta = \frac{L}{\pi d}\int_{-\pi/2}^{\pi/2}\cos\theta\,d\theta.\)

第 6 步(初等积分): \(\int_{-\pi/2}^{\pi/2}\cos\theta\,d\theta = \sin\theta\Big\vert _{-\pi/2}^{\pi/2} = 1 - (-1) = 2.\) 故 \(\Pr[\text{相交}] = \frac{L}{\pi d}\cdot 2 = \frac{2L}{\pi d}.\)

第 7 步(脚本验算)。取 $L = d = 1$:解析值 $2/\pi = 0.6366197724$;Simpson 数值积分 $\int_{-\pi/2}^{\pi/2}\frac1\pi\cos\theta\,d\theta = 0.6366197724$ ✓。蒙特卡洛投针 $2\times 10^6$ 次:相交比例 $0.63673$(理论 $0.636620$),反推 $\hat\pi = 2N/C = 3.1410$ ✓。取 $L=1, d=2$:$2L/(\pi d) = 1/\pi = 0.318310$ ✓。

第 8 步(估计 $\pi$ 的算法)。设投掷 $n$ 次、其中 $C$ 次相交,则由大数定律(讲次 23)$\hat p = C/n \to 2L/(\pi d)$,故 \(\hat\pi = \frac{2Ln}{Cd}.\) 用切比雪夫不等式可以把 $n$ 定到”以 $1-\delta$ 的把握使 $\vert \hat p - p\vert \le \epsilon$”(讲次 23 的标准套路)。

第 9 步(第二种证明:指示变量 + 期望线性性)。设 $X$ 为单位长针的相交次数($0$ 或 $1$),故 $\mathbb{E}[X]=\Pr[X=1]$,我们要证它等于 $2/\pi$。把一根单位长针切成 $m$ 段等长小段,则 $X = I_1 + \cdots + I_m$($I_i$ 为第 $i$ 段是否相交的指示变量),由线性性 \(\mathbb{E}[X] = \sum_{i=1}^m\mathbb{E}[I_i] = m\,\mathbb{E}[I_1] \implies \mathbb{E}[I_1] = \frac{1}{m}\mathbb{E}[X] = (\text{该段长度})\cdot\mathbb{E}[X].\) 把若干段首尾用可旋转关节连起来得到”面条 (noodle)”,则任意形状面条的期望相交次数 = 总长度 $\times \mathbb{E}[X]$。现在取一个直径为 $1$ 的圆(周长 $\pi$):它必定与水平线恰好相交两次(对任何竖直平移都成立),所以它的相交次数恒为 $2$(这不是期望,是必然值)。于是 \(\pi\cdot\mathbb{E}[X] = 2 \implies \mathbb{E}[X] = \Pr[X=1] = \frac{2}{\pi}.\)

【证明机制解说】:第一种证明的核心是“把所有随机性参数化为少数几个连续变量,然后一次积分”——这是所有几何概率问题的模板。第二种证明(Buffon 面条)的核心是期望线性性 + 构造一个”每次相交次数恒定”的形状。第二步是真正的灵感:用圆把未知量 $\mathbb{E}[X]$ 反解出来,因为圆的答案我们不需要任何计算就知道(永远是 $2$)。这展示了线性性最强大的用法:不需要独立性,只需要”能把量拆成线性组合”

与经典问题的联系

(1)随机算法与几何概率:用投针估 $\pi$。 这是蒙特卡洛方法 (Monte Carlo method) 的祖师爷。实际问题(18 世纪 Buffon 提出的”投针求 $\pi$”)→ 数学建模($(Y,\Theta)$ 的联合均匀密度)→ 方案设计(投 $n$ 次,数相交次数 $C$,输出 $2Ln/(Cd)$)→ 正确性证明(定理 24.7 给出 $\mathbb{E}[C/n] = 2L/(\pi d)$,大数定律(讲次 23)给出 $C/n \to 2L/(\pi d)$)→ 复杂度/精度(切比雪夫或 CLT(讲次 25)定 $n$)。同一套”随机采样估计确定量”的思想今天用于积分、渲染、金融定价、机器学习。

(2)负载均衡与排队论:指数分布刻画到达间隔。 若请求以恒定速率 $\lambda$ 随机到达(泊松过程 Poisson process),则相邻两次到达的间隔服从 $\mathrm{Exp}(\lambda)$,且无记忆性意味着”我们是否需要立刻扩容”不取决于”上一个请求是多久之前来的”。这直接解释了为什么排队论里 M/M/1 等模型的推导能如此干净:无记忆性让系统状态只需记录”当前队列长度”,而不需要记录历史。这正是讲次 26 马尔可夫性质的连续版本。

(3)可靠性工程:寿命模型。 若元件失效率恒定(不老化),则寿命 $\sim \mathrm{Exp}(\lambda)$。$\mathbb{E}[\text{寿命}] = 1/\lambda$ 给出平均无故障时间 (MTTF)。工程上常把 $\lambda$ 视为”每小时的故障率”(如 $\lambda = 10^{-5}$/小时),则 MTTF $= 10^5$ 小时 $\approx 11.4$ 年。

(4)哈希与随机化的连续视角。 讲次 20 讨论的哈希负载均衡用的是离散方法(指示变量 + 线性性)。连续版本是把”球落进箱子的比例”用连续密度近似,进而用 CLT 得到”最大负载 $\approx$ 均值 $+ 3\sqrt{\text{均值}}$”这类结论(见讲次 25)。

(5)与后续马尔可夫链的接口。 连续时间马尔可夫链 (CTMC) 的”在每个状态停留的时间”服从指数分布,而无记忆性正是让”状态转移”成为可能的数学基础:如果停留时间有记忆,那么”下一步往哪走”就必须依赖已停留多久,状态就不再是充分的。

与其他讲次的关联

  • 讲次 15(概率公理 Probability Foundations):那里定义了概率空间 $(\Omega, \mathcal{F}, \Pr)$ 的三条公理,其中可数可加性是公理之一。本讲正是靠”可数可加性只对可数并成立”来解释”不可数多个零概率事件之并可以是概率 $1$ 的事件”,从而让”点概率为 $0$ 但事件可能发生”在公理体系内自洽。
  • 讲次 19(随机变量与离散分布 Random Variables & Discrete Distributions):几何分布 $G(p)$ 是指数分布的离散原型,本讲的定理 24.4 第 5–6 步把两者的无记忆性形式逐项对照,并显式取 $\delta\to 0$ 的极限 $\lim_{\delta\to0}(1-\lambda\delta)^{t/\delta}=e^{-\lambda t}$ 建立”连续化”的桥梁。几何分布的期望 $1/p$ 也对应指数分布的 $1/\lambda$。
  • 讲次 20(期望与线性性 Expectations & Linearity):$\mathbb{E}[aX+bY]=a\mathbb{E}[X]+b\mathbb{E}[Y]$ 在连续情形的证明(定理 24.5)与讲次 20 的离散证明结构完全一致,唯一的改动是”求和换积分、PMF 换 PDF”;Buffon 投针的第二种证明(定理 24.7 第 9 步)正是讲次 20”指示变量 + 线性性”手法的连续应用。
  • 讲次 21(联合分布与随机变量独立性 Joint Distributions & Independence of RVs):本讲的联合密度(定义于”核心概念的直观解释”一节)就是讲次 21 离散联合 PMF 的积分版本;定理 24.6 的 $f(x,y)=f_X(x)f_Y(y)$ 是讲次 21”独立 $\iff$ PMF 分解”的连续对应物,边缘化($\int$ 掉一个变量)对应讲次 21 的边缘求和。
  • 讲次 22(方差与协方差 Variance & Covariance):$\operatorname{Var}(X)=\mathbb{E}[X^2]-\mathbb{E}[X]^2$ 这一恒等式(连续版本见本讲定义)在讲次 22 已用离散形式证明过一次;证明过程只用期望线性性,因此对连续情形一字不改地成立。方差可加需要独立(或至少不相关),本讲明确划出这条边界。
  • 讲次 23(集中不等式 Concentration Inequalities):本讲只给出连续分布及其期望方差,尚未讨论”样本均值波动多大”;切比雪夫不等式与(弱)大数定律是讲次 23 的成果,它们被本讲用来论证”投针估 $\pi$ 一定会成功”以及给出所需投掷次数的保守估计。下一讲会用一个更强的结论(CLT)取代这里的粗略估计。
  • 讲次 25(高斯分布与中心极限定理 Gaussian Distribution & CLT):本讲建立的三类连续分布中最重要的一类(正态)留到下一讲;CLT 的陈述必须使用本讲的 PDF/CDF/期望/方差语言,而”独立正态之和仍是正态”的证明要用到本讲的联合密度与独立密度分解。
  • 讲次 26(马尔可夫链与条件期望 Markov Chains & Conditional Expectation):本讲定理 24.4 的无记忆性就是讲次 26 马尔可夫性质的”时间连续版”:马尔可夫性质说”给定现在,未来与过去条件独立”,无记忆性说”给定已等待 $s$,剩余等待时间的分布与 $s$ 无关”。两者是同一个”遗忘性”直觉在不同数学框架下的呈现。
  • 讲次 14(计数 Counting)与讲次 16(组合证明 Combinatorial Proofs):”把面积/长度按比例分配”这一几何概率思想可以视为计数原理的连续化,而 Buffon 面条证明(把针切成 $m$ 段再用线性性)本质上是用离散分解 + 极限去解决连续问题。

关键要点

  1. 连续情形的三句口号:点概率让位给区间概率;PMF 让位给 PDF;求和让位给积分。具体地 $\Pr[X=a]=0$、$\Pr[a\le X\le b]=\int_a^b f$、$\mathbb{E}[X]=\int x f(x)dx$。
  2. $f(x)$ 不是概率。它是”单位长度的概率”,$f(x)dx$ 才是(近似)概率。$f(x)$ 可以大于 $1$:$U[0,\tfrac12]$ 的密度是 $2$,$U[0,0.1]$ 的密度是 $10$,$\mathrm{Exp}(10)$ 在 $0$ 处密度是 $10$。唯一判据是 $\int_{-\infty}^{\infty}f=1$。
  3. “概率为 $0$”不等于”不可能”。连续情形每个单点概率都是 $0$,但不可数多个零概率事件之并可以有概率 $1$——可数可加性只管可数并。
  4. 两个核心分布的闭式结果
    • 均匀 $U[a,b]$:$\mathbb{E}= (a+b)/2$,$\operatorname{Var}=(b-a)^2/12$,密度 $1/(b-a)$。
    • 指数 $\mathrm{Exp}(\lambda)$:PDF $\lambda e^{-\lambda x}$、CDF $1-e^{-\lambda x}$、$\Pr[X>t]=e^{-\lambda t}$、$\mathbb{E}=1/\lambda$、$\operatorname{Var}=1/\lambda^2$,且标准差 $=$ 均值
  5. 无记忆性 = 指数律。$\Pr[X>s+t\mid X>s]=\Pr[X>t]$ 之所以成立,全靠 $e^{-\lambda(s+t)}=e^{-\lambda s}e^{-\lambda t}$ 与尾事件的嵌套性;反之,解函数方程 $g(s+t)=g(s)g(t)$ 会逼出 $g(t)=e^{-\lambda t}$,故指数分布是唯一无记忆的连续分布。它是讲次 19 几何分布的无记忆性在 $\delta\to0$ 下的极限。
  6. 期望线性性在连续情形同样免费:$\mathbb{E}[aX+bY]=a\mathbb{E}[X]+b\mathbb{E}[Y]$ 对任意(可以强相关)的 $X,Y$ 成立,因为证明只用积分的线性性与边缘密度定义。要额外的独立性才能用的公式是方差可加。

常见误区与注意事项

  1. 把 $f(x)$ 当作 $\Pr[X=x]$。最典型的表现是看到 $U[0,1/2]$ 密度为 $2$ 就慌乱,或者把 $f(x)$ 直接乘进求和式算期望。正确读法是”$f(x)$ 是密度,$f(x)dx$ 才是概率”,且密度没有上界 $1$
  2. 认为 $\Pr[X=x]=0$ 就意味着 $X=x$ 不可能。这是把离散直觉硬搬到连续。正确理解:”概率 $0$”与”不可能”在连续世界不等价,因为可数可加性只对可数并成立;$[0,\ell]=\bigcup_{x}[x,x]$ 是不可数并。
  3. 算方差时把 $\mathbb{E}[X]^2$ 当成 $\mathbb{E}[X^2]$。$\operatorname{Var}(X)=\mathbb{E}[X^2]-\mathbb{E}[X]^2$ 里后者是”先求期望、再平方”,与”先平方、再求期望”完全不同。指数分布里 $\mathbb{E}[X^2]=2/\lambda^2$ 而 $\mathbb{E}[X]^2=1/\lambda^2$,混淆会得到错误的 $2/\lambda^2$。
  4. 把积分上下限照抄成 $[-\infty,\infty]$ 而不看密度的支撑。$U[a,b]$ 的积分实际只在 $[a,b]$ 上做,$\mathrm{Exp}(\lambda)$ 的积分只在 $[0,\infty)$ 上做。忘记截断会导致把常数密度 $1/(b-a)$ 积分到无穷而得到 $\infty$。
  5. 以为”无记忆性”是等待时间的一般性质。均匀分布、正态分布、Gamma 分布(整数形状参数 $\ge 2$)都有记忆。用 $U[0,10]$ 的具体反例检验:$\Pr[X>8\mid X>7]=2/3\ne 0.9=\Pr[X>1]$。
  6. 在连续化时把参数范围搞错。几何分布的参数 $p$ 必须满足 $p\le1$,而指数分布的速率 $\lambda$ 可以任意大($\lambda>0$)。反过来,把几何分布的 $p$ 直接当成 $\lambda$ 会得到错误的量纲($p$ 无量纲,$\lambda$ 的量纲是 $1/\text{时间}$)。
  7. 要求期望线性性附带独立性条件。线性性从不需要独立性;需要独立性的是 $\mathbb{E}[XY]=\mathbb{E}[X]\mathbb{E}[Y]$ 与 $\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)$。这条误区在 Buffon 面条证明里会直接导致思路卡死(”两根针的相交指示变量难道独立吗?”——根本不重要)。

思考题(带答案)

Q1.(纯计算) 设 $X \sim U[-2, 3]$,$Y \sim \mathrm{Exp}(2)$,$X$ 与 $Y$ 独立。计算:(a) $\Pr[X \in [0,2]]$;(b) $\Pr[X>2 \mid X>1]$;(c) $\mathbb{E}[3X - 4Y]$;(d) $\Pr[Y > 1 \mid Y > 0.5]$;(e) $\operatorname{Var}(X)$ 与 $\operatorname{Var}(Y)$。

答案 (a) $U[-2,3]$ 的密度是 $1/(3-(-2)) = 1/5$。故 $$\Pr[X\in[0,2]] = \frac{2-0}{3-(-2)} = \frac25 = 0.4.$$ (b) 均匀分布**有记忆**,直接算: $$\Pr[X>2\mid X>1] = \frac{\Pr[X>2]}{\Pr[X>1]} = \frac{(3-2)/5}{(3-1)/5} = \frac{1/5}{2/5} = \frac12 = 0.5.$$ (注意 $\\ne \\Pr[X>1] = 0.4$,所以确实有记忆。) (c) 由线性性(无需独立性): $$\mathbb{E}[X] = \frac{-2+3}{2} = 0.5, \qquad \mathbb{E}[Y] = \frac{1}{2} = 0.5.$$ 故 $\\mathbb{E}[3X-4Y] = 3(0.5) - 4(0.5) = 1.5 - 2 = -0.5$。 (d) 指数分布**无记忆**,所以 $$\Pr[Y>1\mid Y>0.5] = \Pr[Y > 0.5] = e^{-2\times0.5} = e^{-1} = 0.36787944.$$ (数值核对:$e^{-2\\cdot1}/e^{-2\\cdot0.5} = e^{-2}/e^{-1} = e^{-1}$ ✓。) (e) $\\operatorname{Var}(X) = \\dfrac{(3-(-2))^2}{12} = \\dfrac{25}{12} = 2.083333$;$\\operatorname{Var}(Y) = \\dfrac{1}{2^2} = 0.25$。 (脚本 Simpson 数值积分核对:$\\operatorname{Var}(X)$ 数值 $2.083333$ ✓,$\\operatorname{Var}(Y)$ 数值 $0.250000$ ✓。)

Q2.(概念/证明) 证明:若连续随机变量 $X$ 取值于 $[0,\infty)$ 且满足无记忆性 \(\Pr[X>s+t\mid X>s] = \Pr[X>t] \quad\text{对一切 } s,t\ge 0,\) 且 $X$ 的尾函数 $g(t):=\Pr[X>t]$ 连续,则必有 $g(t) = e^{-\lambda t}$ 对某个 $\lambda > 0$,即 $X\sim\mathrm{Exp}(\lambda)$。

答案 **证明策略**:把无记忆性翻译成函数方程 $g(s+t)=g(s)g(t)$,再解这个方程。关键是先证明 $g$ **单调不增**,从而可以取对数,把乘法方程变成加法方程(柯西方程),最后用连续性定出线性解。 **逐步推导**: 第 1 步(把条件概率展开)。$X \\ge 0$ 保证 $\\Pr[X>s]>0$ 对一切 $s\\ge0$ 成立(且 $g$ 严格正:见第 3 步)。由尾事件嵌套 $\\{X>s+t\\}\\subseteq\\{X>s\\}$, $$g(s+t) = \Pr[X>s+t] = \Pr[X>s+t\mid X>s]\cdot\Pr[X>s] = \Pr[X>t]\cdot\Pr[X>s] = g(t)\,g(s).$$ 故 $g$ 满足**函数方程** $g(s+t)=g(s)g(t)$ 对一切 $s,t\\ge0$。 第 2 步($g$ 单调不增)。由 $X$ 取值于 $[0,\\infty)$,$\\{X>t^{\\prime}\\}\\subseteq\\{X>t\\}$ 对 $t^{\\prime}\\ge t$,故 $g(t^{\\prime})\\le g(t)$。又 $g(0)=\\Pr[X>0]=1$。 第 3 步($g>0$)。若存在 $t_0$ 使 $g(t_0)=0$,则对一切 $t\\ge t_0$ 有 $g(t)=0$。由 $g(0)=1$ 与 $g$ 单调,这允许"跳到 $0$ 后永远为 $0$"的解(对应"有界支撑"的分布)。要排除它,用 $X$ 的无记忆性本身:设 $t_1$ 是 $g$ 第一次取 $0$ 的下确界。若 $t_1<\\infty$,取 $s=t_1/2$,则 $g(t_1) = g(t_1/2)^2$,而 $g(t_1)=0$ 要求 $g(t_1/2)=0$,与 $t_1$ 的定义(下确界)矛盾。故 $g(t)>0$ 对一切 $t\\ge0$。(这正是"无记忆性排除有界支撑"的机制:**有界支撑的分布如 $U[0,10]$ 会因为 $g(10)=0$ 而在 $t=10$ 处破坏相乘关系**。) 第 4 步(取对数)。定义 $h(t) = \\ln g(t)$,良定义($g>0$)且 $h(0)=0$。由第 1 步取对数得**柯西方程 (Cauchy equation)**: $$h(s+t) = h(s) + h(t) \quad \text{对一切 } s,t \ge 0.$$ 第 5 步(解柯西方程)。由 $h$ 连续($g$ 连续)且单调不增,可得存在常数 $c$ 使 $h(t) = ct$。理由是标准的:先由归纳得 $h(n t)=n h(t)$ 对正整数 $n$,再对有理数 $q=m/n$ 得 $h(q)=qh(1)$,最后用连续性把有理逼近推广到一切实数。 第 6 步(定符号)。因 $g$ 单调不增且 $g(0)=1$,故 $g(t)\\le1$,即 $h(t)\\le0$,于是 $c\\le0$。令 $\\lambda := -c \\ge 0$。若 $\\lambda=0$ 则 $g\\equiv1$,即 $\\Pr[X=\\infty]=1$,与"$X$ 是实值随机变量且 $\\Pr[X<\\infty]=1$"矛盾。故 $\\lambda>0$,从而 $$g(t) = e^{-\lambda t} \implies F(t) = 1 - e^{-\lambda t} \implies X\sim\mathrm{Exp}(\lambda).$$ **证明机制解说**:全证明只有两个"灵光一现":(i) 把条件概率展开成**乘法函数方程** $g(s+t)=g(s)g(t)$;(ii) 认识到 $g>0$ 所以可以对数化,从而把乘法问题变成加法问题。这是"化归"的典范:指数函数是唯一满足 $g(s+t)=g(s)g(t)$ 的连续函数,所以**无记忆性等价于指数分布**。

Q3.(概念/反例) 判断下列陈述真假并说明理由:(a) “若 $\Pr[A]=0$,则 $A=\emptyset$。” (b) “若连续随机变量 $X$ 的密度在 $x=0$ 处满足 $f(0)=5$,则 $\Pr[X=0]=5$。” (c) “两个连续随机变量 $X,Y$ 满足 $\operatorname{cov}(X,Y)=0$,则它们独立。” (d) “若 $g(x)=f(x)$ 在除有限个点外处处相等,则 $g$ 与 $f$ 导出同一个概率分布。”

答案 (a) **假。** 取 $X\\sim U[0,1]$,$A=\\{X = 0.5\\} \\ne\\emptyset$($0.5$ 确实是 $X$ 可能取的值),但 $\\Pr[A]=0$。连续概率里"零概率"与"空事件"是两回事:$\\Pr$ 只对**可数并**可加,而单点事件有不可数多个,它们的并 $\\{X\\in[0,1]\\}$ 概率为 $1$。**注意区分**:"零概率"在离散情形等价于"不可能"(因为样本点可数,零概率点之并仍零概率),在连续情形不等价。 (b) **假(且荒谬)。** $\\Pr[X=0]=0$ 对任何连续随机变量成立(连续分布没有原子)。$f(0)=5$ 只说明"落在 $0$ 附近每单位长度的概率是 $5$",即 $\\Pr[0\\le X\\le 0.01]\\approx 0.05$。密度可以任意大:$U[0,0.1]$ 的密度处处是 $10$,$\\mathrm{Exp}(10)$ 在 $0$ 处密度是 $10$。 (c) **假。** 不相关 $\\not\\Rightarrow$ 独立(讲次 22 已给出离散反例)。连续反例:取 $X\\sim U[-1,1]$,$Y = X^2$。则 $\\mathbb{E}[X]=0$,$\\mathbb{E}[XY]=\\mathbb{E}[X^3]=0$(奇函数在对称区间上积分为 $0$),故 $\\operatorname{cov}(X,Y)=\\mathbb{E}[XY]-\\mathbb{E}[X]\\mathbb{E}[Y]=0$。但 $Y$ **完全由 $X$ 决定**(知道 $X$ 就精确知道 $Y$),显然不独立。**正确方向**是"独立 $\\Rightarrow$ 不相关"(当二阶矩存在时)。 (d) **真。** 因为概率由积分给出:$\\Pr[a\\le X\\le b] = \\int_a^b f$,而积分对**零测集**(有限个点、甚至可数多个点)的改动不敏感。所以 $f$ 只在有限个点上与 $g$ 不同不影响任何事件的概率。**推论**:连续分布没有唯一的密度函数,密度是"几乎处处 (almost everywhere)"意义下确定的。这也是为什么"$f(x)=\\Pr[X=x]$"这种想法从一开始就不对——连 $f$ 的逐点值都不是唯一确定的量。

Q4.(多个分布的图形对照) 下面这张 ASCII 图刻画了 $U[0,1]$、$\mathrm{Exp}(1)$、$\mathrm{Exp}(2)$ 的密度形状。请据此回答:为什么 $U[0,1]$ 的方差($1/12\approx0.0833$)比 $\mathrm{Exp}(1)$ 的方差($1$)小得多,尽管两者的”平均高度”看起来相近?

  f(x)
  2.0 |*
      |*
  1.6 |*  .                        <- Exp(2): lambda*e^{-2x}, f(0)=2
      |*  .  .
  1.2 |*   .   ..                  <- Exp(1): lambda*e^{-x},  f(0)=1
      |*    .     ..._
  0.8 |*     .          ----______
      |*      .                    <- U[0,1]: f(x)=1 on [0,1], 0 elsewhere
  0.4 |*______.____,_______-------
      |*      .    |
  0.0 +*------+----+--------------> x
      0      1    2    3    4
      |<-- 均匀分布的全部质量挤在宽度 1 内 -->|

  面积恒等式:int f = 1 对三条曲线都成立
  U[0,1]   : 底 1 x 高 1  = 1
  Exp(1)   : 长尾,质量拖到无穷远
  Exp(2)   : 更陡更尖,但尾巴更短
答案 关键在**质量的"摊开程度"不同**,而方差的本质就是"质量离均值多远"。 - $U[0,1]$:均值 $\\mu = 0.5$,质量全部集中在 $[0,1]$ 这个**宽度为 $1$** 的区间内,故标准差 $\\sigma = 1/\\sqrt{12} = 0.2887\\le 0.5$,永远不超过半宽。事实上 $\\Pr[\\vert X-\\mu\\vert >0.5]=0$——**均匀分布是"最集中"的分布**(在固定支撑长度的分布中,均匀分布方差最大,但对 $[0,1]$ 与 $\\mathbb{R}_+$ 这个比较而言它显然最窄)。 - $\\mathrm{Exp}(1)$:均值 $\\mu=1$,但**长尾拖到无穷**。计算 $\\Pr[X>3]=e^{-3}=0.0498\\approx5\\%$ 的质量落在 $3$ 之外,$\\Pr[X>5]=0.0067$。这些"极远"的样本贡献了巨大的 $(x-\\mu)^2$(如 $x=5$ 贡献 $(4)^2=16$)。别忘了一个漂亮的事实:指数分布的标准差 $=$ 均值 $=1$,即 $\\sigma/\\mu = 1$,而均匀分布的 $\\sigma/\\mu = 0.2887/0.5 = 0.577$。**变异系数 (coefficient of variation)** 正是这个比值。 - $\\mathrm{Exp}(2)$:$\\mu=0.5$,$\\sigma=0.5$,形状与 $\\mathrm{Exp}(1)$ "自相似"(只是横轴压缩 $2$ 倍),所以方差是 $\\mathrm{Exp}(1)$ 的 $1/4$。 **为什么视觉上"平均高度接近"却方差差 $12$ 倍?** 因为 $U[0,1]$ 的"高"来自**窄底**(底宽 $1$、高 $1$),$\\mathrm{Exp}(1)$ 的"高"来自**长尾换面积**($f(0)=1$ 但底延伸到无穷)。把面积归一化到 $1$ 之后,**同样的"高度"配不同长度的"底",得到的离散程度完全不同**。离散类比:一个取 $\\{0,1\\}$ 各 $1/2$ 的分布方差是 $0.25$,而一个取 $\\{0,100\\}$ 各 $1/2$ 的分布方差是 $2500$——两者的"高度"(PMF 值)都是 $1/2$,但尺度差 $100$ 倍,方差差 $10^4$ 倍。 **脚本对照表**: | 分布 | $\\mathbb{E}$ | $\\operatorname{Var}$ | $\\sigma$ | $\\sigma/\\mu$ | |:---|:---|:---|:---|:---| | $U[0,1]$ | $0.5$ | $0.083333$ | $0.2887$ | $0.577$ | | $U[0,10]$ | $5$ | $8.333333$ | $2.887$ | $0.577$ | | $\\mathrm{Exp}(1)$ | $1$ | $1$ | $1$ | $1$ | | $\\mathrm{Exp}(2)$ | $0.5$ | $0.25$ | $0.5$ | $1$ | 结论:$\\operatorname{Var}$ 是**尺度敏感**的量(量纲是单位平方),比较不同分布时最好同时看 $\\sigma/\\mu$ 这个无量纲比值。