Lecture 25: Gaussian Distribution & CLT(高斯分布与中心极限定理)

目录 · ← l25 · l27 →

Lecture 25: Gaussian Distribution & CLT(高斯分布与中心极限定理)

概述

上一讲我们建立了连续概率的框架,并认识了两个分布:均匀分布与指数分布。本讲要介绍第三个、也是在应用中压倒性最重要的连续分布:正态分布(normal distribution),又称高斯分布(Gaussian distribution)。它由两个参数刻画——均值 $\mu$ 与方差 $\sigma^2$——密度是一条关于 $x=\mu$ 对称的”钟形曲线”。

但正态分布真正的主角地位来自本讲的核心定理:中心极限定理 (Central Limit Theorem, CLT)。它说:任意独立同分布的随机变量之和,只要均值与方差有限,标准化之后都收敛到标准正态分布。也就是说,不论原始分布长什么样(均匀、指数、二项、骰子、高度偏斜……),把它们加起来、平均起来,形状一律变成钟形。原分布的全部信息只剩下两个数:均值 $\mu$ 与方差 $\sigma^2$。

这是整个课程”从特殊到普遍”最震撼的一步:讲次 23 的大数定律只告诉我们”样本均值趋于 $\mu$”,CLT 则告诉我们”围绕 $\mu$ 的波动长什么样、有多大”——误差量级是 $\sigma/\sqrt{n}$,且形状是正态。本讲末尾还会讲清 CLT 的边界:需要有限方差、需要(近似)独立、$n$ 要够大、而且它说的是”均值的分布“而非”数据本身”。

核心概念的直观解释

正态分布 / 高斯分布 (Normal / Gaussian Distribution)

  • 定义:对任意 $\mu \in \mathbb{R}$ 与 $\sigma > 0$,若连续随机变量 $X$ 的概率密度为 \(f(x) = \frac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right),\) 则称 $X$ 服从参数为 $\mu, \sigma^2$ 的正态分布,记作 $X \sim \mathcal{N}(\mu, \sigma^2)$。特别地,$\mu=0,\sigma=1$ 时称为标准正态分布 (standard normal),记为 $\mathcal{N}(0,1)$。

  • 直观解释(”它是什么意思?”):把 $f(x)$ 拆成三块看。
    • 指数里的 $-(x-\mu)^2/(2\sigma^2)$:这是钟形的来源。随着 $\vert x-\mu\vert $ 增大,$(x-\mu)^2$ 二次增长,$e^{-(\cdot)}$ 极速衰减,所以曲线在两侧迅速贴近 $0$。二次型是”惩罚偏离均值”的最自然方式(类比:最小二乘、误差平方和)。
    • $x=\mu$ 是唯一的峰值点,且曲线关于 $x=\mu$ 左右对称(因为 $(x-\mu)^2$ 是 $x-\mu$ 的偶函数)。
    • 分母里的 $\sigma$:$\sigma$ 越大,指数衰减越慢,钟形越”胖”;$\sigma$ 越小越”瘦高”。而前面的系数 $1/\sqrt{2\pi\sigma^2}$ 正是为让总面积为 $1$ 而设的归一代价:$\sigma$ 变大 $\Rightarrow$ 峰变矮、范围变宽,面积不变。峰高恰好是 $f(\mu) = 1/\sqrt{2\pi\sigma^2} \approx 0.4/\sigma$。

    现实类比:正态分布是”大量微小独立扰动之叠加“的模型。Berkeley 蚊子的体重(受无数基因与环境微扰共同决定)、物理实验的观测误差(无数仪器与环境误差叠加)、某地成年男性身高(同理)——都近似正态。这不奇怪,因为它正是 CLT 的结论。

  • 具体示例:$X\sim\mathcal{N}(0,1)$ 时 $f(0) = 1/\sqrt{2\pi} = 0.398942$(脚本验算)。$X\sim\mathcal{N}(2,4)$(即 $\mu=2,\sigma=2$)时峰值在 $x=2$、峰高 $= 1/\sqrt{2\pi\cdot4} = 0.199471$,恰为标准正态峰高的一半。

标准化 (Standardization)

  • 定义:若 $X\sim\mathcal{N}(\mu,\sigma^2)$,定义 \(Z = \frac{X - \mu}{\sigma},\) 则 $Z \sim \mathcal{N}(0,1)$(见定理 25.2)。反过来,若 $Z\sim\mathcal{N}(0,1)$,则 $X = \sigma Z + \mu \sim \mathcal{N}(\mu,\sigma^2)$。

  • 直观解释:标准化 = “先把原点平移到均值处(减去 $\mu$),再把长度单位换成标准差(除以 $\sigma$)“。做完这两步,一切正态分布都变成同一条曲线 $\mathcal{N}(0,1)$。生活类比:把不同学科的成绩换算成”离班级平均几个标准差”,就得到可比的 $z$ 分数 (z-score)。

  • 具体示例:设 $X \sim \mathcal{N}(70, 100)$($\mu=70$ 分,$\sigma=10$ 分)。则 $X=85$ 对应 $z=(85-70)/10 = 1.5$,即”高于平均 $1.5$ 个标准差”。于是 \(\Pr[X \le 85] = \Pr[Z \le 1.5].\) 这就是为什么统计书里只需要一张标准正态表:把问题约化到 $\mathcal{N}(0,1)$ 之后,所有正态分布共用同一张表。

68–95–99.7 法则(经验法则 Empirical Rule)

  • 内容:若 $X \sim \mathcal{N}(\mu,\sigma^2)$,则
区间概率(脚本验算)近似口诀
$\mu \pm 1\sigma$$\Pr[\vert Z\vert \le1] = 0.682690$$\approx 68\%$
$\mu \pm 2\sigma$$\Pr[\vert Z\vert \le2] = 0.954500$$\approx 95\%$
$\mu \pm 3\sigma$$\Pr[\vert Z\vert \le3] = 0.997300$$\approx 99.7\%$
$\mu \pm 0.6745\sigma$$\Pr[\vert Z\vert \le0.6745]=0.500007$中央 $50\%$
$\mu \pm 1.96\sigma$$\Pr[\vert Z\vert \le1.96]=0.950004$中央 $95\%$(置信区间用)
$\mu \pm 2.576\sigma$$\Pr[\vert Z\vert \le2.576]=0.990005$中央 $99\%$
  • 直观解释:注意单侧双侧的区别:$\Pr[Z\le 1]=0.841345$(单侧 $84\%$),但 $\Pr[\vert Z\vert \le 1]=0.682690$(双侧 $68\%$)。另外记一个常用数:$\Pr[Z>1.96]\approx0.025$,所以”均值 $\pm 1.96$ 个标准差”正好夹住中央 $95\%$ 的质量。为什么要 $1.96$ 而不是 $2$?因为 $2$ 给出 $95.45\%$(少了一点),要精确 $95\%$ 需把半宽放宽到 $1.96\sigma$。

  • 具体示例:$X\sim\mathcal{N}(70,100)$($\sigma=10$)。则 $\Pr[60\le X \le 80] \approx 68.3\%$,$\Pr[50 \le X \le 90]\approx 95.5\%$,$\Pr[40\le X\le 100]\approx 99.7\%$。若某天有人考了 $102$ 分,那已经超出 $3$ 个标准差($z=3.2$),$\Pr[Z>3.2]\approx 0.0007$——”千年一遇”,值得怀疑是不是卷子有问题(这正是 $p$ 值/异常检测的思想)。

为什么正态分布无处不在?

  • 答案:因为它是“大量微小独立扰动之和”的极限分布。设一个量 $X = \sum_{i=1}^n Y_i$,其中每个 $Y_i$ 是”一个小扰动”(同分布、独立,$\mathbb{E}[Y_i]=\mu_i$、$\operatorname{Var}(Y_i)=\sigma_i^2$)。只要 $n$ 大且没有单个 $Y_i$ 支配总和,$X$ 的分布就接近正态,参数是 $\mu=\sum\mu_i$、$\sigma^2 = \sum\sigma_i^2$。原分布的形状被彻底”洗掉”,只剩一阶矩与二阶矩。
  • 直观解释:这也是为什么”误差”在科学中普遍正态:一次测量误差是许多独立微小误差之和;身高、体重、血压、考试成绩是许多独立微小遗传与环境因素之和。
  • 具体示例(骰子之和):单枚骰子是离散均匀分布(完全不像钟形),但脚本验算表明 $n$ 枚骰子之和与正态的最大点偏差随 $n$ 迅速缩小:
$n$均值 $3.5n$标准差 $\sqrt{35n/12}$与正态的最大点偏差
$1$$3.5$$1.7078$$0.08666$
$2$$7$$2.4152$$0.01364$
$5$$17.5$$3.8188$$0.00327$
$10$$35$$5.4006$$0.00118$
$30$$105$$9.3541$$0.00023$

$n=1$ 时偏差 $0.087$(很不像),$n=30$ 时只有 $0.00023$(几乎一样)。 而且 $n=1$ 的骰子是”平的”,正态近似根本不成立;$n=2$ 是三角形;$n=3$ 已经明显像钟了。

中心极限定理 (Central Limit Theorem, CLT)

  • 定义/陈述:设 $X_1, X_2, \dots$ 是独立同分布 (i.i.d.) 的随机变量序列,$\mathbb{E}[X_i] = \mu$、$\operatorname{Var}(X_i)=\sigma^2$ 都有限且 $\sigma^2>0$。记 $S_n = \sum_{i=1}^n X_i$。则标准化和 \(\frac{S_n - n\mu}{\sigma\sqrt{n}} \xrightarrow{\ d\ } \mathcal{N}(0,1) \quad (n\to\infty),\) 这里的 $\xrightarrow{d}$ 表示依分布收敛 (convergence in distribution)。等价地,对任意常数 $c \in \mathbb{R}$, \(\Pr\left[\frac{S_n - n\mu}{\sigma\sqrt{n}} \le c\right] \longrightarrow \frac{1}{\sqrt{2\pi}}\int_{-\infty}^{c} e^{-x^2/2}\,dx = \Phi(c).\)

  • 等价形式(更常用):样本均值 $\bar X_n = S_n/n$ 满足 \(\frac{\bar X_n - \mu}{\sigma/\sqrt{n}} \xrightarrow{\ d\ } \mathcal{N}(0,1), \qquad\text{即}\qquad \bar X_n \approx \mathcal{N}\!\left(\mu, \frac{\sigma^2}{n}\right).\) 注意这两个式的分母不同:和 $S_n$ 的波动是 $\sigma\sqrt n$,均值的波动是 $\sigma/\sqrt n$。$\bar X_n$ 的均值与方差我们早就知道(分别是 $\mu$ 与 $\sigma^2/n$,讲次 20 与 22);CLT 的新信息是“分布形状变成正态”

  • 直观解释(”它是什么意思?”)误差量级 $\sigma/\sqrt n$。 这是全文最重要的一个量。想让估计精度提高一倍,样本量要增加到 $4$ 倍(因为 $\sqrt n$)。想让精度提高 $10$ 倍,要 $100$ 倍样本量。这条”开根号定律”支配着所有抽样调查、蒙特卡洛模拟、A/B 测试的成本预算。

  • 具体示例:一枚公平骰子 $\mu=3.5$、$\sigma=\sqrt{35/12}=1.707825$。掷 $n=100$ 次,则 $\bar X \approx \mathcal{N}(3.5, 0.029168)$,标准差 $\sigma/\sqrt{100} = 0.170783$。所以”100 次掷骰子平均值落在 $3.5\pm0.335$ 内”的概率约 $95\%$($1.96\sigma/\sqrt n = 0.33473$)。脚本用 $2\times10^4$ 次独立实验模拟,实测 $95\%$ 置信区间覆盖率为 $0.9515$——与理论 $0.95$ 吻合。

CLT 与大数定律 (LLN) 的对比

  • 大数定律(讲次 23):$\dfrac{S_n}{n} \to \mu$(依概率),即”均值收敛到 $\mu$“。它只说”会靠近”,不说”多近、以什么形状靠近”。
  • 中心极限定理(本讲):$\dfrac{S_n-n\mu}{\sigma\sqrt n} \xrightarrow{d}\mathcal{N}(0,1)$,即”偏离的尺度与形状“。它给出 $\bar X_n$ 的波动量级 $\sigma/\sqrt n$ 与波动的分布形状 $\mathcal{N}$。
  • 类比:LLN 说”箭最终会射中靶心附近的某个点”;CLT 说”箭的散布服从二维正态,散布半径正比于 $1/\sqrt n$、并精确告诉你命中环数的概率”。LLN 是 CLT 的”粗糙版”:由 CLT 可以推出 LLN(因为 $\sigma/\sqrt n\to0$,正态分布的质量越来越集中在 $0$ 附近),但反过来不行。

连续性修正 (Continuity Correction)

  • 问题:CLT 的极限分布是连续的正态,而被近似的对象(如二项分布 $B(n,p)$)是离散的。直接代入会产生系统性偏差。
  • 修正规则:把离散点 $k$ 看作连续区间 $[k-\tfrac12, k+\tfrac12]$(”把每个整数摊成一个宽度 $1$ 的小柱”)。于是 \(\Pr[X \le k] \approx \Phi\!\left(\frac{k + 0.5 - n\mu}{\sigma}\right), \quad \Pr[X \ge k] \approx 1 - \Phi\!\left(\frac{k - 0.5 - n\mu}{\sigma}\right),\) \(\Pr[a \le X \le b] \approx \Phi\!\left(\frac{b+0.5-n\mu}{\sigma}\right) - \Phi\!\left(\frac{a-0.5-n\mu}{\sigma}\right).\)
  • 具体示例(脚本验算,$n=30,p=0.5$,$\mu=15$,$\sigma=\sqrt{7.5}=2.738613$)
目标量精确值无修正有修正
$\Pr[X=15]$$0.144464$$0.145673$(密度法)
$\Pr[X\le15]$$0.572232$$\Phi(0)=0.500000$ ❌$\Phi(0.5/\sigma)=0.572434$ ✓
$\Pr[10\le X\le20]$$0.957226$$0.932111$$0.955390$

注意无修正在 $\Pr[X\le15]$ 上错得离谱($0.500$ vs 真实 $0.572$),因为 $\Pr[X\le15]$ 在对称情况下恰好卡在中点,非常敏感。修正后误差降到 $0.0002$。再看 $n=100,p=0.4$($\mu=40,\sigma=4.8990$):$\Pr[35\le X\le45]$ 精确 $0.738573$,有修正 $0.738428$ ✓,无修正 $0.692566$(误差 $0.046$)。结论:连续性修正是”便宜且必要”的改进,务必加上。

置信区间 (Confidence Interval)

  • 构造:设 $X_1,\dots,X_n$ i.i.d.,均值 $\mu$、方差 $\sigma^2$。由 CLT,$\Pr[-1.96 \le \frac{\bar X - \mu}{\sigma/\sqrt n}\le 1.96] \approx 0.95$。把不等式对 $\mu$ 解出来: \(\Pr\left[\bar X - \frac{1.96\sigma}{\sqrt n} \le \mu \le \bar X + \frac{1.96\sigma}{\sqrt n}\right] \approx 0.95.\) 区间 $\left[\bar X - \frac{1.96\sigma}{\sqrt n},\ \bar X + \frac{1.96\sigma}{\sqrt n}\right]$ 称为 $\mu$ 的 $95\%$ 置信区间

  • 确切含义(必须说清):$\mu$ 是一个固定的未知常数(不是随机变量);随机的是区间的两个端点。所以这句话的意思是:“如果把这个实验(抽 $n$ 个样本、算出这个区间)重复无数次,那么其中约 $95\%$ 的区间会盖住真值 $\mu$。” 这是一个关于整个程序 (procedure) 的长期频率保证,而不是关于某一次具体区间的概率断言。

  • 常见误读
    • ❌ “$\mu$ 落在本次区间内的概率是 $95\%$。” —— 对固定的一次实验,$\mu$ 要么在区间里、要么不在,没有概率可言(频率学派解释下)。
    • ❌ “$95\%$ 的数据落在区间内。” —— 数据落在 $\bar X \pm 1.96\sigma/\sqrt n$ 内的比例远小于 $95\%$:这个半宽是均值的波动量级($\sigma/\sqrt n$),不是数据的波动量级($\sigma$)。真正含 $95\%$ 数据的是 $\bar X \pm 1.96\sigma$(宽 $\sqrt n$ 倍)。
    • ❌ “区间越宽越有把握,所以干脆取 $100\%$ 置信。” —— 置信区间宽度与置信度是一对权衡;$100\%$ 置信需要区间是整个实数轴,毫无信息量。
    • ⚠️ 反向陷阱:”样本量增加 $4$ 倍只能把半宽减半,所以不值得多做实验。” —— 半宽是 $\sigma/\sqrt n$,$n\to4n$ 恰使半宽减半。这个”减半”在精度敏感的场景(如药品审批)往往正是必须付的代价;错的是以为 $n\to2n$ 就能减半。
  • 具体示例:单骰子 $\sigma = 1.707825$。脚本验算 $95\%$ 置信区间半宽随 $n$ 的收缩:
$n$半宽 $1.96\sigma/\sqrt n$
$100$$0.33473$
$400$$0.16737$
$1000$$0.10585$
$10000$$0.03347$

$n$ 从 $100$ 到 $10000$($\times100$),半宽从 $0.3347$ 降到 $0.0335$($\div10$)——正是 $\sqrt{100}=10$ 的开根号定律。

CLT 的证明思路(矩生成函数 / 特征函数)

  • 工具矩生成函数 (Moment Generating Function, MGF) $M_X(t) = \mathbb{E}[e^{tX}]$,或特征函数 (characteristic function) $\varphi_X(t)=\mathbb{E}[e^{itX}]$(后者总存在,前者可能发散)。核心事实:分布被特征函数唯一确定,且依分布收敛 $\iff$ 特征函数逐点收敛
  • 为什么选这个策略:因为独立性让和的 MGF 变成乘积:$M_{X+Y}(t) = M_X(t)M_Y(t)$(离散情形由 $\mathbb{E}[e^{t(X+Y)}]=\mathbb{E}[e^{tX}]\mathbb{E}[e^{tY}]$ 得到,用到独立性)。“求和 → 求积”是把 $n$ 个变量的问题压成 $n$ 次方的关键。
  • 步骤概要(下一节给出可计算的详细版本):标准化后 $Z_n = \sum_i (X_i-\mu)/(\sigma\sqrt n)$,则 $\log M_{Z_n}(t) = n\log M_{(X-\mu)/\sigma}(t/\sqrt n)$。把 $\log M$ 在 $0$ 附近做 Taylor 展开,一次项为 $0$(因为中心化后均值为 $0$)、二次项为 $t^2/2$(因为二次项系数是方差,标准化后方差为 $1$),于是 $n\log M(t/\sqrt n) \to nt^2/(2n) = t^2/2$,即 $M_{Z_n}(t)\to e^{t^2/2}$。而 $e^{t^2/2}$ 正是 $\mathcal{N}(0,1)$ 的 MGF。证毕。
  • 本课定位:官方 Note 只给出 CLT 的陈述与直觉,完整的解析证明(含上述 Taylor 展开的严格余项控制、以及”特征函数唯一决定分布”)超出本课范围。但机制的核心——”一次项消失、二次项来自方差、$n$ 次方恰好把 $1/n$ 抵消掉,留下 $e^{t^2/2}$”——是完全可以讲清楚的,下面给出脚本可验证的版本。

独立正态之和仍是正态 (Sum of Independent Normals)

  • 定理:设 $X\sim\mathcal{N}(\mu_X,\sigma_X^2)$、$Y\sim\mathcal{N}(\mu_Y,\sigma_Y^2)$ 独立,$a,b\in\mathbb{R}$。则 \(Z = aX + bY \sim \mathcal{N}\left(a\mu_X + b\mu_Y,\ a^2\sigma_X^2 + b^2\sigma_Y^2\right).\) 特别地,$a=b=1$ 时 $X+Y\sim\mathcal{N}(\mu_X+\mu_Y,\sigma_X^2+\sigma_Y^2)$:均值相加、方差相加
  • 直观解释:正态族在”独立相加”下闭包 (closed)——这是它极其好用的原因(类比:讲次 19 的二项分布是伯努利分布之和,也闭包;正态是它的连续对应)。注意方差前的系数是 $a^2,b^2$(平方),因为方差是二次量。
  • 具体示例:$X\sim\mathcal{N}(1,4)$、$Y\sim\mathcal{N}(-1,9)$ 独立,则 $X+Y \sim \mathcal{N}(0,13)$,即均值 $0$、标准差 $\sqrt{13}=3.605551$。脚本用 Box–Muller 生成 $4\times10^5$ 对样本,得 $\mathbb{E}[X+Y]=-0.0079$、$\operatorname{Var}(X+Y)=13.0441$——与 $(0,13)$ 吻合。

完整证明与推导(核心)

定理 25.1(高斯积分:正态密度是合法的 PDF):$\displaystyle\int_{-\infty}^{\infty} e^{-x^2/2}\,dx = \sqrt{2\pi}$。从而对任意 $\mu,\sigma$,$\displaystyle\int_{-\infty}^{\infty}\frac{1}{\sqrt{2\pi\sigma^2}}e^{-(x-\mu)^2/(2\sigma^2)}dx = 1$。

证明策略极坐标技巧 (polar coordinates trick)。选择这个策略的理由很实际:$e^{-x^2/2}$ 没有初等原函数,所以一维直接积分走不通。但平方之后变成二重积分,被积函数 $e^{-(x^2+y^2)/2}$ 只依赖半径 $r=\sqrt{x^2+y^2}$,在极坐标下分离变量,两个方向各自都变得好算。这是数学中最著名的”绕道”之一。

逐步推导

第 1 步(平方,升维)。设 $I = \int_{-\infty}^{\infty}e^{-x^2/2}dx$。则 \(I^2 = \left(\int_{-\infty}^{\infty}e^{-x^2/2}dx\right)\left(\int_{-\infty}^{\infty}e^{-y^2/2}dy\right) = \int_{-\infty}^{\infty}\int_{-\infty}^{\infty} e^{-(x^2+y^2)/2}\,dx\,dy.\) 这一步的依据是Fubini 定理:$e^{-(x^2+y^2)/2}>0$,非负函数的二重积分等于两个一维积分的乘积(也可直接看作把两个独立的一维积分合并成平面上的积分)。

第 2 步(换极坐标)。令 $x = r\cos\theta$、$y = r\sin\theta$,$r\in[0,\infty)$、$\theta\in[0,2\pi)$。此时 \(x^2 + y^2 = r^2, \qquad dx\,dy = r\,dr\,d\theta.\) 注意那个关键的 Jacobi 因子 $r$—它不是装饰,正是它让径向积分可算。

第 3 步(分离变量): \(I^2 = \int_0^{2\pi}\int_0^{\infty} e^{-r^2/2}\,r\,dr\,d\theta = \left(\int_0^{2\pi}d\theta\right)\left(\int_0^{\infty} r e^{-r^2/2}\,dr\right).\)

第 4 步(算两个一维积分)。

  • 角度部分:$\int_0^{2\pi}d\theta = 2\pi$。
  • 径向部分:令 $u = r^2/2$,则 $du = r\,dr$,故 \(\int_0^{\infty} r e^{-r^2/2}dr = \int_0^{\infty}e^{-u}du = \Big[-e^{-u}\Big]_0^{\infty} = 1.\) 数值核对:Simpson 在 $[0,40]$ 上算得 $1.0000000000$ ✓。

第 5 步(开方): \(I^2 = 2\pi\cdot1 = 2\pi \implies I = \sqrt{2\pi} = 2.5066282746.\) 数值核对:Simpson 在 $[-40,40]$ 上算 $\int e^{-x^2/2}dx = 2.5066282746$ ✓,与 $\sqrt{2\pi}$ 完全一致。顺带 $\int e^{-x^2}dx = \sqrt\pi = 1.7724538509$ ✓。

第 6 步(一般 $\mu,\sigma$)。令 $x = \mu + \sigma y$,则 $dx = \sigma\,dy$、$(x-\mu)^2/(2\sigma^2) = y^2/2$,所以 \(\int_{-\infty}^{\infty}\frac{1}{\sqrt{2\pi\sigma^2}}e^{-(x-\mu)^2/(2\sigma^2)}dx = \frac{1}{\sqrt{2\pi\sigma^2}}\cdot\sigma\int_{-\infty}^{\infty}e^{-y^2/2}dy = \frac{\sigma\sqrt{2\pi}}{\sqrt{2\pi\sigma^2}} = 1.\ ✓\) 数值核对:$\frac{1}{\sqrt{2\pi}}\int e^{-x^2/2}dx = 1.0000000000$ ✓。

第 7 步(非负性校验)。$e^{\text{任意实数}}>0$,系数 $1/\sqrt{2\pi\sigma^2}>0$,故 $f(x)>0$ 处处成立 ✓。两条 PDF 公设都满足,$f$ 确实是一个概率密度。

【证明机制解说】:这个证明的”灵光一现”是“平方升维 + 极坐标”。为什么必须绕道?因为 $\int e^{-x^2/2}dx$ 的困难在于被积函数虽然简单,其原函数却不是初等函数(误差函数 $\mathrm{erf}$ 不是初等函数)。平方之后 $x$ 与 $y$ 对称出现,而极坐标恰好把这个对称性利用起来:$x^2+y^2=r^2$ 让指数变成纯粹的 $r$ 的函数,Jacobi 因子 $r$ 又恰好凑出一个完美可积的形式。这个技巧会在任何涉及”正态归一化”的地方反复出现——例如”独立正态之和仍是正态”的旋转对称证明(见定理 25.4)、以及二维正态的协方差结构。

定理 25.2(标准化定理):若 $X\sim\mathcal{N}(\mu,\sigma^2)$,则 $Y = \dfrac{X-\mu}{\sigma}\sim\mathcal{N}(0,1)$。

证明策略:直接证明——用 CDF 做变量替换。选择 CDF 而不是密度的理由:CDF 方法不需要背”密度如何变换”的公式(那需要 Jacobi 因子),它只需要把事件 $\{Y\le b\}$ 翻译回 $X$ 的语言,然后在 $X$ 的密度上积分。

逐步推导

第 1 步(把事件翻译回去)。对 $a<b$, \(a \le Y \le b \iff a \le \frac{X-\mu}{\sigma} \le b \iff \sigma a + \mu \le X \le \sigma b + \mu.\) 这里用到 $\sigma>0$(不等号方向不变)。

第 2 步(换成 $X$ 的密度积分): \(\Pr[a \le Y \le b] = \Pr[\sigma a + \mu \le X \le \sigma b+\mu] = \int_{\sigma a+\mu}^{\sigma b+\mu}\frac{1}{\sqrt{2\pi\sigma^2}}e^{-(x-\mu)^2/(2\sigma^2)}dx.\)

第 3 步(换元 $x = \sigma y + \mu$)。此时 $dx = \sigma\,dy$,$x-\mu = \sigma y$,积分限从 $[\sigma a+\mu,\sigma b+\mu]$ 变成 $[a,b]$: \(= \frac{1}{\sqrt{2\pi\sigma^2}}\int_a^b e^{-(\sigma y)^2/(2\sigma^2)}\cdot\sigma\,dy = \frac{\sigma}{\sqrt{2\pi\sigma^2}}\int_a^b e^{-y^2/2}dy = \frac{1}{\sqrt{2\pi}}\int_a^b e^{-y^2/2}dy.\)

第 4 步(读出结论)。右端恰是 $\mathcal{N}(0,1)$ 密度在 $[a,b]$ 上的积分。因这对一切 $a<b$ 成立,故 $Y\sim\mathcal{N}(0,1)$。

第 5 步(逆命题)。若 $Y\sim\mathcal{N}(0,1)$ 且 $X = \sigma Y+\mu$,同样的换元(反向走一遍)给出 $X\sim\mathcal{N}(\mu,\sigma^2)$。

【证明机制解说】“平移 + 缩放”是正态分布的自同构 (automorphism)。这两种操作把正态族映到自身,所以整个族只有一个”本质形态” $\mathcal{N}(0,1)$。这就是”只需要一张标准正态表”的数学依据。请注意第 3 步中 $\sigma$ 从换元里冒出来、恰好抵消分母里的 $\sqrt{\sigma^2}$——这不是巧合,而是为让归一化在缩放后仍成立所必需的(密度是”每单位长度的概率”,长度单位放大 $\sigma$ 倍,密度就要除以 $\sigma$)。

反例/注意点:这个”平移 + 缩放不变性”不是所有分布都有。以均匀分布为例,$U[0,1]$ 经过 $X\mapsto\sigma X+\mu$ 变成 $U[\mu,\mu+\sigma]$,仍然是均匀分布(也是闭包的),但形变后不再是同一个分布(除非 $\sigma=1$ 且 $\mu=0$)。指数分布更惨:$\mathrm{Exp}(1)$ 经过 $Y\mapsto \sigma Y$ 变成 $\mathrm{Exp}(1/\sigma)$,形状仍然是同一条曲线的压缩(缩放闭包),但平移会彻底破坏它:$Y+c$($c>0$)不再是任何指数分布,因为它的支撑变成了 $[c,\infty)$、在 $0$ 附近密度为 $0$。也就是说,指数族只有缩放闭包、没有平移闭包;正态族两者都有。 这个对称性上的巨大差异正是正态分布”特殊”的地方之一。整篇 CLT 存在的意义就是解释这种特殊性。

定理 25.3(正态分布的均值与方差):若 $X\sim\mathcal{N}(\mu,\sigma^2)$,则 $\mathbb{E}[X]=\mu$、$\operatorname{Var}(X)=\sigma^2$。

证明策略:先在标准情形 $\mathcal{N}(0,1)$ 上做(利用奇偶性把一阶矩免费拿下,用分部积分把二阶矩归约到高斯积分),再用定理 25.2 的标准化 + 期望线性性与方差的性质搬到一般情形。选择这个策略是因为对称性能省掉大量计算——这是数学中的通用省力法。

逐步推导

第 1 步(标准情形,期望)。设 $Z\sim\mathcal{N}(0,1)$: \(\mathbb{E}[Z] = \frac{1}{\sqrt{2\pi}}\int_{-\infty}^{\infty} x e^{-x^2/2}dx.\) 把积分从 $0$ 拆开:$\int_{-\infty}^{0} + \int_{0}^{\infty}$。作变量替换 $x\mapsto -x$ 在负半轴上:$e^{-(-x)^2/2}=e^{-x^2/2}$、$dx\mapsto -dx$、积分限 $(-\infty,0)\to(\infty,0)$,于是 \(\int_{-\infty}^{0}xe^{-x^2/2}dx = \int_{\infty}^{0}(-x)e^{-x^2/2}(-dx) = -\int_{0}^{\infty}xe^{-x^2/2}dx.\) 两部分恰好抵消(被积函数 $xe^{-x^2/2}$ 是奇函数,在对称区间上积分为 $0$): \(\mathbb{E}[Z] = \frac{1}{\sqrt{2\pi}}\left(-\int_0^\infty xe^{-x^2/2}dx + \int_0^{\infty}xe^{-x^2/2}dx\right) = 0.\)

第 2 步(标准情形,二阶矩)。由 $\mathbb{E}[Z]=0$, \(\operatorname{Var}(Z) = \mathbb{E}[Z^2] = \frac{1}{\sqrt{2\pi}}\int_{-\infty}^{\infty}x^2e^{-x^2/2}dx.\) 用分部积分:取 $u = x$、$dv = xe^{-x^2/2}dx$,则 $du = dx$、$v = -e^{-x^2/2}$。于是 \(\int_{-\infty}^{\infty}x^2e^{-x^2/2}dx = \underbrace{\Big[-xe^{-x^2/2}\Big]_{-\infty}^{\infty}}_{=0\text{(指数衰减压倒多项式)}} + \int_{-\infty}^{\infty}e^{-x^2/2}dx = \sqrt{2\pi}\ \text{(定理 25.1)}.\) 故 \(\operatorname{Var}(Z) = \frac{1}{\sqrt{2\pi}}\cdot\sqrt{2\pi} = 1.\)

第 3 步(一般情形,期望)。由定理 25.2,$Z = (X-\mu)/\sigma\sim\mathcal{N}(0,1)$,故 $\mathbb{E}[Z]=0$。由期望线性性(讲次 20、讲次 24 定理 24.5), \(0 = \mathbb{E}\left[\frac{X-\mu}{\sigma}\right] = \frac{\mathbb{E}[X]-\mu}{\sigma} \implies \mathbb{E}[X] = \mu.\)

第 4 步(一般情形,方差)。由 $\operatorname{Var}(Z)=1$ 与 $\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X)$, \(1 = \operatorname{Var}\left(\frac{X-\mu}{\sigma}\right) = \frac{\operatorname{Var}(X)}{\sigma^2} \implies \operatorname{Var}(X) = \sigma^2.\)

第 5 步(参数命名的闭环)。这解释了记号 $\mathcal{N}(\mu,\sigma^2)$ 里两个参数正是均值与方差;也解释了为什么 $\sigma$ 控制”宽度”:由切比雪夫不等式(讲次 23),constant fraction 的质量落在 $\mu\pm 2\sigma$ 内(实际 $95.45\%$,远好于切比雪夫给的 $\ge 75\%$)。

【证明机制解说】:两个”省力技巧”值得记住:

  • 奇偶性:$\mathcal{N}(0,1)$ 的密度是偶函数,故 $x\cdot f(x)$ 是奇函数,对称区间积分为 $0$。对称分布的中心就是它的均值——证明只需一行。
  • 升降阶归约:把 $\int x^2 e^{-x^2/2}dx$ 分部积分后恰好变回高斯积分 $\int e^{-x^2/2}dx$,而后者已在定理 25.1 算出。这与讲次 24 中”把 $\int x^2\lambda e^{-\lambda x}dx$ 归约到 $\mathbb{E}[X]$”是同一招。看到”多项式 × 指数”的积分,先想分部积分降阶。

反例(对称不等于正态):$\mathcal{N}(0,1)$ 的对称性只用来算均值,不能反过来说”对称的分布就是正态”。例如 $X = 2B-1$,其中 $B\sim\mathrm{Bernoulli}(1/2)$,则 $X$ 在 $\{-1,+1\}$ 上对称、$\mathbb{E}[X]=0$,但它显然是离散的两点分布,与正态毫无关系。另一个反例:密度 $f(x) = \frac{1}{2}e^{-\vert x\vert }$(Laplace 分布)关于 $0$ 对称且连续,均值也是 $0$、方差是 $2$,但它在 $0$ 处是尖峰(不可导),概率质量比正态更集中在中心、尾部更重(指数尾而非高斯尾)。所以要做正态的假设,必须检验尾部的薄厚,光看对称是不够的。

定理 25.4(独立正态之和仍是正态,标准情形的旋转对称证明):设 $X,Y$ i.i.d. $\mathcal{N}(0,1)$,$a,b\in\mathbb{R}$。则 $Z = aX+bY\sim\mathcal{N}(0,a^2+b^2)$。

证明策略利用联合密度的旋转对称性 (rotational symmetry)。选择这个策略的理由:定理 25.1 用的极坐标技巧告诉我们 $\mathcal{N}(0,1)$ 的二变量联合密度只依赖半径,因此对平面上的旋转不变。而 $aX+bY$ 的分布通过”半平面被旋转成竖直半平面”就直接读出来——完全不需要算卷积积分。

逐步推导

第 1 步(写出联合密度)。$X,Y$ 独立且各自 $\mathcal{N}(0,1)$,由定理 24.6(连续情形的独立密度分解), \(f(x,y) = f_X(x)f_Y(y) = \frac{1}{\sqrt{2\pi}}e^{-x^2/2}\cdot\frac{1}{\sqrt{2\pi}}e^{-y^2/2} = \frac{1}{2\pi}e^{-(x^2+y^2)/2}.\)

第 2 步(旋转对称性)。上式只依赖 $x^2+y^2$(即 $(x,y)$ 到原点的距离平方),因此对任何绕原点的旋转 $T$, \(f(T(x,y)) = f(x,y) \implies \Pr[(X,Y)\in A] = \Pr[(X,Y)\in T(A)] \quad \text{对任意区域 } A.\) 数值佐证:极坐标下的总质量 $2\pi\int_0^\infty re^{-r^2/2}dr = 2\pi\cdot1 = 6.2831853072$ ✓(脚本验算),与 $2\pi$ 一致。

第 3 步(把事件写成半平面)。对任意 $t\in\mathbb{R}$, \(\Pr[Z \le t] = \Pr[aX+bY \le t] = \Pr[(X,Y)\in A], \qquad A := \{(x,y): ax+by \le t\}.\) $A$ 是半平面,其边界直线 $ax+by = t$ 到原点的距离是 \(d = \frac{\vert t\vert }{\sqrt{a^2+b^2}}.\)

第 4 步(把半平面旋转成”竖直”的)。平面上的旋转可以把任何过原点的直线转到竖直方向,因此把 $A$ 旋转成 \(T(A) = \left\{(x,y): x \le \frac{t}{\sqrt{a^2+b^2}}\right\}.\) ——这个新区域是”直线 $x = t/\sqrt{a^2+b^2}$ 左侧”的半平面,且到原点的距离完全相同(都是 $d$,这正是旋转保持距离的体现)。

第 5 步(用旋转不变性读出分布)。由第 2 步, \(\Pr[Z\le t] = \Pr[(X,Y)\in A] = \Pr[(X,Y)\in T(A)] = \Pr\left[X \le \frac{t}{\sqrt{a^2+b^2}}\right] = \Pr\left[\sqrt{a^2+b^2}\,X \le t\right].\)

第 6 步(结论)。上式对一切 $t\in\mathbb{R}$ 成立,故 $Z$ 与 $\sqrt{a^2+b^2}\,X$ 同分布。而由定理 25.2 的缩放性质,$\sqrt{a^2+b^2}\,X \sim \mathcal{N}(0,a^2+b^2)$。故 \(Z = aX+bY \sim \mathcal{N}(0, a^2+b^2).\)

【证明机制解说】:这个证明的”灵光一现”是把”线性组合”转化为”距离”。关键是意识到:$aX+bY \le t$ 描述的是”点 $(X,Y)$ 落在某条直线的一侧”,而这条直线的位置完全由它到原点的距离决定;由于联合密度只关心”点离原点多远”,旋转不改变任何概率,于是任意方向的半平面都与”竖直半平面”等价。几何直觉:二维标准正态是一团各向同性的云雾,你从任何角度看它都一模一样,所以只落在某个方向的投影分量必然是标准正态(按投影长度缩放)。

推论 25.1(一般情形的相加公式):设 $X\sim\mathcal{N}(\mu_X,\sigma_X^2)$、$Y\sim\mathcal{N}(\mu_Y,\sigma_Y^2)$ 独立,$a,b\in\mathbb{R}$。则 \(Z = aX+bY \sim \mathcal{N}\left(a\mu_X+b\mu_Y,\ a^2\sigma_X^2+b^2\sigma_Y^2\right).\)

证明:由标准化定理,$Z_1 = (X-\mu_X)/\sigma_X$ 与 $Z_2 = (Y-\mu_Y)/\sigma_Y$ 是独立的标准正态(独立性由”独立随机变量的函数仍独立”保证)。把 $X = \mu_X+\sigma_X Z_1$、$Y=\mu_Y+\sigma_Y Z_2$ 代入: \(Z = a(\mu_X+\sigma_X Z_1) + b(\mu_Y+\sigma_Y Z_2) = \underbrace{(a\mu_X+b\mu_Y)}_{\text{常数}} + \underbrace{(a\sigma_X Z_1 + b\sigma_Y Z_2)}_{=:Z^{\prime}}.\) 由定理 25.4,$Z^{\prime}\sim\mathcal{N}(0, a^2\sigma_X^2+b^2\sigma_Y^2)$。再由定理 25.2 的”加常数”性质,$Z = \mu + Z^{\prime} \sim \mathcal{N}(\mu,\sigma^2)$,其中 $\mu = a\mu_X+b\mu_Y$、$\sigma^2 = a^2\sigma_X^2+b^2\sigma_Y^2$。$\blacksquare$

特例(方差可加):取 $a=b=1$,得 \(X+Y\sim\mathcal{N}(\mu_X+\mu_Y,\ \sigma_X^2+\sigma_Y^2).\)

脚本验算:$X\sim\mathcal{N}(1,4)$、$Y\sim\mathcal{N}(-1,9)$,理论 $X+Y\sim\mathcal{N}(0,13)$、$\sigma=\sqrt{13}=3.605551$。用 Box–Muller 生成 $4\times10^5$ 对独立样本:样本均值 $-0.0079$(理论 $0$),样本方差 $13.0441$(理论 $13$)✓。

反例(去掉独立性,结论立刻失效):取 $Y = -X$,其中 $X\sim\mathcal{N}(0,1)$。则 $X+Y = 0$ 恒等于 $0$——这是退化的”分布”(全部质量在 $0$),而不是 $\mathcal{N}(0,1+1)=\mathcal{N}(0,2)$。所以”方差相加”必须要独立性(准确地说,需要不相关;而独立是充分的)。

定理 25.5(CLT 的矩生成函数证明思路):设 $X_1,X_2,\dots$ i.i.d.,$\mathbb{E}[X_i]=\mu$、$\operatorname{Var}(X_i)=\sigma^2\in(0,\infty)$。令 $Y_i = (X_i-\mu)/\sigma$(故 $\mathbb{E}[Y_i]=0$、$\operatorname{Var}(Y_i)=1$),$Z_n = \frac{1}{\sqrt n}\sum_{i=1}^n Y_i$。则对每个固定的 $t$, \(M_{Z_n}(t) = \mathbb{E}\left[e^{tZ_n}\right] \longrightarrow e^{t^2/2},\) 而 $e^{t^2/2}$ 是 $\mathcal{N}(0,1)$ 的矩生成函数。由”矩生成函数在 $0$ 的邻域内收敛 $\Rightarrow$ 依分布收敛”(Levy 连续性定理的 MGF 版本),即得 $Z_n\xrightarrow{d}\mathcal{N}(0,1)$。

证明策略把”和”变成”积”,再做 Taylor 展开取极限。选择这个策略的理由:$Z_n$ 是 $n$ 个独立项之和,其 MGF 是 $n$ 个 MGF 的乘积——一个指数级的对象被压成一个 $n$ 次方。然后唯一需要的信息只是 $M_Y$ 在 $0$ 附近的二阶展开:一次项被中心化杀掉、二次项就是方差。$n$ 次方恰好与 $1/\sqrt n$ 的缩放配合,把 $1/n$ 消掉。

逐步推导

第 1 步(中心化与标准化)。令 $Y_i = (X_i-\mu)/\sigma$。则 \(\mathbb{E}[Y_i] = \frac{\mathbb{E}[X_i]-\mu}{\sigma} = 0, \qquad \operatorname{Var}(Y_i) = \frac{\operatorname{Var}(X_i)}{\sigma^2} = 1.\) 记公共 MGF 为 $M(t) := \mathbb{E}[e^{tY_i}]$(下标相同,因为同分布)。

第 2 步(和的 MGF = MGF 的积)。因为 $Y_i$ 独立且 $Z_n = \frac{1}{\sqrt n}\sum_i Y_i$, \(M_{Z_n}(t) = \mathbb{E}\left[\exp\left(\frac{t}{\sqrt n}\sum_{i=1}^n Y_i\right)\right] = \mathbb{E}\left[\prod_{i=1}^n e^{(t/\sqrt n)Y_i}\right] \overset{\text{(i)}}{=} \prod_{i=1}^n \mathbb{E}\left[e^{(t/\sqrt n)Y_i}\right] \overset{\text{(ii)}}{=} \left[M\!\left(\frac{t}{\sqrt n}\right)\right]^n.\) 其中 (i) 用独立性(独立随机变量之积的期望等于期望之积),(ii) 用同分布。“和 → 积”这一步是整个证明的支点。

第 3 步(对数化,把 $n$ 次方变成乘法): \(\log M_{Z_n}(t) = n\log M\!\left(\frac{t}{\sqrt n}\right).\)

第 4 步($M$ 的 Taylor 展开)。把 $M(s)$ 在 $s=0$ 附近展开: \(M(s) = \mathbb{E}[e^{sY}] = \mathbb{E}\left[1 + sY + \frac{s^2Y^2}{2} + O(s^3)\right] = 1 + s\,\mathbb{E}[Y] + \frac{s^2}{2}\mathbb{E}[Y^2] + O(s^3) = 1 + \frac{s^2}{2} + O(s^3).\) 关键:一次项系数是 $\mathbb{E}[Y]=0$(中心化的功劳),二次项系数是 $\frac12\mathbb{E}[Y^2] = \frac12\operatorname{Var}(Y) = \frac12$(标准化的功劳:方差为 $1$)。

第 5 步(对 $\log$ 展开)。由 $\log(1+u) = u - u^2/2 + O(u^3)$,取 $u = s^2/2 + O(s^3)$: \(\log M(s) = \frac{s^2}{2} + O(s^3).\) 这是”二阶项的来源”:它不来自任何复杂计算,就是”方差为 $1$”这一条信息。

第 6 步(代入 $s = t/\sqrt n$ 并取极限): \(\log M_{Z_n}(t) = n\left(\frac{(t/\sqrt n)^2}{2} + O\!\left(\frac{t^3}{n^{3/2}}\right)\right) = n\cdot\frac{t^2}{2n} + O\!\left(\frac{t^3}{\sqrt n}\right) = \frac{t^2}{2} + O\!\left(\frac{t^3}{\sqrt n}\right) \longrightarrow \frac{t^2}{2}.\) 注意”$n$ 次方恰好把 $1/n$ 消掉”——这是全证明最漂亮的一步:为什么归一化因子必须是 $\sqrt n$ 而不是 $n$?因为多乘一个 $t/\sqrt n$ 会带来 $1/n$ 的平方衰减,而 $n$ 次方正好补回线性增长,留下常数 $t^2/2$。若错误地用 $n$ 归一化,$n\log M(t/n)\to 0$,得到的是退化分布;若用 $n^{1/4}$ 归一化,则对数发散。(可由脚本核对:对 $Y$ 取标准化 Bernoulli $=\pm1$,$M(s)=\cosh s$,$\log\cosh s = s^2/2 - s^4/12 + O(s^6)$。脚本验算 $t=0.1$ 时 $\log\cosh(0.1)=0.0049916888$ 与 $t^2/2 - t^4/12 = 0.0049916667$ 只差 $2.2\times10^{-8}$ ✓;$t=0.5$ 时 $\log\cosh(0.5)=0.1201145070$ 与 $t^2/2-t^4/12 = 0.1197916667$ 相差 $0.0003$ ✓。另外 $\log\cosh(t)/t^2\to 1/2$:脚本在 $t=10^{-4}$ 处得 $\log\cosh(t)/t^2 = 0.50000000$ ✓。)

第 7 步(从 MGF 收敛到依分布收敛): \(M_{Z_n}(t)\to e^{t^2/2} \implies Z_n \xrightarrow{\ d\ }\mathcal{N}(0,1).\) 这一步用的是 Levy 连续性定理:若 MGF(或特征函数)在 $t=0$ 的一个邻域内逐点收敛到某个在 $0$ 处连续的函数,则相应的分布依分布收敛到该极限 MGF 所对应的分布。而 $e^{t^2/2}$ 正是 $\mathcal{N}(0,1)$ 的 MGF(可由 $\int e^{tx}\frac{1}{\sqrt{2\pi}}e^{-x^2/2}dx = e^{t^2/2}$ 配完全平方得到)。

第 8 步(还原到 $S_n$)。$Z_n = \frac{1}{\sqrt n}\sum_i\frac{X_i-\mu}{\sigma} = \frac{S_n-n\mu}{\sigma\sqrt n}$,故定理得证。

【证明机制解说】:整个证明只有三次”化归”

  1. 中心化让一次项消失(否则会有漂移项 $n s\,\mathbb{E}[Y]$ 发散);
  2. 标准化让二次项恰好是 $1/2$(否则极限里会出现 $\sigma^2 t^2/2$,得到 $\mathcal{N}(0,\sigma^2)$,尺度失控);
  3. $\sqrt n$ 归一化让 $n$ 次方与 $1/n$ 严丝合缝地抵消。 这三步合起来解释了 CLT 为什么必须长成定理陈述里的那个样子。注意证明中从未用到原始分布的具体形状——只用到了 $\mathbb{E}[Y]=0$ 与 $\mathbb{E}[Y^2]=1$ 两个数。这就是”所有痕迹都被洗掉”的数学根源。什么会破坏它? 只要 $\mathbb{E}[Y^2]=\infty$(方差无穷,如 Cauchy 分布),第 4 步的 Taylor 展开就无从谈起,$M(s)$ 在 $0$ 处甚至不可导/不存在(Cauchy 的 MGF 对所有 $t\ne0$ 都发散),整个机制崩掉。这正是下一节反例的机理。

反例(Cauchy 分布:CLT 彻底失效):设 $X_1,X_2,\dots$ i.i.d. 服从标准柯西分布 (standard Cauchy),密度 \(f(x) = \frac{1}{\pi(1+x^2)}, \qquad x\in\mathbb{R}.\) 这个密度很漂亮(钟形!关于 $0$ 对称!),但它的尾太厚:$\Pr[\vert X\vert >t] \approx \frac{2}{\pi t}$,衰减只有 $1/t$(正态是 $e^{-t^2/2}$)。因此 \(\int_{-\infty}^{\infty}\vert x\vert f(x)dx = \frac{2}{\pi}\int_0^{\infty}\frac{x}{1+x^2}dx = \infty \quad\text{(对数发散)},\) 所以 $\mathbb{E}[\vert X\vert ]=\infty$,均值与方差都不存在,CLT 的前提被直接违反。

更惊人的是:样本均值 $\bar X_n$ 永远服从标准 Cauchy,与 $n$ 无关(可由特征函数 $\varphi(t)=e^{-\vert t\vert }$ 验证:$\varphi_{\bar X_n}(t) = \varphi(t/n)^n = e^{-n\vert t\vert /n} = e^{-\vert t\vert }$)。所以 $\bar X_n$ 的分布根本不向任何东西集中,更别说正态。

脚本验算($2\times10^5$ 次实验,统计 $\Pr[\vert \bar X_n\vert \le1]$):

$n$实测 $\Pr[\vert \bar X_n\vert \le1]$Cauchy 理论值若 CLT 成立应为 $\Pr[\vert Z\vert \le1]=0.6827$
$1$$0.4999$$0.5$$0.6827$
$10$$0.4997$$0.5$$0.6827$
$100$$0.5000$$0.5$$0.6827$
$1000$$0.4986$$0.5$$0.6827$

$n$ 从 $1$ 增到 $1000$(增了 $1000$ 倍),答案纹丝不动 $=0.5$。 这就是”重尾分布下 CLT 失效”的直观:偶尔出现一个巨大到荒谬的样本($\vert X\vert >10^6$ 的概率仍有 $6\times10^{-7}$),它一旦出现就把前面 $n-1$ 个样本的平均值全部推翻——均值的波动不会因为 $n$ 增大而变小,因为最大样本的量级与 $n$ 同阶增长。

反例(强相关:CLT 也需要”独立”):设 $X_i = X$ 对所有 $i$(完全相关,每个都是同一个随机变量),则 $\bar X_n = X$ 恒成立,分布完全不随 $n$ 变化,绝不会趋于一个尖峰(更不会正态)。若 $X$ 不是正态,CLT 的结论就是错的。这说明”独立同分布”里的”独立”不可省。(弱相关情形的推广如 $m$-依赖序列、混合条件可以在附加假设下恢复 CLT,但要有额外条件。)

与经典问题的联系

(1)用正态近似算二项概率。 二项分布 $B(n,p)$ 是 $n$ 个独立 $\mathrm{Bernoulli}(p)$ 之和,$\mu=np$、$\sigma^2=np(1-p)$。由 CLT, \(B(n,p) \approx \mathcal{N}\big(np,\ np(1-p)\big),\) 配上连续性修正(见前文公式)精度极高。脚本验算($n=1000,p=0.5$,$\mu=500$,$\sigma=\sqrt{250}=15.811388$,用对数组合数精确计算)

目标量精确值CLT + 连续性修正CLT 无修正
$\Pr[X\le520]$$0.90261684$$\Phi(20.5/\sigma)=0.90260414$(误差 $1.3\times10^{-5}$)$0.89704835$
$\Pr[490\le X\le510]$$0.49333996$$0.49336006$

经验判据:$np \ge 10$ 且 $n(1-p)\ge 10$ 时近似通常够用(这条判据的实质是”均值至少离边界 $3$ 个标准差左右”,让正态尾部不至于伸到 $0$ 或 $n$ 以外)。脚本用”与正态的 $L_1$ 距离”量化了这条判据:

$n$$p$$np$$L_1$ 距离最大点偏差
$1$$0.5$$0.5$$0.03212$$0.01606$
$2$$0.5$$1$$0.14908$$0.06419$
$5$$0.5$$2.5$$0.04701$$0.01118$
$10$$0.5$$5$$0.02381$$0.00622$
$30$$0.5$$15$$0.00770$$0.00121$
$100$$0.5$$50$$0.00235$$0.00020$
$10$$0.1$$1$$0.20980$$0.10740$
$50$$0.1$$5$$0.09419$$0.01798$
$200$$0.1$$20$$0.04787$$0.00422$

两个独立信息:(i) $n$ 增大,$L_1$ 距离单调下降;(ii) 在相同的 $n$ 下,$p$ 靠近 $0.5$ 时近似好得多($n=10$:$p=0.5$ 时 $L_1=0.0238$,$p=0.1$ 时 $L_1=0.2098$,差近 $9$ 倍)。原因是 $p=0.1$ 时分布高度偏斜(右尾长、左边被 $0$ 顶住),需要更大的 $n$ 才能”洗掉”偏斜。

(2)置信区间与民意调查的样本量设计。 这是 CLT 在工程与社会统计中最广泛的应用。问题背景:估计某候选人支持率 $p$。数学建模:抽 $n$ 人,$X_i \sim \mathrm{Bernoulli}(p)$,$\bar X = \hat p$,$\sigma^2 = p(1-p)$。方案设计:由 CLT,$\hat p \approx \mathcal{N}(p, p(1-p)/n)$,故 $95\%$ 置信区间 $\hat p \pm 1.96\sqrt{p(1-p)/n}$。最重要的一步是用 $p(1-p)\le1/4$ 做最坏情况界定(因为 $p(1-p)$ 在 $p=1/2$ 处取最大值 $1/4$),于是半宽 $\le 1.96\cdot\frac{1}{2\sqrt n} = \frac{0.98}{\sqrt n}$。

脚本验算的样本量表($95\%$ 半宽,单位:百分点):

$p$$n=100$$n=1000$$n=10000$
$0.5$$9.800$$3.099$$0.980$
$0.1$$5.879$$1.859$$0.588$

实践中的经典经验:“$n=1000$ 给出 $\pm3\%$ 的误差”——正是 $0.98/\sqrt{1000} = 3.10$ 个百分点。而要把误差压到 $\pm1\%$,需要 $n = (0.98/0.01)^2 \approx 9604 \approx 10^4$,即样本量要增加到原来的 $10$ 倍(精度提高 $3$ 倍,样本量提高 $9$ 倍,又是开根号定律)。注意这个半宽与总体大小几乎无关(因子是 $\sqrt{(N-n)/(N-1)}$,当 $N\gg n$ 时接近 $1$)——这是”全国抽 $1500$ 人就能估全国支持率”的原因。

下面这张 ASCII 图把”$n$ 增大时 $B(n,0.5)$ 逐步变成钟形”画在一起。脚本把每个柱子画成高度正比于 $\Pr[X=k]$(归一化到同一尺度),并把 $n=30$ 的正态近似曲线叠在下面作对照:

  PMF
 0.50 |#
      |#
 0.40 |#                       n=1  : 两个等高的柱子
      |#                       max|exact-normal| = 0.01606
 0.00 +--+------------------> k=0,1
        0  1

  PMF
 0.50 |   #                    n=2  : 三角形(三个柱子)
 0.25 |#     #                 max|exact-normal| = 0.06419  <- 最不像!
 0.00 +--+--+--> k=0,1,2
        0  1  2

  PMF
 0.32 |   #                    n=5  : 已经是圆顶,但仍不够宽
 0.16 | #     #                 max|exact-normal| = 0.01118
 0.00 +-+--+--+--+--+->
        0  1  2  3  4  5

  PMF
 0.25 |    ###                  n=10 : 很像钟了
 0.12 |  #     #                max|exact-normal| = 0.00622
 0.00 +-+--+--+--+--+--+--+-> k
        0  1  2 ... 8  9 10

  PMF
 0.15 |      #####              n=30 : 与正态几乎不可分辨
      |    ##     ##            max|exact-normal| = 0.00121
 0.00 +--+--+--+--+--+--+--+--> k
        .. 10 15 20 25 30
             ^mu=15, sd=2.7386

  正态参照曲线 (n=30, mu=15, sd=2.7386):
     f(15) = 1/(sd*sqrt(2pi)) = 0.14567
     68% 区间 [12.26, 17.74]   95% 区间 [9.52, 20.48]

  关键读数:
    L1 距离  n=1: 0.03212  n=2: 0.14908  n=5: 0.04701
             n=10: 0.02381 n=30: 0.00770 n=100: 0.00235
    注意 n=2 比 n=1 更"不像"正态 —— 收敛不是单调的,
    但 n>=5 之后 L1 距离稳定下降。
    同样 n=10 但 p=0.1 时 L1 = 0.20980(比 p=0.5 差近 9 倍):
    "偏离 0.5 越远,需要的 n 越大" —— 偏斜是近似的大敌。

(3)算法与负载均衡:最大负载的分析。 把 $n$ 个球随机投入 $m$ 个箱子(如哈希表、分布式分片),某个固定箱子里的球数 $\sim B(n,1/m)$,均值 $\mu=n/m$、方差 $\approx n/m$。由 CLT,该箱负载 $\approx \mathcal{N}(n/m, n/m)$,于是最大负载约为 $\mu + \Theta(\sqrt{\mu\log m})$($\log m$ 因子来自对 $m$ 个箱子做 union bound,讲次 18)。脚本对”$\mu + 3\sigma$”的粗略上界:

$n$$m$$\mu$$\sigma$$\mu+3\sigma$相对 $\mu$ 的倍数
$10^4$$100$$100$$9.9499$$129.85$$1.299$
$10^4$$1000$$10$$3.1607$$19.48$$1.948$
$10^6$$1000$$1000$$31.607$$1094.8$$1.095$

结论:负载越重($\mu$ 越大),相对偏差 $3\sigma/\mu = 3/\sqrt\mu$ 越小($1.095$ vs $1.948$)。这就是“大表比小表更均衡”的定量版本;也解释了为什么要用”两选择哈希 (power of two choices)”:让每个球在两个随机箱子中选负载小的那个,可以把最大负载从 $\Theta(\log n/\log\log n)$ 降到 $\Theta(\log\log n)$。

(4)估计 $\pi$、蒙特卡洛积分的误差界。 讲次 24 的 Buffon 投针用切比雪夫定投掷次数,得到极保守的界;用 CLT 则可以得到 $\hat p \approx \mathcal{N}(p, p(1-p)/n)$,从而给出”误差以 $95\%$ 把握不超过 $1.96\sqrt{p(1-p)/n}$“这类实用的误差棒。所有蒙特卡洛方法的误差分析都走这一条路。

(5)测量误差与$\chi^2$/$t$ 检验的前置知识。 物理实验的”观测误差”被建模为”大量独立微小误差之和”,故正态;这就是最小二乘法 (least squares) 与线性回归的理论依据(讲次 20 讨论过 LLSE,其最优性依赖正态假设下的条件期望等于线性函数——见讲次 20”MMSE for Jointly Gaussian”)。

与其他讲次的关联

  • 讲次 23(集中不等式 Concentration Inequalities):那里的大数定律 (LLN) 说 $\bar X_n \to \mu$,本讲的 CLT 是它的”精细化升级”——LLN 给”收敛”,CLT 给”收敛的速率与形状”。切比雪夫不等式(讲次 23)在 $\sigma^2/n$ 已知时给 $\Pr[\vert \bar X-\mu\vert \ge\epsilon]\le\sigma^2/(n\epsilon^2)$(多项式衰减、极保守);CLT 给的是高斯尾 $2\Phi(-\epsilon\sqrt n/\sigma)$(指数衰减、精确)。对比这两个界,就能看出 CLT 的威力。同时,CLT 的 MGF 证明直接使用了讲次 19 就引入的期望与独立性。
  • 讲次 20(期望与线性性 Expectations & Linearity):CLT 中”$\mathbb{E}[\bar X_n]=\mu$、$\operatorname{Var}(\bar X_n)=\sigma^2/n$”这两个矩计算完全来自讲次 20 与讲次 22(期望线性性 + 方差可加需要独立);而定理 25.3 的证明直接调用期望线性性把 $X=\mu+\sigma Z$ 的均值搬过来。
  • 讲次 19(随机变量与离散分布 Random Variables & Discrete Distributions):二项分布 $B(n,p)$ 定义为 $n$ 个独立伯努利之和,这正是 CLT 最常见的应用对象;本讲的连续性修正就是”把二项这个离散分布摊成连续的正态”。另外,讲次 19 的几何分布、讲次 24 的指数分布是”重尾/轻尾”对照实验中不可或缺的样本。
  • 讲次 21(联合分布与独立性 Joint Distributions & Independence of RVs):定理 25.4(独立正态之和)的证明第一步就用”独立 $\iff$ 联合密度 = 边缘密度之积”,而这个对应关系是从讲次 21 的离散版本通过讲次 24 定理 24.6 搬到连续情形的。旋转对称性论证则完全是联合密度这一工具的直接应用。
  • 讲次 22(方差与协方差 Variance & Covariance):$\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{cov}(X,Y)$,在独立(或至少不相关)时协方差项消失——这是推论 25.1 中”$\sigma^2=a^2\sigma_X^2+b^2\sigma_Y^2$”的来源,也是”$\sigma^2/n$”这个均值的方差的来源。
  • 讲次 24(连续概率与分布 Continuous Probability & Distributions):本讲完全建立在讲次 24 的语言之上——PDF 的定义与归一化条件(定理 25.1 就是在验证它)、CDF 与变量替换技巧(定理 25.2)、期望方差的积分定义(定理 25.3)、联合密度与独立性分解(定理 25.4)。此外”指数分布是几何分布的连续极限”这一对应关系,与本讲”二项分布在 CLT 下趋近正态”是同一类”离散 → 连续”的极限思想。
  • 讲次 18(独立性与事件组合 Independence & Combination of Events):负载均衡应用的”对 $m$ 个箱子做 union bound”直接来自讲次 18 的并集上界;而 CLT 给出的单箱尾概率与之相乘,是”集中不等式 + union bound”的标准组合拳。
  • 讲次 26(马尔可夫链与条件期望 Markov Chains & Conditional Expectation):CLT 用于马尔可夫链会产生”马尔可夫链的中心极限定理”($\sqrt n$ 尺度上的正态波动),讲次 26 只讲时间比例 $\frac1n\sum_m \mathbf{1}\{X_m=i\}$ 的收敛(LLN 版本),而本讲的工具是那个结论的下一层精细化。同时讲次 26 的条件期望是”CLT 应用中证明某些量不相关”的常用手段。
  • 讲次 14(计数 Counting):二项系数 $\binom nk$ 的精确计算(用于脚本验算中的精确值)是本讲所有”精确 vs 近似”对照表的基准,而 $\log\binom nk$ 的 Stirling 近似也与正态近似的指数部分直接对应。

关键要点

  1. 正态分布的两个参数就是均值与方差:$X\sim\mathcal{N}(\mu,\sigma^2)$ 时 $\mathbb{E}[X]=\mu$、$\operatorname{Var}(X)=\sigma^2$;峰在 $x=\mu$、峰高 $\approx 0.4/\sigma$。
  2. 标准化是万能钥匙:$Z=(X-\mu)/\sigma\sim\mathcal{N}(0,1)$,故 $\Pr[X\le a] = \Phi\!\big(\frac{a-\mu}{\sigma}\big)$——一切正态计算都约化到 $\Phi$ 一张表。
  3. 68–95–99.7:$\Pr[\vert Z\vert \le1]=0.6827$、$\le2$ 给 $0.9545$、$\le3$ 给 $0.9973$;中央 $95\%$ 需 $1.96$ 个标准差。
  4. CLT 的公式与误差量级:$\dfrac{S_n-n\mu}{\sigma\sqrt n}\xrightarrow{d}\mathcal{N}(0,1)$,等价地 $\bar X_n \approx \mathcal{N}(\mu, \sigma^2/n)$。波动量级 $\sigma/\sqrt n$,精度翻倍需样本量翻四倍。
  5. CLT 与大数定律的分工:LLN 说”均值收敛(位置)”,CLT 说”波动的尺度与形状($\sigma/\sqrt n$ 与正态)”。CLT 更强,能推出 LLN。
  6. CLT 证明的机制三件套:中心化(杀一次项)+ 标准化(二次项 $=1/2$)+ $\sqrt n$ 归一化(让 $n$ 次方与 $1/n$ 抵消),极限 MGF 为 $e^{t^2/2}$。全程只用 $\mathbb{E}[Y]=0$ 与 $\mathbb{E}[Y^2]=1$,不用原始分布的形状——这正是”痕迹被洗掉”的原因。
  7. 用 CLT 必须加连续性修正:$\Pr[X\le k]\approx\Phi(\frac{k+0.5-np}{\sqrt{np(1-p)}})$。$n=30,p=0.5$ 时无修正的 $\Pr[X\le15]$ 给 $0.500$,而有修正给 $0.572$,精确值 $0.572$。
  8. CLT 的四个前提/边界:(i) 有限方差(Cauchy 反例);(ii) 独立(或弱相关);(iii) $n$ 够大(偏斜分布要更大,经验判据 $np\ge10$ 且 $n(1-p)\ge10$);(iv) 它说的是均值的分布趋近正态,不是数据本身

常见误区与注意事项

  1. 把”数据的分布”当成正态。 CLT 说的是”样本均值的分布“趋近正态,绝不是”原始数据趋近正态”。一枚骰子的结果永远是六个点上的均匀分布($n$ 再大也不会变成钟形);变成钟形的是”$n$ 枚骰子的平均”。骰子之和的例子很清楚:$n=1$ 时最大偏差 $0.087$(仍是很平的),$n=30$ 时才 $0.00023$。同理,”身高近似正态”和”掷骰子难以近似正态”两种说法并不矛盾——前者本身就是许多微小扰动之和。
  2. 用 CLT 而忘记连续性修正。 $\Pr[X\le15]$ 在 $n=30,p=0.5$ 时无修正给 $0.5$、真实值 $0.572$,误差 $7$ 个百分点。规则很简单:离散量 $k$ 一律换成 $k\pm0.5$。
  3. 置信区间解释成”$\mu$ 有 $95\%$ 概率在区间内”。 正确的说法是关于程序的:重复实验无数次,约 $95\%$ 的区间会盖住固定的 $\mu$。$\mu$ 是常数不是随机变量,谈它本身的概率没有意义。
  4. 置信区间半宽用错标准差。 半宽是 $1.96\sigma/\sqrt n$(均值的波动),而”含 $95\%$ 数据”的区间是 $\bar X\pm1.96\sigma$(单次观测的波动),后者宽 $\sqrt n$ 倍。$n=100$ 时两者差 $10$ 倍,误用会严重低估不确定性。记忆锚点:涉及”均值”就除 $\sqrt n$,涉及”单个数据”就不除。
  5. 以为 $n$ 增大误差线性减小。 误差是 $\sigma/\sqrt n$,是开根号的:$n$ 增 $100$ 倍,误差只减 $10$ 倍(脚本:骰子 $n=100\to10000$,半宽 $0.3347\to0.0335$)。设计实验预算时最常见的低估就发生在这里。
  6. 忽略”有限方差”这个前提。 Cauchy 分布密度也是钟形、也对称、也以 $0$ 为中心,看起来”应该”满足 CLT,但 $\mathbb{E}[\vert X\vert ]=\infty$,样本均值永远是 Cauchy 本身(脚本实测 $\Pr[\vert \bar X_n\vert \le1]$ 在 $n=1$ 到 $1000$ 之间恒为 $0.5$,完全不动)。“看起来像钟形”和”服从正态/满足 CLT”是两回事:判据是尾部的厚度,不是形状的好看程度。
  7. 把”独立”当成可有可无的技术条件。 完全相关时($X_i\equiv X$)$\bar X_n = X$,分布根本不随 $n$ 变化。要求”独立同分布”里的独立不是保守,而是必要的。现实数据(时间序列、聚类抽样)往往有相关性,此时 CLT 需要额外条件才能救回来。
  8. 在高度偏斜、$n$ 又小时硬套 CLT。 脚本的 $L_1$ 表显示:$n=10,p=0.1$($np=1$)时 $L_1 = 0.2098$,最大点偏差 $0.1074$——近似极差;而 $n=200,p=0.1$($np=20$)时降到 $0.0479$。偏斜分布的”有效 $n$”要按 $np$ 与 $n(1-p)$ 中较小的那个来估,而不是按 $n$ 本身。
  9. 把 $1.96$ 与 $2$ 混用而不看精度需求。 $\pm2\sigma$ 给 $95.45\%$,$1.96\sigma$ 给 $95.00\%$,$2.576\sigma$ 给 $99\%$。在 $n$ 很大时这 $0.45$ 个百分点的差异会显著影响样本量预算($(1.96/2)^2 = 0.96$,即 $4\%$ 的样本量差异)。

思考题(带答案)

Q1.(纯计算) 设 $X$ 服从二项分布 $B(n=100, p=0.4)$。(a) 写出用 CLT 近似的均值和标准差。(b) 用 CLT + 连续性修正估计 $\Pr[X\le45]$、$\Pr[X=40]$、$\Pr[35\le X\le45]$。(c) 与脚本算出的精确值 $0.868910$、$0.081219$、$0.738573$ 比较误差。(d) 若要求 $\Pr[X\le45]$ 的估计误差不超过 $0.005$,$n$ 是否已足够?

答案 (a) $X$ 是 $100$ 个独立 $\\mathrm{Bernoulli}(0.4)$ 之和,$\\mu = np = 40$,$\\sigma^2 = np(1-p) = 100\\times0.4\\times0.6 = 24$,$\\sigma = \\sqrt{24} = 4.898979$。 (b) 用 $\\Phi$(脚本用 Abramowitz–Stegun 近似,精度 $\\sim10^{-7}$): - $\\Pr[X\\le45]$:连续性修正把 $45$ 换成 $45.5$, $$\Pr[X\le45]\approx\Phi\left(\frac{45.5-40}{4.898979}\right) = \Phi(1.122676) = 0.869214.$$ - $\\Pr[X=40]$:把单点摊成 $[39.5, 40.5]$, $$\Pr[X=40]\approx\Phi\left(\frac{40.5-40}{4.898979}\right)-\Phi\left(\frac{39.5-40}{4.898979}\right) = \Phi(0.102062)-\Phi(-0.102062) = 0.081293.$$ - $\\Pr[35\\le X\\le45]$: $$\approx\Phi\left(\frac{45.5-40}{4.898979}\right)-\Phi\left(\frac{34.5-40}{4.898979}\right) = \Phi(1.122676)-\Phi(-1.122676) = 0.738428.$$ (c) **误差表**: | 目标量 | 精确值(脚本) | CLT+修正 | 绝对误差 | |:---|:---|:---|:---| | $\\Pr[X\\le45]$ | $0.868910$ | $0.869214$ | $0.00030$ | | $\\Pr[X=40]$ | $0.081219$ | $0.081293$ | $0.00007$ | | $\\Pr[35\\le X\\le45]$ | $0.738573$ | $0.738428$ | $0.00015$ | **三个误差都在 $10^{-4}$ 量级**,说明 $np=40$、$n(1-p)=60$ 都远大于 $10$,CLT 在这个参数下极好用。作为对照,若无连续性修正:$\\Pr[35\\le X\\le45]\\approx\\Phi(5/4.899)-\\Phi(-5/4.899) = 0.692566$,误差 $0.046$,**把修正加上就把误差降了 $300$ 倍**。 (d) 误差 $0.0003 \\ll 0.005$,**已经足够**。若想更保守:误差 $\\sim 1/(\\sigma\\sqrt{2\\pi})$ 量级的"点质量"误差,或直接看 §(1)的 $L_1$ 表——$np\\ge10$ 且 $n(1-p)\\ge10$ 是经验充分条件,本例两个数分别是 $40$ 与 $60$,远超门槛。

Q2.(概念/证明) 设 $X_1,\dots,X_n$ i.i.d. 且 $\mathbb{E}[X_i]=\mu$、$\operatorname{Var}(X_i)=\sigma^2\in(0,\infty)$。用 CLT 证明弱大数定律:对任意 $\epsilon>0$,$\Pr[\vert \bar X_n-\mu\vert >\epsilon]\to0$。

答案 **证明策略**:从 CLT 的标准化量出发,把大偏差事件 $\\{\\vert \\bar X_n-\\mu\\vert >\\epsilon\\}$ 等价地写成 $\\{\\vert Z_n\\vert > \\epsilon\\sqrt n/\\sigma\\}$,再用标准正态的尾概率随阈值增大而趋于 $0$。也就是说,**用"分布收敛 + 极限分布无原子"推出"概率收敛"**。 **逐步推导**: 第 1 步(标准化)。由 CLT, $$Z_n := \frac{\bar X_n-\mu}{\sigma/\sqrt n} = \frac{S_n-n\mu}{\sigma\sqrt n} \xrightarrow{\ d\ }\mathcal{N}(0,1).$$ 第 2 步(事件等价改写)。$\\sigma>0$、$\\sqrt n>0$,故 $$\vert \bar X_n-\mu\vert > \epsilon \iff \left\vert \frac{\bar X_n-\mu}{\sigma/\sqrt n}\right\vert > \frac{\epsilon\sqrt n}{\sigma} \iff \vert Z_n\vert > c_n, \qquad c_n := \frac{\epsilon\sqrt n}{\sigma}.$$ **注意 $c_n\\to\\infty$**(因为 $\\sqrt n$ 增长)。 第 3 步(用极限分布的 CDF 表示)。因 $\\mathcal{N}(0,1)$ 的 CDF $\\Phi$ 在 $\\pm c_n$ 处连续,依分布收敛给出 $$\Pr[\vert Z_n\vert \le c_n] = \Pr[Z_n\le c_n] - \Pr[Z_n< -c_n] \longrightarrow \Phi(c_n) - \Phi(-c_n).$$ (更严谨地说:对每个固定 $c$,$\\Pr[Z_n\\le c]\\to\\Phi(c)$;这里 $c_n\\to\\infty$ 依赖 $n$,需要用 Slutsky/连续映射或用下面第 4 步的直接估计。) 第 4 步(直接估计,避免依赖 $n$ 的阈值)。取任意固定的大 $M>0$,把事件拆开: $$\Pr[\vert Z_n\vert >c_n] \le \Pr[\vert Z_n\vert > M] \quad\text{(当 } c_n \ge M\text{,即 } n\ge\sigma^2M^2/\epsilon^2\text{ 时成立)}.$$ 再由 CLT 与 $\\Phi$ 的连续性, $$\limsup_{n\to\infty}\Pr[\vert Z_n\vert >c_n] \le \lim_{n\to\infty}\Pr[\vert Z_n\vert >M] = 2(1-\Phi(M)).$$ 因为 $M$ 可以取任意大,而 $2(1-\\Phi(M))\\to0$($M\\to\\infty$),故 $$\limsup_{n\to\infty}\Pr[\vert Z_n\vert >c_n] \le 0 \implies \lim_{n\to\infty}\Pr[\vert \bar X_n-\mu\vert >\epsilon] = 0.$$ 第 5 步(说明与讲次 23 的差别)。讲次 23 用切比雪夫直接给 $\\Pr[\\vert \\bar X_n-\\mu\\vert >\\epsilon]\\le\\frac{\\sigma^2}{n\\epsilon^2}$(对一切 $n$ 成立,不需 CLT,但界很松);本证明给出的是"**极限为 $0$ 且误差以高斯尾速度衰减**"。例如 $\\epsilon\\sqrt n/\\sigma = 3$ 时,CLT 给 $\\approx0.0027$,而切比雪夫给 $\\le 1/9=0.111$,相差 $40$ 倍。 **证明机制解说**:这个证明体现了"**分布收敛 $\\Rightarrow$ 概率收敛到常数**"这一常用套路。核心观察是:$\\mathcal{N}(0,1)$ 的质量全部集中在有限区间内,所以当阈值 $c_n\\to\\infty$ 时,$\\vert Z_n\\vert >c_n$ 的概率必然趋于 $0$。**注意 $\\sqrt n$ 在这里起了决定性作用**:如果误差量级不是 $\\sigma/\\sqrt n$ 而是常数,$c_n$ 就不会趋于无穷,结论立刻消失。**这也再次说明 CLT 严格强于 LLN**。

Q3.(概念/反例) 下面的 ASCII 图给出标准正态密度并标注了 $68$–$95$–$99.7$ 分区,以及三条对照曲线。请回答:(a) 从图中读出 $\Pr[Z>2]$ 约为多少?(b) 为什么 $\mathcal{N}(0,1)$ 在 $\vert x\vert >5$ 处的密度已经小到 $1.5\times10^{-7}$ 却仍不能直说”$\vert Z\vert >5$ 不可能”?(c) 若某数据集报告”均值 $100$、标准差 $10$、有一个观测值 $160$”,用图中信息判断这个值有多异常。

      f(x)
 0.40 |            *****
      |          *       *
 0.35 |         *         *
      |        *           *
 0.30 |       *             *
      |      *               *
 0.25 |     *                 *
      |    *                   *
 0.20 |   *                     *
      |  *                       *
 0.15 | *                         *
      |*                           *
 0.10 |                             *
      |                              *
 0.05 |                                *     *
      |                                   *     *    *
 0.00 +--+------+------+------+------+------+------+-----> x
     -4     -3     -2     -1     0      1      2      3      4
           |      |      |      |      |      |      |      |
           |<----------- 99.7% ----------->|              (mu +- 3 sigma)
                  |<------- 95% ------>|                  (mu +- 2 sigma)
                       |<-- 68% -->|                      (mu +- 1 sigma)

  峰高 = 1/sqrt(2*pi) = 0.398942  在 x=0
  1 sigma 半宽处 f(1) = 0.241971
  2 sigma 半宽处 f(2) = 0.053991
  3 sigma 半宽处 f(3) = 0.004432
  5 sigma 半宽处 f(5) = 1.4867e-6   (已经很小,但 P[|Z|>5]=5.7e-7 仍非 0)
  拐点(inflection) 恰在 x = +-1(二阶导为零处)

  对照:Laplace(0,1) 密度 0.5*e^{-|x|}(更尖、尾更重,方差 2)
        U[-sqrt(3),sqrt(3)](同方差 1, 平顶, 有紧支撑)
答案 (a) $\\Pr[Z>2] = 1-\\Phi(2) = 1-0.977250 = 0.022750$(脚本验算)。即**约 $2.3\\%$**,双侧 $\\Pr[\\vert Z\\vert >2]=0.0455$。图中 $2\\sigma$ 以外两侧共约 $4.5\\%$。 (b) 因为**"密度很小"与"概率为零"是两件事**,而且"不可能"在连续世界只能由"事件是空集"或"落在密度支撑之外"来保证。 - $\\Pr[\\vert Z\\vert >5] = 2(1-\\Phi(5)) = 5.73\\times10^{-7}$(即约**一百七十五万分之一**)。它**不是 $0$**:正态密度的支撑是整个 $\\mathbb{R}$,任何实数都有正密度。 - 由讲次 24 的教训:连续分布中**单个点**的概率才是 $0$。$\\{\\vert Z\\vert >5\\}$ 是**区间**(不可数多个点),概率由积分 $\\int_{\\vert x\\vert >5}f$ 给出,只要积分区间长度非零且密度正,概率就正。 - 所以正确的说法是"$\\vert Z\\vert >5$ 是**极小概率事件**($1$ 百万分之 $0.57$)",而不是"不可能"。类似地 $6\\sigma$ 的概率是 $2\\times10^{-9}$(约**十亿分之二**)——依然不是 $0$,这也解释了为什么"$6\\sigma$ 事件"在现实中被当作重大异常信号而不是绝对禁忌。 (c) $z = (160-100)/10 = 6$,即**偏离 $6$ 个标准差**。由图/表中 $3\\sigma$ 已含 $99.7\\%$,$6\\sigma$ 处 $\\Pr[\\vert Z\\vert >6] = 2\\times10^{-9}$。在正态假设下这是一个"约**十亿分之二**"的事件。结论(要小心措辞):**在正态模型下,遇到 $6\\sigma$ 观测的概率极小,因此更有可能是模型本身有问题**——比如 - 标准差被低估(真实 $\\sigma$ 是 $20$ 而非 $10$,则 $z=3$,$0.27\\%$,仍罕见但没那么离谱); - 分布是重尾的(如 Cauchy/厚尾分布),"$6\\sigma$"在那里一点也不罕见; - 存在数据录入错误、单位错误(可能是 $160$ 应为 $16.0$); - 或者这是一次真正值得报告的新发现。 **这正是"异常检测"与"$p$ 值"的逻辑**:不是"$6\\sigma$ 不可能",而是"在既定模型下它太不可能,所以我们优先怀疑模型"。

Q4.(概念/多反例) 判断真假并说明:(a) “若 $X,Y$ 都服从正态分布,则 $X+Y$ 服从正态分布。” (b) “若 $X$ 的密度关于 $0$ 对称且 $\mathbb{E}[X]=0$,则 $X$ 近似正态。” (c) “CLT 成立时,$\bar X_n$ 的分布与 $X$ 的分布形状无关,只通过 $\mu,\sigma^2$ 影响 $\bar X_n$。”

答案 (a) **假(缺少独立性)。** 反例:取 $X\\sim\\mathcal{N}(0,1)$、$Y = -X$。则 $Y$ 也是 $\\mathcal{N}(0,1)$(正态关于 $0$ 对称,$-$ 幂等),但 $X+Y = 0$ 是退化分布(全部质量在 $0$),不是任何非退化正态。**正确定理(推论 25.1)要求 $X,Y$ 独立**(更弱地说,需要联合正态或至少不相关)。这是本讲最容易被漏掉的条件。 (b) **假。** 对称 + 均值为 $0$ 远不足以刻画正态。三个反例: - $X = 2B-1$,$B\\sim\\mathrm{Bernoulli}(1/2)$:离散两点分布,对称、均值 $0$,与正态毫无关系。 - **Laplace 分布** $f(x)=\\frac12e^{-\\vert x\\vert }$:连续、对称、均值 $0$、方差 $2$,但**在 $x=0$ 不可导(尖峰)**,尾部是指数衰减(比高斯尾重得多)。图注里已画出这条对照曲线。 - **Kurtosis 证据**:正态的四阶累积量 $\\kappa_4 = 0$,而 Laplace 的 $\\kappa_4 = 3$。**"对称"只约束奇阶矩,"像不像正态"要靠尾部的薄厚(四阶矩)。** 更极端的:Cauchy 分布同样对称、均值不存在,尾部厚到没有矩。 (c) **真(这正是 CLT 的要点),但要精确表述。** 标准化后的 $\\frac{S_n-n\\mu}{\\sigma\\sqrt n}$ 的极限分布是**同一个** $\\mathcal{N}(0,1)$,与原分布形状无关。原分布的全部影响**只通过 $\\mu$ 与 $\\sigma^2$ 两个数**进入(一个定位置、一个定尺度),其余高阶矩(偏度、峰度等)只影响**收敛速度**(例如 Berry–Esseen 界正比于 $\\mathbb{E}\\vert Y\\vert ^3$),不影响极限。脚本证据:$n$ 枚骰子之和(离散、平顶)在 $n=30$ 时与正态的最大点偏差仅 $0.00023$;$n$ 个 $U[0,1]$ 之和(连续、有紧支撑)在 $n=12$ 时也已很接近(CDF 对照:模拟 $\\Pr[Z\\le-2]=0.0223$ vs 正态 $0.0228$,$\\Pr[Z\\le2]=0.9777$ vs $0.9772$)。**唯一的例外是重尾(方差无穷)——那时 CLT 本身不成立**,这恰好再次说明"有限方差"是不容删的前提。