Lecture 25: Power Series and the Weierstrass Approximation Theorem(幂级数与 Weierstrass 逼近定理)

目录 · ← l24 · appendix →

Lecture 25: Power Series and the Weierstrass Approximation Theorem(幂级数与 Weierstrass 逼近定理)

概述

这是整门课最后一讲。上一讲(Lecture 24)我们提出了三个”能否交换极限”的问题(Question 271):连续函数的极限是否连续?可导函数列的极限是否可导且导数就是导数列的极限?积分与极限能否交换?第 24 讲已经证明:若收敛是一致的,三个答案都是”是”(Theorem 274、275、277),并且预告了”若只有逐点收敛,三个答案都是’否’“。本讲第一件事就是把这三个”否”用三个反例落实(Question 273)。

做完这件事,本讲立刻把这套一致收敛的机器灌进幂级数 (power series):Lecture 23 定义的幂级数 $\sum_{j=0}^{\infty}a_j(x-x_0)^j$ 只是一个”逐点收敛”的对象,似乎享受不到一致收敛的好处;但 Theorem 278 会告诉我们一个漂亮的事实——幂级数在收敛半径内部所包含的每一个紧子区间上都是一致收敛的,于是 Lecture 24 的三条交换定理全部可以实例化到幂级数上:得到连续性、逐项求导 (term-by-term differentiation)、逐项积分 (term-by-term integration),并且求导/积分之后收敛半径不变。由此又得到一个贯穿全课的结论:$a_j=f^{(j)}(x_0)/j!$,即幂级数的系数被和函数完全决定,幂级数就是它的 Taylor 级数(呼应 Lecture 20 的 Taylor 定理),因此展开式唯一

本讲最后回答了另一个方向的问题:幂级数(也就是多项式)能表示多少函数? 答案是——全部连续函数。这就是 Weierstrass 逼近定理 (Weierstrass approximation theorem, Theorem 282):$[a,b]$ 上的任意连续函数都能被一列多项式一致逼近。源文件给出的证明路线是构造一族”近似 Dirac delta 函数”的多项式核 $Q_n(x)=c_n(1-x^2)^n$(Theorem 283)再做卷积 $P_n(x)=\int_0^1 f(t)Q_n(t-x)\,dt$;本笔记另外补充了Bernstein 多项式 (Bernstein polynomial) 的构造性证明——它把 $f$ 在等距点上的值按二项式权重做局部平均,用二项式恒等式算出前三阶矩、用方差界 $x(1-x)/n\le 1/(4n)$ 证明权重集中,是一个”把大数定律翻译成分析语言”的漂亮证明。

本讲回答了什么问题?(1)若收敛只是逐点的,三个交换极限的问题为什么全部失败?(2)幂级数在哪里一致收敛,端点为什么不行?(3)幂级数的和函数有多好(连续?可导?无穷次可导?)?(4)幂级数的系数与和函数是什么关系?(5)连续函数能不能被多项式一致逼近?——第(5)问是整门课的收束:我们从 Lecture 1 的集合与 LUB 出发,绕着极限、连续、可微、积分、一致收敛一路走来,最后回到一个关于逼近的陈述,它把”连续”这个概念与最熟悉的函数类(多项式)连接了起来。

核心定义与直观解释

(一)幂级数与收敛半径(Lecture 23 的 Definition 258 / Theorem 259 / Definition 260 回顾)

  • 严格定义(Definition 258, Power series / 幂级数):一个关于 $x_0$ 的幂级数是形如 \(\sum_{m=0}^{\infty}a_m(x-x_0)^m\) 的级数,其中 $x_0\in\mathbb{R}$ 称为中心 (center),$\{a_m\}$ 是给定的实数列,称为系数 (coefficients)。这里 $x$ 是变量:对每个固定的 $x$,它就是一个普通的数项级数 $\sum a_m(x-x_0)^m$。

  • 严格定义(Theorem 259 + Definition 260, Radius of convergence / 收敛半径;归属 Lecture 23):设 \(R=\lim_{m\to\infty}\vert a_m\vert ^{1/m}\) 存在(源文件笔误提示:Theorem 259 的陈述里把这个极限写成 $\vert a_m\vert ^{1/n}$,指数 $1/n$ 与求和指标 $m$ 混了;但该定理的证明用的正是 $1/m$(原文:”$\lim_{n\to\infty}\vert a_m(x-x_0)^m\vert ^{1/m}=R\vert x-x_0\vert $,定理由根值判别法得到”),故正确指数是 $1/m$,本笔记统一写成 $\vert a_m\vert ^{1/m}$),并令 \(p=\begin{cases}\dfrac{1}{R}, & R>0,\\[4pt] \infty, & R=0.\end{cases}\) 则 $\sum a_m(x-x_0)^m$ 在 $\vert x-x_0\vert <p$ 时绝对收敛,在 $\vert x-x_0\vert >p$ 时发散。这个 $p$ 就称为该幂级数的收敛半径 (radius of convergence)。当 $p=0$ 与 $p=\infty$ 时上式按字面理解:$p=0$ 表示级数只在 $x=x_0$ 收敛,$p=\infty$ 表示级数在整个 $\mathbb{R}$ 上绝对收敛。(请注意:幂级数的定义 Definition 258 与收敛半径的定义 Definition 260 都属于 Lecture 23;本讲只是引用。)

  • (补充)Cauchy–Hadamard 形式:Theorem 259 假设 $\lim\vert a_m\vert ^{1/m}$ 存在。若极限不存在,标准做法(教材 [JL] §2.6.5)改用上极限: \(p=\frac{1}{\limsup_{m\to\infty}\vert a_m\vert ^{1/m}}\qquad(\text{若 }\limsup=0\text{ 则 }p=\infty;\ \limsup=\infty\text{ 则 }p=0).\) 本课源文件只用”极限存在”的版本,这里标注为补充,仅作参考;下文所有计算都用源文件版本(本例中极限都存在)。

  • 直观解释(”它到底在说什么?”):幂级数是一个”无穷次多项式”$\sum a_m(x-x_0)^m$。第 $m$ 项的大小大致是 $\vert a_m\vert \,\vert x-x_0\vert ^m$;当我们把 $\vert x-x_0\vert $ 取得足够小,而 $\vert a_m\vert $ 的增长被一个固定的速率 $1/p$ 控制时,项就整体塌缩。所以这里的竞争是“系数的增长速度” vs “变量幂的衰减速度”:若 $\vert a_m\vert \approx (1/p)^m$,则第 $m$ 项 $\approx (\vert x-x_0\vert /p)^m$——这正是几何级数!于是”收敛”的判据自然就是 $\vert x-x_0\vert /p<1$。收敛半径 $p$ 就是这场竞争的临界刻度:从中心 $x_0$ 出发,凡是走得比 $p$ 近的地方都收敛,走得比 $p$ 远的地方都发散。

  • 为什么需要”收敛半径”这个概念? 因为它把”幂级数收敛的地方”这个看起来依赖于 $x$、依赖于系数的复杂集合,压缩成了一个单个数字 $p$:收敛域必然是 $(x_0-p,x_0+p)$ 加上若干端点。这就让后续讨论(一致收敛、逐项求导、逐项积分)有了一个统一的参数。反过来,如果幂级数的收敛域可以像 $\mathbb{R}$ 中任意集合那样畸形,”在收敛域上是否一致收敛”这类问题就无法用一个数字来描述。

  • 三分性(这是本讲反复使用的图像):设 $p$ 为收敛半径,则
    • $\vert x-x_0\vert <p$:绝对收敛(Theorem 259);
    • $\vert x-x_0\vert >p$:发散(Theorem 259);
    • $\vert x-x_0\vert =p$:定理不表态,必须逐点单独判断(这是 Lecture 23 的 Question 262 的延续,也是本讲”端点反例”的来源)。
  • 具体示例(把定义走一遍):取 $\sum_{m=0}^{\infty}2^mx^m$,则 $a_m=2^m$,$\lim\vert a_m\vert ^{1/m}=2$,故 $R=2$、$p=1/R=1/2$。取 $x=0.4$:$\vert x-0\vert =0.4<1/2$,级数绝对收敛,和为 $1/(1-2\cdot0.4)=1/0.2=5$。取 $x=0.6$:项为 $2^m(0.6)^m=(1.2)^m\to\infty$,发散。取端点 $x=1/2$:项恒为 $1$,不趋于 $0$,发散;取 $x=-1/2$:项为 $(-1)^m$,也不趋于 $0$,发散。

  • 反例(为什么端点的结论不能”顺手”推出来):$\sum_{m=1}^{\infty}x^m/m$ 的收敛半径是 $1$(因为 $\lim\vert a_m\vert ^{1/m}=\lim m^{-1/m}=1$),但在同一对端点 $x=\pm1$ 处行为相反:$x=1$ 时它是调和级数 $\sum 1/m$,发散;$x=-1$ 时它是交错级数 $\sum(-1)^m/m$,收敛(且和为 $-\ln 2=-0.6931471806$,用前 $10^6$ 项数值验算得 $-0.6931466806$,符合)。同一个 $p$、同一对端点,一个收敛一个发散——这说明”$\vert x-x_0\vert =p$ 时定理不表态”不是技术上的偷懒,而是数学事实的必然:端点的行为确实可以不同,必须单独分析。

(二)收敛半径的具体计算(对应 Assignment 7 第 2 题)

Assignment 7 第 2 题要求”求所有使级数收敛的实数 $x$”,共四小问。这正是”算 $p$ + 讨论端点”的标准训练。下面逐个做完,并在最后补两个常用作对照的例题。所有 $p$ 值都用 Python 数值验算过(脚本见下)。

0. 工具:两个直接可用的判别法。 对固定 $x$,令 $u_m=a_m(x-x_0)^m$。

  • 比值判别法(Lecture 12, Theorem 138):若 $L=\lim\dfrac{\vert u_{m+1}\vert }{\vert u_m\vert }=\lim\dfrac{\vert a_{m+1}\vert }{\vert a_m\vert }\vert x-x_0\vert $ 存在,则 $L<1$ 时绝对收敛,$L>1$ 时发散。取 $L<1$ 解得 $\vert x-x_0\vert <1/\lim\frac{\vert a_{m+1}\vert }{\vert a_m\vert }$,所以这就是”比值形式的收敛半径”。
  • 根值判别法(Lecture 12, Theorem 142):由定理直接给出 $p=1/\lim\vert a_m\vert ^{1/m}$。

(记号约定说明) 源文件在幂级数的语境中一律用下标 $j$(系数 $a_j$,中心 $x_0$,收敛半径 $p$,级数 $\sum_j a_j(x-x_0)^j$);本小节为了与 Assignment 7 原题的求和下标 $n$ 对齐,在逐项计算时暂用 $a_n,\ u_n$,但收敛半径一律记作 $p$(源文件符号)。”$R$” 是 Lecture 23 的 Theorem 259 中 $\lim\vert a_m\vert ^{1/m}$ 的名字,$p=1/R$ 才是收敛半径,请勿混淆。

(a)$\displaystyle\sum_{n=0}^{\infty}2^nx^n$。

  • 算 $p$:$a_n=2^n$,故 $\lim\vert a_n\vert ^{1/n}=2$,$p=1/2$。(比值法:$\frac{\vert u_{n+1}\vert }{\vert u_n\vert }=2\vert x\vert $,$<1\iff\vert x\vert <1/2$,一致。)
  • 端点:$x=1/2$ 时通项 $=2^n\cdot2^{-n}=1\not\to0$,发散;$x=-1/2$ 时通项 $=(-1)^n\not\to0$,发散。
  • 结论:收敛域恰为开区间 $(-1/2,1/2)$;在内部绝对收敛(且和为 $\frac{1}{1-2x}$),两端点都发散。

(b)$\displaystyle\sum_{n=0}^{\infty}nx^n$。

  • 算 $p$:$a_n=n$,$\lim n^{1/n}=1$(Lecture 9 的 Theorem 95 第 3 条已证),故 $p=1$。比值法:$\frac{\vert u_{n+1}\vert }{\vert u_n\vert }=\frac{n+1}{n}\vert x\vert \to\vert x\vert $,$<1\iff\vert x\vert <1$,同样得 $p=1$。
  • 端点:$x=1$ 时通项 $=n\not\to0$,发散;$x=-1$ 时通项 $=(-1)^nn$,也不趋于 $0$(绝对值恒为 $n$),发散。
  • 结论:收敛域为 $(-1,1)$,内部绝对收敛,和为 $\frac{x}{(1-x)^2}$(可由 $\sum x^n=\frac1{1-x}$ 逐项求导得到——本讲 Theorem 279 给出合法性)。

(c)$\displaystyle\sum_{n=0}^{\infty}\frac{(x-10)^n}{(2n)!}$。

  • 算 $p$:$a_n=\frac{1}{(2n)!}$。用比值法:$\vert u_{n+1}\vert /\vert u_n\vert =\frac{\vert x-10\vert }{(2n+1)(2n+2)}\to0$,对一切 $x\in\mathbb{R}$ 都 $<1$,故 $p=\infty$。(根值法一致:$(1/(2n)!)^{1/n}\to0$,由 $n!\ge (n/2)^{n/2}$ 可得。)
  • 端点:没有端点($p=\infty$,收敛域为整个 $\mathbb{R}$)。
  • 结论:对一切 $x\in\mathbb{R}$ 绝对收敛。(补充观察:偶阶乘使这个级数等于 $\cosh\sqrt{x-10}$ 的幂级数形式。数值验算:$x=9$ 代入得 $0.5403023059$,正是 $\cos 1=0.5403023059$;$x=11$ 代入得 $1.5430806348$,正是 $\cosh 1=1.5430806348$。)

(d)$\displaystyle\sum_{n=0}^{\infty}n!\,x^n$。

  • 算 $p$:$a_n=n!$。比值法:$\frac{\vert u_{n+1}\vert }{\vert u_n\vert }=(n+1)\vert x\vert \to\infty$(当 $x\ne0$),故 $x\ne0$ 时必发散;$x=0$ 时级数只有首项 $1$,收敛。根值法:$(n!)^{1/n}\to\infty$,$p=0$。
  • 端点:没有端点。
  • 结论收敛域只有单点 $\{0\}$,即 $p=0$。
  • 【注】这是”$p=0$”的典型代表:系数增长得比任何几何级数都快($n!$ 最终压过 $c^n$,因为 $n!/c^n\to\infty$),所以除了中心本身无处收敛。这类现象说明收敛半径定义中的”$p=0$”情形不是空洞的。

(e)对照例题 $\displaystyle\sum_{n=1}^{\infty}\frac{x^n}{n}$。

  • 算 $p$:$a_n=1/n$,$\lim n^{-1/n}=\frac{1}{\lim n^{1/n}}=1$,故 $p=1$。
  • 端点:$x=1$:$\sum1/n$ 发散(Lecture 11 的 Theorem 128,调和级数);$x=-1$:$\sum(-1)^n/n$ 是交错级数,由 Lecture 12 的 Theorem 144(交错级数判别法)收敛(条件收敛),和为 $-\ln 2$。
  • 结论:收敛域为 $[-1,1)$,且只有 $x=-1$ 处是条件收敛,其余内部点绝对收敛。这是”端点必须单独讨论”的样板。

(f)对照例题 $\displaystyle\sum_{n=1}^{\infty}\frac{x^n}{n^2}$。

  • 算 $p$:$a_n=1/n^2$,$\lim(n^{-2})^{1/n}=(\lim n^{-1/n})^2=1$,故 $p=1$。
  • 端点:$x=1$:$\sum1/n^2$ 收敛($p$-级数,$p=2>1$,Lecture 11 的 Theorem 137);$x=-1$:$\sum(-1)^n/n^2$ 绝对收敛,故收敛。
  • 结论:收敛域为闭区间 $[-1,1]$,两端点都(绝对)收敛。数值验算:$\sum_{n=1}^{10^6}(-1)^n/n^2=-0.8224670334$,与 $-\pi^2/12=-0.8224670334$ 吻合到小数点后 $12$ 位;$\sum_{n=1}^{10^6}1/n^2=1.6449330668$,向 $\pi^2/6=1.6449340668$ 靠拢。

数值验算脚本与结果($p$ 的核对)

import math
def show(name, logf, N):
    v = math.exp(logf(N)/N)          # |a_N|^(1/N)
    print(f"{name:26s} N={N:5d}  |a_N|^(1/N)={v:.10f}   p~{1/v:.8f}")

show("sum 2^n x^n",        lambda n: n*math.log(2),   2000)
show("sum n x^n",          lambda n: math.log(n+1),   2000)
show("sum (x-10)^n/(2n)!", lambda n: -math.lgamma(2*n+1), 300)
show("sum n! x^n",         lambda n: math.lgamma(n+1),    300)
show("sum x^n/n",          lambda n: -math.log(n+1),   5000)
show("sum x^n/n^2",        lambda n: -2*math.log(n+1), 5000)

实际输出:

sum 2^n x^n                N= 2000  |a_N|^(1/N)=2.0000000000   p~0.50000000
sum n x^n                  N= 2000  |a_N|^(1/N)=1.0038079330   p~0.99620651
sum (x-10)^n/(2n)!         N=  300  |a_N|^(1/N)=0.0000202454   p~49394.01051870
sum n! x^n                 N=  300  |a_N|^(1/N)=111.7599014502   p~0.00894775
sum x^n/n                  N= 5000  |a_N|^(1/N)=0.9982979715   p~1.00170493
sum x^n/n^2                N= 5000  |a_N|^(1/N)=0.9965988398   p~1.00341277

读法:前两行与第四行的数值收敛到 $2,1,\infty$(第四行 $\vert a_N\vert ^{1/N}$ 随 $N$ 增大而无界增长,说明 $p=0$),$x^n/n$ 与 $x^n/n^2$ 的估计值都向 $1$ 靠拢($N=5000$ 时 $1.0017$ 与 $1.0034$,$N$ 越大越接近 $1$,因为 $n^{-1/n}=e^{-(\ln n)/n}\to1$ 很慢)。第三行说明 $(2n)!$ 的增长极快,$p$ 事实上是 $\infty$(有限 $N$ 下的截断估计必然有限,这正说明”数值只能提示、不能替代 $p=\infty$ 的解析证明”)。

(三)一次”必败”的对照:逐点收敛下三条交换定理全错(Question 273)

先做一句回顾。 Lecture 24 的 Question 271 提出了三个”能否交换极限”的问题,本讲源文件开头(Question 273)指出:若收敛只是逐点的,三个答案都是”否”。上一讲(Lecture 24)已经用三个反例把这件事讲透了,本讲只作一句回顾,不再重复展开

  1. $f_n(x)=x^n$ 在 $[0,1]$ 上(逐点极限在 $x=1$ 处不连续);
  2. $f_n(x)=\dfrac{x^{n+1}}{n+1}$ 在 $[0,1]$ 上($f_n\to0$,但 $f_n^{\prime}=x^n\to g$ 而 $g(1)=1\ne0=(0)’$);
  3. 帐篷函数($\int_0^1f_n=1\not\to0=\int_0^10$)。

唯一需要带走的结论:这三个反例的病根完全相同——$\sup_{x}\bigl\vert f_n(x)-f(x)\bigr\vert $ 不趋于 $0$(误差在某个”移动的位置”上始终很大),即收敛不是一致的。这也解释了本讲为什么要花大力气去证明”幂级数在紧子区间上一致收敛”(Theorem 278):幂级数天生只给出逐点收敛,而逐点收敛什么都保证不了;只有拿到一致性,Lecture 24 的三条交换定理才能被启用。

(四)源文件的构造:$Q_n$ 核(”近似 Dirac delta”)(Theorem 283 的铺垫)

说明:本节按源文件路线展开。 源文件的 Weierstrass 逼近证明不用 Bernstein 多项式,而是构造一族”近似 Dirac delta 函数”的多项式核 $Q_n$ 做卷积。(本笔记在”定理与完整证明”一节的末尾另附一条补充小节,给出 Bernstein 多项式的构造性证明作为对照,并明确标注为源文件之外的补充材料。)

源文件的证明思路如下(这是源文件的原始思路,务必记住):

选取一列多项式 $\{Q_n\}_n$,使 $Q_n$ 像”Dirac delta 函数”一样在 $n\to\infty$ 时集中到 $0$ 点;然后令 $P_n(x)=\int_0^1Q_n(x-t)f(t)\,dt$,则 $P_n\to f$。

源文件给出的具体核是 \(c_n:=\left(\int_{-1}^{1}(1-x^2)^n\,dx\right)^{-1}>0,\qquad Q_n(x)=c_n(1-x^2)^n .\) $Q_n$ 是一个在 $[-1,1]$ 上非负、在 $x=0$ 取最大值 $c_n$、在 $\vert x\vert =1$ 处为 $0$ 的”钟形”多项式。它的三条性质(Theorem 283)是:$\int_{-1}^1Q_n=1$(归一化)、$Q_n\ge0$、以及对每个 $\delta\in(0,1)$,$Q_n\to0$ 在 $\delta\le\vert x\vert \le1$ 上一致

“近似 delta”的直观:$Q_n$ 的总”质量”始终是 $1$,但随着 $n$ 增大,质量越来越挤向原点附近(在 $\vert x\vert \ge\delta$ 上高度一致地塌缩到 $0$),所以 $Q_n$ 越来越像”只在 $0$ 处有质量的点质量”。用它去做卷积 $P_n(x)=\int f(t)Q_n(t-x)dt$,”点质量”就把 $t\approx x$ 处的函数值 $f(x)$ 挑出来——这正是”局部平均”的连续版本,与 Bernstein 多项式的”离散局部平均”是同一个思想的两个化身。

$Q_n$ 的钟形集中(用脚本画出的数值形状,未归一化值 $(1-x^2)^n$)

n=10 :  x=±0.00 1.000000 ****************************************
        x=±0.10 0.904382 ************************************
        x=±0.20 0.664833 ***************************
        x=±0.30 0.389416 ****************
        x=±0.40 0.174901 *******
        x=±0.50 0.056314 **
        x=±0.60 0.011529 
        x=±0.70 0.001190 
        x=±0.80 0.000037 
        x=±0.90 0.000000 

n=30 :  x=±0.00 1.000000 ****************************************
        x=±0.10 0.739700 ******************************
        x=±0.20 0.293858 ************
        x=±0.30 0.059053 **
        x=±0.40 0.005350 
        x=±0.50 0.000179 
        x=±0.60 0.000002 
        x=±0.70 0.000000      ← n 越大,两侧塌缩越快("delta 化")

定理与完整证明(核心)

定理 274(一致收敛保持连续性;Lecture 24 已证,此处列作后续依据)

  • 定理陈述:设 $f_n:S\to\mathbb{R}$ 对每个 $n$ 连续,$f:S\to\mathbb{R}$,且 $f_n\to f$ 一致。则 $f$ 连续。
  • 说明:这是 Lecture 25 的 Theorem 274(Lecture 24 已用它讨论过三个交换问题),本讲开头(源文件第 65–80 行)重新给出了证明,因为它是后面所有”交换定理”的原型。证明思路:一致性给出”整条函数曲线的 $\epsilon/3$-带”,再用其中某一个具体的 $f_M$ 的连续性把 $\epsilon/3$ 传给 $f$。
  • 逐步推导:设 $c\in S$,$\epsilon>0$。(1)由一致收敛,$\exists M\in\mathbb{N}$ 使 $\forall n\ge M\ \forall y\in S$,$\vert f_n(y)-f(y)\vert <\epsilon/3$。(依据:一致收敛定义取 $\epsilon/3$)(2)固定这个 $M$。$f_M$ 在 $c$ 连续,故 $\exists\delta_0>0$ 使 $\forall\vert x-c\vert <\delta_0$,$\vert f_M(x)-f_M(c)\vert <\epsilon/3$。(依据:连续性的 $\epsilon$-$\delta$ 定义)(3)取 $\delta=\delta_0$。若 $\vert x-c\vert <\delta$,则由三角不等式 \(\vert f(x)-f(c)\vert \le\vert f(x)-f_M(x)\vert +\vert f_M(x)-f_M(c)\vert +\vert f_M(c)-f(c)\vert <\frac\epsilon3+\frac\epsilon3+\frac\epsilon3=\epsilon .\) (依据:三角不等式;前两项用一致收敛在 $y=x$ 与 $y=c$ 处的估计,第三项用 $f_M$ 的连续性)
  • 【证明机制解说】关键在”选一个中间函数 $f_M$“:$f$ 本身的连续性正是我们要证的,不能直接用;而一致收敛给了”$f$ 与 $f_M$ 整体只差 $\epsilon/3$”这条全部 $y$ 同时成立的信息。于是”$f$ 在 $x$ 与 $c$ 的差”被拆成三段:$f\to f_M$(一致收敛管)、$f_M(x)\to f_M(c)$($f_M$ 连续管)、$f_M\to f$(一致收敛管)。三段每段 $\epsilon/3$,合计 $\epsilon$。如果只有逐点收敛,第一步的 $M$ 会依赖 $y$:在 $x$ 处要 $M_x$、在 $c$ 处要 $M_c$,就没法取到同一个 $f_M$ 同时管住两端——这正是逐点收敛反例($f_n=x^n$)失效的机制。
  • 【证明技巧总结】$\epsilon/3$ 技巧“:要把”极限函数继承性质”写成三段,就取 $\epsilon/3$;中间那一段总是一个已知好性质的具体成员(这里的 $f_M$)。可迁移的口号是:”先取一个足够好的中间对象,再把两边都压到 $\epsilon/3$ 以内。”

定理 275(一致收敛可交换积分;Lecture 24 已证)

  • 定理陈述:设 $f_n:[a,b]\to\mathbb{R}$ 连续,$f:[a,b]\to\mathbb{R}$,且 $f_n\to f$ 一致。则 $\int_a^bf_n\to\int_a^bf$。
  • 逐步推导:设 $\epsilon>0$。(1)由一致收敛 $\exists M_0$ 使 $\forall n\ge M_0\ \forall x\in[a,b]$,$\vert f_n(x)-f(x)\vert <\frac{\epsilon}{b-a}$。(依据:一致收敛定义,取 $\epsilon/(b-a)$)(2)对 $n\ge M_0$, \(\left\vert \int_a^bf_n-\int_a^bf\right\vert =\left\vert \int_a^b(f_n-f)\right\vert \le\int_a^b\vert f_n-f\vert <\int_a^b\frac{\epsilon}{b-a}=\epsilon .\) (依据:积分的线性;积分的绝对值不等式 $\vert \int g\vert \le\int\vert g\vert $;积分的单调性;区间长度 $b-a$)
  • 【证明机制解说】这里的核心是”把函数的一致误差换成积分的误差要靠区间长度定价“:$\sup\vert f_n-f\vert $ 是”高度”,乘上区间长度 $b-a$ 才得到”面积”。因此一致性里必须取 $\epsilon/(b-a)$,而不能只取 $\epsilon$。这也解释了为什么一致性在 $[a,b]$ 上(长度有限)特别有用:若区间长度无限,同一不等式就失效。
  • 【证明技巧总结】误差定价技巧“:先明确”我要控制的是哪个量纲”(这里是积分,是面积),再按它去反推函数误差需要多小(除以长度)。同类技巧在 Fourier 分析、测度论中反复出现。

定理 277(一致收敛可交换求导;Lecture 24 已证)

  • 定理陈述:设 $f_n:[a,b]\to\mathbb{R}$ 连续可微(continuously differentiable),$f,g:[a,b]\to\mathbb{R}$,且 $f_n\to f$ 逐点、$f_n^{\prime}\to g$ 一致。则 $f$ 连续可微,且 $g=f^{\prime}$。
  • 逐步推导:(1)对每个 $n$ 与每个 $x\in[a,b]$,微积分基本定理(FTC)给出 $f_n(x)-f_n(a)=\int_a^xf_n^{\prime}$。(依据:FTC,Lecture 22 已给)(2)由 Theorem 275(积分交换,$f_n^{\prime}$ 一致收敛到 $g$、$[a,x]$ 是 $[a,b]$ 的子区间,把定理用在 $[a,x]$ 上)与逐点收敛,得 \(f(x)-f(a)=\lim_{n\to\infty}\bigl(f_n(x)-f_n(a)\bigr)=\lim_{n\to\infty}\int_a^xf_n^{\prime}=\int_a^xg .\) (依据:$f_n\to f$ 逐点;Theorem 275)(3)于是 $f(x)=f(a)+\int_a^xg$。(4)由 FTC 的第二形式,$x\mapsto\int_a^xg$ 可导且导数为 $g(x)$($g$ 连续:由 $f_n^{\prime}$ 连续 + 一致收敛 + Theorem 274),故 $f$ 可导且 $f^{\prime}=g$,且 $f^{\prime}=g$ 连续。(依据:FTC(第二形式);Theorem 274)
  • 【证明机制解说】直接对 $f_n\to f$ 求导是行不通的(没有”极限的导数”这样的定理);本证明绕道积分:先承认 $g$ 是 $f_n^{\prime}$ 的一致极限,再通过 FTC 把 $f_n$ 写成 $f_n^{\prime}$ 的积分,从而把”求导交换”降级成”积分交换”——而积分交换(Theorem 275)我们已经有了。这是”把未知问题归约到已知问题“的典范。为什么求导这边只要求 $f_n\to f$ 逐点? 因为 $f_n$ 在证明中只通过 $f_n(x)-f_n(a)$ 出现,不需要一致性;一致性只需作用在导数序列上,这才是关键(也是与积分情形最大的不同:求导交换的”一致性条件”落在 $f_n^{\prime}$ 而不是 $f_n$ 上)。
  • 【证明技巧总结】FTC 归约法“:碰到”导数与极限交换”就先把两边都积分,把求导换成积分,用已证的积分交换定理;并注意”要一致收敛的是导数”。此模式在 Picard 定理([JL] §6.3)中还会再出现。

定理 278(幂级数在收敛区间内部的紧子区间上一致收敛)★本讲核心★

  • 定理陈述(与源文件 Theorem 278 完全一致):设 $\sum_{j=0}^{\infty}a_j(x-x_0)^j$ 是一个收敛半径为 $p\in(0,\infty]$ 的幂级数。则对每个 $r\in(0,p)$,$\sum_{j=0}^{\infty}a_j(x-x_0)^j$ 在闭区间 $[x_0-r,\ x_0+r]$ 上一致收敛
  • 证明策略:这是一致收敛问题,而我们手上最强的工具是 Lecture 24 的 Weierstrass M-判别法 (M-test, Theorem 268):只要给每一项找一个与 $x$ 无关的上界 $M_j$,并且 $\sum M_j$ 收敛,就自动得到一致收敛。所以计划是:
    1. 固定 $r<p$,把 $M_j$ 取成 $\vert a_j\vert r^j$(这是 $[x_0-r,x_0+r]$ 上 $\vert a_j(x-x_0)^j\vert $ 的最大值,与 $x$ 无关);
    2. 用根值判别法证明 $\sum\vert a_j\vert r^j$ 收敛(这一步用到 $r<p$);
    3. 调用 M-判别法收尾。
  • 逐步推导
    1. 取定 $r\in(0,p)$。对每个 $j\ge0$ 与每个 $x\in[x_0-r,x_0+r]$,有 $\vert x-x_0\vert \le r$,故 \(\vert a_j(x-x_0)^j\vert \le\vert a_j\vert \,r^j=:M_j .\) (依据:绝对值的乘法性质 $\vert uv\vert =\vert u\vert \vert v\vert $ 与 $\vert x-x_0\vert ^j\le r^j$;$M_j$ 与 $x$ 无关,这是 M-判别法的前提 a))
    2. 验证 $\sum M_j$ 收敛。由 Lecture 23 的 Theorem 259 的假设,$p^{-1}=\lim_{j\to\infty}\vert a_j\vert ^{1/j}$(当 $p<\infty$;当 $p=\infty$ 时该极限为 $0$)。于是 \(\lim_{j\to\infty}M_j^{1/j}=\lim_{j\to\infty}\vert a_j\vert ^{1/j}\cdot r=\begin{cases}\dfrac{r}{p}, & p<\infty,\\[6pt] 0, & p=\infty.\end{cases}\) (依据:$(\vert a_j\vert r^j)^{1/j}=\vert a_j\vert ^{1/j}\cdot r$;极限的乘法性质;$p^{-1}=\lim\vert a_j\vert ^{1/j}$)
    3. 因为 $r<p$,无论 $p<\infty$(此时 $r/p<1$)还是 $p=\infty$(此时极限为 $0<1$),都有 \(\lim_{j\to\infty}M_j^{1/j}<1 .\) (依据:$r<p$ 的直接推论)
    4. 根值判别法(Lecture 12, Theorem 142:若 $\lim\vert x_j\vert ^{1/j}<1$ 则 $\sum x_j$ 绝对收敛),数项级数 $\sum_{j=0}^{\infty}M_j=\sum_{j=0}^{\infty}\vert a_j\vert r^j$ 收敛。(依据:根值判别法;这是 M-判别法的前提 b))
    5. Weierstrass M-判别法(Lecture 24, Theorem 268),$\sum_{j=0}^{\infty}a_j(x-x_0)^j$ 在 $[x_0-r,x_0+r]$ 上一致收敛(并且逐点绝对收敛)。(依据:M-判别法,前提 a) 与 b) 均已验证)
  • 【证明机制解说】这个证明只有五行,但每一行都在回答一个”为什么可以”:
    • 为什么要缩到 $[x_0-r,x_0+r]$ 而不是整个 $(x_0-p,x_0+p)$? 因为 M-判别法要求 $M_j$ 与 $x$ 无关。在 $[x_0-r,x_0+r]$ 上,最大的 $\vert x-x_0\vert $ 就是 $r$,所以 $M_j=\vert a_j\vert r^j$ 可行。若想在开区间 $(x_0-p,x_0+p)$ 上做同样的事,就得取 $M_j=\vert a_j\vert p^j$——而 $\sum\vert a_j\vert p^j$ 在端点处未必收敛(下一小节有具体反例),M-判别法就失效了。这不是证明技巧不够,而是事实如此:幂级数在开区间上确实不必一致收敛。
    • “$r<p$”这个严格不等式在哪里用了? 用在第 3 步:$r/p<1$。如果是 $r=p$,根值极限正好等于 $1$,根值判别法失效(Lecture 12 的 Remark:$L=1$ 是盲区)。这就是”必须取 $r$ 严格小于 $p$”的全部原因。
    • 如果想自己重新发明这个证明:先问”我有什么工具能证明一致收敛?”——只有 M-判别法(本课程范围内);再问”M-判别法要什么?”——一个可和的、与 $x$ 无关的 majorant;最后问”哪里能拿到这样的 majorant?”——把 $\vert x-x_0\vert $ 顶到区间端点 $r$,用”$r$ 处绝对收敛”这一条已知信息。三步一步都省不掉。
  • 【证明技巧总结】缩到紧子区间 + 取端点值当 majorant + M-判别法“。这是本讲最该背下来的证明模式,它的三个要素是:(i)把”一致”的难度通过缩小定义域来换取($\vert x-x_0\vert \le r$ 而不是 $<p$);(ii)majorant 取成”最坏点”的值($M_j=\vert a_j\vert r^j$);(iii)用根值判别法把 majorant 的可和性翻译成 $r<p$。可迁移口号:”一致收敛往往不是免费的,它是用’离奇点远一点’换来的。

【关键辨析】为什么是”内部一致收敛”,而不是在 $[x_0-p,x_0+p]$ 上一致收敛?

这是本讲最容易被忽略却最重要的洞见。定理 278 的结论中 $r<p$ 是本质的,不能改成 $r\le p$。

  • 反例 1:$\sum_{n=1}^{\infty}\dfrac{x^n}{n}$ 在 $[0,1]$ 上不一致收敛。
    • 已知:$p=1$,级数在 $(-1,1)$ 内绝对收敛,在 $x=1$ 发散,在 $x=-1$ 收敛(条件收敛)。所以它在每一个 $[0,r]$($r<1$)上由 Theorem 278 一致收敛。
    • 但它在 $[0,1]$ 上一致收敛。理由(严格):设 $S_N(x)=\sum_{n=1}^{N}x^n/n$,$S(x)=\sum_{n=1}^{\infty}x^n/n$。若在 $[0,1]$ 上一致收敛,则对 $\epsilon=1/4$ 应存在 $N$,使 $\forall n\ge N\ \forall x\in[0,1]$,$\vert S(x)-S_n(x)\vert <\epsilon$。取 $x=1$:此时 $S(1)$ 不存在(级数发散),命题无意义——所以更准确的说法是:该级数的部分和在 $[0,1]$ 上不是一致 Cauchy 的,因为 \(\sup_{x\in[0,1]}\left\vert S_{2m}(x)-S_m(x)\right\vert \ge\left\vert S_{2m}(1)-S_m(1)\right\vert =\sum_{n=m+1}^{2m}\frac1n\ \ge\ m\cdot\frac{1}{2m}=\frac12,\) 对一切 $m$ 都 $\ge1/2$,不趋于 $0$。(依据:每个 $x^n\le1$ 但取 $x=1$ 时每项取到 $1/n$;调和级数部分和的”块估计” $\sum_{n=m+1}^{2m}\frac1n\ge\frac12$,这是 Lecture 11 证明调和级数发散时用过的同一手法。)
    • 直观:误差在 $x=1$ 处”最慢”——靠近 $1$ 时每一项 $x^n/n$ 都接近其最大值 $1/n$,级数收敛得最吃力;越靠近 $1$,需要的 $N$ 越大,$\sup$ 因此不趋 $0$。“最慢的地方”就是端点。
  • 反例 2:$\sum_{n=1}^{\infty}\dfrac{x^n}{n^2}$ 在 $[-1,1]$ 上也已经一致收敛。
    • 这是因为 $M_n=1/n^2$ 本身就是可和的($\sum1/n^2<\infty$),可以直接对 $[-1,1]$ 用 M-判别法。
    • 对照的意义:反例 1 与反例 2 的 $p$ 都是 $1$,端点行为都(部分)收敛,但闭区间上的一致性一个成立、一个不成立。这说明”收敛区间上是否一致收敛不能仅由 $p$ 和端点收敛性判定,必须单独分析。判别的方法是看 $\sum\sup_{[-1,1]}\vert a_nx^n\vert =\sum\vert a_n\vert $ 是否收敛。
  • 洞见总结:”一致收敛是局部性质”:幂级数的和函数在每一个紧子区间 $[x_0-r,x_0+r]\subset(x_0-p,x_0+p)$ 上具有一切好性质(连续、可积、可导、可逐项操作),但这些性质不一定能一路推到端点。这提示了一条更一般的原则(在 [JL] 第二卷中被正式命名为”局部一致收敛”):局部的规则性 + 全局的定义域,是分析中常见的一对张力。 典型后果:$\sum x^n/n$ 的和函数在 $(-1,1)$ 内无穷次可导,但它并不是”整条 $[-1,1]$ 上的光滑对象”——它在端点处的行为完全是另一回事。

示意图(”内部一致、端点失控”)

  一致收敛的"安全区" vs 端点
                                        p=1, 级数 Σ x^n/n
  x:   -1        0        r      1
       |---------|--------|---|----|
       ↑                        ↑
    端点:交错级数            内部:任意 [0,r] 上一致收敛
    条件收敛,但              (M-判别法,M_n = r^n/n)
    级数在 1 处发散;
    部分和"块差" >= 1/2
    → [0,1] 上不一致收敛

  sup_{x∈[0,1]} |S_{2m}(x)-S_m(x)| >= 1/2  对一切 m  ← 不一致的"铁证"

  ▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓▓
  误差随 x→1 越来越难压:x=0.5 时 0.5^n 飞快消失;
  x=0.99 时 0.99^n 衰减极慢 → 端点最慢 → sup 不趋 0

定理 279(幂级数的逐项求导与逐项积分,收敛半径不变)★本讲核心★

  • 定理陈述(与源文件 Theorem 279 一致):设 $\sum_{j=0}^{\infty}a_j(x-x_0)^j$ 的收敛半径为 $p\in(0,\infty]$。则
    1. 对每个 $c\in(x_0-p,\ x_0+p)$,和函数在该点可导,且 \(\frac{d}{dx}\sum_{j=0}^{\infty}a_j(x-x_0)^j=\sum_{j=0}^{\infty}j\,a_j(x-x_0)^{j-1};\)
    2. 对任意 $x_0-p<a<b<x_0+p$, \(\int_a^b\sum_{j=0}^{\infty}a_j(x-x_0)^j\,dx=\sum_{j=0}^{\infty}a_j\left(\frac{(b-x_0)^{j+1}}{j+1}-\frac{(a-x_0)^{j+1}}{j+1}\right).\)
  • 证明策略:定理 277 已经把”求导交换”归约到”导数级数一致收敛“。所以策略是:先证明导数级数 $\sum j a_j(x-x_0)^{j-1}$ 在紧子区间上一致收敛(用 M-判别法),然后套用 Theorem 277。积分部分直接用 Theorem 275(积分交换),因为积分交换只要求原级数一致收敛,而 Theorem 278 刚刚给了。
  • (第一部分:逐项求导)逐步推导
    1. 先确认原级数与导数级数的收敛半径。设 $b_j=ja_j$,考察 $\sum b_j(x-x_0)^{j-1}$。令 $j=k+1$,其系数(按 $(x-x_0)^k$ 排列)为 $(k+1)a_{k+1}$。由源文件 Remark 280: \(\lim_{k\to\infty}\bigl((k+1)\vert a_{k+1}\vert \bigr)^{1/k}=\lim_{k\to\infty}\Bigl((k+1)^{1/(k+1)}\vert a_{k+1}\vert ^{1/(k+1)}\Bigr)^{(k+1)/k}=\lim_{k\to\infty}\vert a_k\vert ^{1/k}=p^{-1}.\) (依据:改写为 $(j+1)$ 次根的 $(j+1)/j$ 次幂;$(k+1)^{1/(k+1)}\to1$,这是 Lecture 9 的 Theorem 95 第 3 条;指数 $(k+1)/k\to1$;极限的乘法与复合性质) 于是导数级数的收敛半径与原来相同,仍是 $p$。(依据:收敛半径由 $\lim\vert a_j\vert ^{1/j}=p^{-1}$ 决定)
    2. 取定 $r$ 与 $r^{\prime}$,满足 $0<r<r^{\prime}<p$。(关键:为什么需要两个数? 见下。)
    3. 对 $x\in[x_0-r,x_0+r]$,考察导数级数的第 $j$ 项(写成 $ja_j(x-x_0)^{j-1}$): \(\vert ja_j(x-x_0)^{j-1}\vert \le j\,\vert a_j\vert \,r^{\,j-1}=\frac{j\,\vert a_j\vert \,r^{\,j-1}}{\vert a_j\vert (r^{\prime})^{\,j}}\cdot\vert a_j\vert (r^{\prime})^{\,j}=\vert a_j\vert (r^{\prime})^{\,j}\cdot\frac{j}{r^{\prime}}\left(\frac{r}{r^{\prime}}\right)^{j-1}.\) (依据:$\vert x-x_0\vert \le r$;代数变形”乘一项除一项”)
    4. 令 $\rho:=r/r^{\prime}\in(0,1)$。断言 $\displaystyle\sum_{j=1}^{\infty}j\,\rho^{\,j-1}$ 收敛。证明:由比值判别法, \(\frac{(j+1)\rho^{\,j}}{j\,\rho^{\,j-1}}=\frac{j+1}{j}\cdot\rho\longrightarrow\rho<1,\) 故收敛。(依据:比值判别法 Lecture 12, Theorem 138;$\rho<1$ 由 $r<r^{\prime}$ 保证)
    5. 于是存在常数 $K>0$(可取 $K=\sup_j \frac{j}{r^{\prime}}\rho^{\,j-1}<\infty$,由第 4 步收敛知 $j\rho^{j-1}\to0$ 故有界)使 \(\vert ja_j(x-x_0)^{j-1}\vert \le K\,\vert a_j\vert (r^{\prime})^{\,j}=:M_j .\) (依据:第 3、4 步;$M_j$ 与 $x$ 无关)
    6. 又因为 $r^{\prime}<p$,由 Theorem 278(或第 4 步同款根值论证)$\sum\vert a_j\vert (r^{\prime})^j$ 收敛。(依据:$r^{\prime}<p$ 与根值判别法)
    7. M-判别法,$\sum_{j=1}^{\infty}j\,a_j(x-x_0)^{j-1}$ 在 $[x_0-r,x_0+r]$ 上一致收敛。(依据:M-判别法,前提 a) 第 5 步、b) 第 6 步)
    8. 每个函数 $x\mapsto a_j(x-x_0)^j$ 在 $[x_0-r,x_0+r]$ 上连续可微。(依据:多项式可微,讲义 Lecture 20 的求导法则)
    9. 取 $[a,b]\subset(x_0-p,x_0+p)$ 与 $c\in(a,b)$。由 $p$ 的性质可取 $r$ 使 $[a,b]\subset[x_0-r,x_0+r]\subset(x_0-p,x_0+p)$(例如 $r$ 取 $[a,b]$ 到 $x_0$ 的距离与 $p$ 之间的一个数)。把 Theorem 277(求导交换) 用在 $[x_0-r,x_0+r]$ 上:$f_n(x)=\sum_{j=0}^{n}a_j(x-x_0)^j\to f(x)$ 逐点(甚至由第 7 步的 M-判别法论证更快:一致),$f_n^{\prime}\to\sum ja_j(x-x_0)^{j-1}$ 一致(第 7 步),故 $f$ 可导且 \(f^{\prime}(c)=\sum_{j=0}^{\infty}j\,a_j(c-x_0)^{j-1}.\) (依据:Theorem 277)
    10. 由于 $c$ 是 $(x_0-p,x_0+p)$ 中任意点,第一部分得证;并且 $f^{\prime}$ 作为连续函数列的一致极限(再用 Theorem 274)是连续的。(依据:Theorem 274)
  • (第二部分:逐项积分)逐步推导
    1. 由 Theorem 278,取 $r$ 使 $[a,b]\subset[x_0-r,x_0+r]$,原级数在 $[x_0-r,x_0+r]$ 上一致收敛。(依据:Theorem 278)
    2. 每个 $x\mapsto a_j(x-x_0)^j$ 在 $[a,b]$ 上连续。(依据:多项式连续)
    3. Theorem 275(积分交换), \(\int_a^b\sum_{j=0}^{\infty}a_j(x-x_0)^j\,dx=\sum_{j=0}^{\infty}\int_a^b a_j(x-x_0)^j\,dx .\) (依据:Theorem 275)
    4. 对每个 $j$ 直接算积分(Lecture 22 的 FTC):$\int_a^b(x-x_0)^j\,dx=\left[\frac{(x-x_0)^{j+1}}{j+1}\right]_{a}^{b}=\frac{(b-x_0)^{j+1}-(a-x_0)^{j+1}}{j+1}$。(依据:FTC;幂函数积分公式,$j+1\ge1>0$ 故无奇点)
    5. 代入第 3 步即得定理第二部分的公式。(依据:代数整理) 特别注意:积分后的级数 $\sum_j\frac{a_j}{j+1}(x-x_0)^{j+1}$ 的收敛半径不变(见 Remark 280 的同款论证:$\lim\bigl(\vert a_j\vert /(j+1)\bigr)^{1/(j+1)}=\lim\vert a_j\vert ^{1/j}\cdot\lim(j+1)^{-1/(j+1)}=p^{-1}\cdot1=p^{-1}$,因为 $(j+1)^{1/(j+1)}\to1$)。理由一句话:除以 $j+1$ 只是把系数按多项式速率(而非指数速率)压缩,而收敛半径只由系数的指数增长率 $\lim\vert a_j\vert ^{1/j}$ 决定,多项式因子的 $n$ 次根总是趋向 $1$。所以”除以 $n+1$”和”乘以 $n$”一样,都不改变 $p$
  • 【证明机制解说】
    • 为什么求导比积分”危险”? 因为求导把每一项 $a_j(x-x_0)^j$ 变成 $ja_j(x-x_0)^{j-1}$,凭空多出一个随 $j$ 线性增长的因子 $j$。这个因子足以毁掉很多级数:例如 $\sum x^n/n^2$ 逐项求导后得到 $\sum x^{n-1}/n$,在 $x=1$ 处变成调和级数而发散。所以”求导后还一直一致收敛”不是白来的
    • 幂级数的结构为什么足够强? 因为幂级数的项本身以指数速率衰减:在 $\vert x-x_0\vert \le r<r^{\prime}$ 时,第 $j$ 项被 $(r/r^{\prime})^{j}$ 这样的指数因子压制。指数衰减足以吃掉任何多项式增长:这正是第 4 步 $\sum j\rho^{j-1}<\infty$($\rho<1$)的内容,也是数值上”$j\rho^j\to0$ 极快”的原因(见下)。
    • $r<r^{\prime}<p$ 里那个”额外的 $r^{\prime}$”是干什么的? 它给”被 $j$ 放大后的项”留出指数衰减的余地。如果只用 $r$,我们有的只是 $\vert ja_j\vert r^{j-1}$,而 $r$ 可能已经贴着 $p$,$\sum\vert a_j\vert r^j$ 可能刚好在收敛边缘,$j$ 倍的放大就可能把它推出去。取一个更大的 $r^{\prime}<p$,我们把”用来付指数衰减的预算”($(r/r^{\prime})^j$)与”被 $j$ 放大”这两件事分开支付:前者由 $\rho<1$ 提供,后者由 $\sum\vert a_j\vert (r^{\prime})^j$ 的收敛提供。这个”两参数技巧“是本证明的灵光一现。
    • 如果让你自己发明:目标是”把 $j$ 这个麻烦因子吸收掉”。既然 $j$ 是多项式增长,就找指数衰减来配对——手头最强的指数衰减就是 $(r/r^{\prime})^j$。于是自然去取 $r<r^{\prime}<p$,把 $j$ 与 $\rho^{j-1}$ 捆成 $\sum j\rho^{j-1}$(收敛!),把 $\vert a_j\vert $ 与 $(r^{\prime})^j$ 捆成 $\sum\vert a_j\vert (r^{\prime})^j$(也收敛!)。“把两个麻烦分开,各自配一个杀手”就是全部思想。
  • 【证明技巧总结】多项式因子由指数衰减吸收“:凡是要证明”乘上 $n^k$ 后级数仍收敛/一致收敛”,就写 $n^k\rho^n$ 并证明它有界(甚至 $\to0$),再配一个 $r^{\prime}$ 的缓冲带。数值上 $n\rho^n$ 的最大值约在 $n\approx1/(1-\rho)$ 处,等于 $\frac{1}{e(1-\rho)}$ 量级——它是一个有限的峰值,随 $\rho\to1^-$ 而变慢发散,这正是”必须留出 $r^{\prime}<p$ 的余量”的定量体现。

数值验算($n\rho^n$ 的峰值与 $\sum n\rho^n$)

import math
for r in [0.5, 0.9, 0.99, 0.999]:
    peak = max(n*r**n for n in range(1, 200000))
    print(f"rho={r}: max n*rho^n = {peak:.6f}  (峰值位置 n ~ 1/(1-rho) = {1/(1-r):.0f})")
print("sum n*0.9^n =", sum(n*0.9**n for n in range(1,4000)), " 精确值 0.9/0.01 =", 0.9/0.01)

输出:

rho=0.5:   max n*rho^n = 0.500000    (峰值位置 n ~ 2)
rho=0.9:   max n*rho^n = 3.486784    (峰值位置 n ~ 10)
rho=0.99:  max n*rho^n = 36.603234   (峰值位置 n ~ 100)
rho=0.999: max n*rho^n = 367.695425  (峰值位置 n ~ 1000)
sum n*0.9^n = 89.99999999999986  精确值 0.9/0.01 = 90.0

结论:$j\rho^{j-1}$ 有界(峰值有限),且在 $\rho$ 远离 $1$ 时迅速 $\to0$;这就是第 5 步常数 $K$ 的存在性。$\sum_{n\ge1}n(0.9)^n=90$ 与精确值 $0.9/(1-0.9)^2=90$ 完全吻合,说明第 4 步的”比值判别法判定收敛”是真的。

定理 280(Remark 280 的正式化:幂级数无穷次可导,且 $a_k=\dfrac{f^{(k)}(x_0)}{k!}$)★与 Lecture 20 的呼应★

  • 定理陈述:设 $f(x)=\sum_{j=0}^{\infty}a_j(x-x_0)^j$ 的收敛半径为 $p>0$。则 $f$ 在 $(x_0-p,x_0+p)$ 上无穷次可导,且对每个 $k\ge0$, \(a_k=\frac{1}{k!}\left.\left(\frac{d^k}{dx^k}\sum_{j=0}^{\infty}a_j(x-x_0)^j\right)\right\vert _{x=x_0}.\) 换言之:$f^{(k)}(x_0)=k!\,a_k$,即 $a_k=f^{(k)}(x_0)/k!$。幂级数就是它的 Taylor 级数。
  • 证明策略反复使用 Theorem 279 的第一部分。先用一次得到 $f^{(1)}=f^{\prime}$ 是一个幂级数(且 $p$ 不变),再用一次得到 $f^{\prime\prime}$ 也是一个幂级数($p$ 仍不变),如此下去。然后在 $x=x_0$ 处取值——在 $x_0$ 处所有高次项都消失,只剩常数项,这就是系数的来源。
  • 逐步推导
    1. 由 Theorem 279 的第一部分,$f$ 在 $(x_0-p,x_0+p)$ 上可导,且 $f^{\prime}(x)=\sum_{j=1}^{\infty}ja_j(x-x_0)^{j-1}$,其收敛半径仍为 $p$。(依据:Theorem 279)
    2. 重写指标:令 $k=j-1$,得 $f^{\prime}(x)=\sum_{k=0}^{\infty}(k+1)a_{k+1}(x-x_0)^{k}$——这又是一个以 $x_0$ 为中心、收敛半径为 $p$ 的幂级数。(依据:代数重排;系数为 $(k+1)a_{k+1}$;收敛半径由 Remark 280 的同一论证为 $p$)
    3. 对 $f^{\prime}$ 再应用 Theorem 279:$f^{\prime\prime}(x)=\sum_{k=0}^{\infty}(k+1)ka_{k+1}(x-x_0)^{k-1}=\sum_{m=0}^{\infty}(m+1)(m+2)a_{m+2}(x-x_0)^m$,收敛半径仍为 $p$。(依据:Theorem 279 可重复使用,因为每一步得到的都是收敛半径为 $p>0$ 的幂级数)
    4. 归纳:重复 $k$ 次后,$f^{(k)}(x)=\sum_{m=0}^{\infty}\frac{(m+k)!}{m!}a_{m+k}(x-x_0)^{m}$,收敛半径仍为 $p$。(依据:对 $k$ 作归纳;”收敛半径不变”在第 1、3 步已各验证一次,且用同一论证)
    5. 在 $x=x_0$ 处求值:上式右边只剩 $m=0$ 项(因为 $(x_0-x_0)^m=0^m$,$m\ge1$ 时为零;通常约定 $0^0=1$),故 \(f^{(k)}(x_0)=\frac{(0+k)!}{0!}a_{k+0}\cdot(x_0-x_0)^0=k!\,a_k .\) (依据:幂级数在中心处的求值:$\sum_{m\ge0}c_m\cdot0^m=c_0$)
    6. 整理得 $a_k=\dfrac{f^{(k)}(x_0)}{k!}$,即源文件 Remark 280 的结论 $k!a_k=\left.\left(\frac{d^k}{dx^k}\sum a_j(x-x_0)^j\right)\right\vert _{x=x_0}$。(依据:第 5 步两边除以 $k!$,$k!\ne0$)
  • 推论(展开式唯一性):若存在 $p>0$ 与系数列 $\{a_j\},\{b_j\}$ 使 \(\sum_{j=0}^{\infty}a_j(x-x_0)^j=\sum_{j=0}^{\infty}b_j(x-x_0)^j\qquad\text{对所有 }\vert x-x_0\vert <p,\) 则 $a_j=b_j$ 对一切 $j$ 成立。 证明:设公共和函数为 $f$。由定理,$a_k=f^{(k)}(x_0)/k!$ 且 $b_k=f^{(k)}(x_0)/k!$,故 $a_k=b_k$。(依据:定理本身;关键点:$f$ 的导数只依赖 $f$ 这个函数,不依赖用哪个级数表示它。)这就是”幂级数展开唯一”——它是 Lecture 20 的 Taylor 定理的幂级数版本,也是后面”把函数展开成幂级数”这一整套操作($e^x$、$\sin x$、$\ln(1+x)$ 等)有意义的逻辑前提:如果展开不唯一,写出一个展开就毫无信息量。
  • 【证明机制解说】
    • 为什么”反复求导”能一直做下去? 因为 Theorem 279 同时给了两件事:可导性 + 收敛半径不变。如果收敛半径在求导后变小,那么求导几次之后 $p$ 可能变成 $0$,就无法继续。所以”$p$ 不变“这个细节是整条推理链的承重墙,而不是装饰。
    • 为什么把 $x=x_0$ 代进去就能”挑出”第 $k$ 项? 因为 $(x-x_0)^m$ 在 $x=x_0$ 处等于 $0$($m\ge1$),只有 $m=0$ 存活。这就像”在 $0$ 处取值是一个过滤器,只放过常数项”。反复求导则把”第 $k$ 项”变成”新的常数项”,再过滤一次就取出 $a_k$。
    • 与 Lecture 20 的关系:Lecture 20 的 Taylor 定理说 $f(x)=\sum_{k=0}^{n}\frac{f^{(k)}(c)}{k!}(x-c)^k+R_n(x)$,其中余项 $R_n$ 需要单独控制(这是 Taylor 定理最麻烦的地方)。本定理以一种完全不同的方式绕开了余项:它假设函数已经等于一个幂级数,此时”余项”就是级数的尾 $\sum_{j>n}a_j(x-x_0)^j$,由幂级数自身的收敛性(以及内部一致收敛)自动可忽略。两相对照,可以看出幂级数是一类”余项自动清零”的 Taylor 展开——这也解释了为什么本课程的路线要先证明”幂级数可以逐项求导”,才能回头谈 $e^x$、$\sin x$ 的展开式。
  • 【证明技巧总结】用算子重复作用 + 在特殊点求值提取系数“:把一个复杂对象(整个系数列)通过反复施加一个线性算子(求导)并在一处求值($x=x_0$)逐步”投影”出来。同类模式:Fourier 系数用 $\int f(x)\cos(nx)dx$ 提取(”正交投影”),Taylor 系数用 $f^{(n)}(c)/n!$ 提取。核心都是”设计一个过滤器把干扰项杀掉”。

Theorem 282(Weierstrass 逼近定理 / Weierstrass approximation theorem)★本讲目标★

  • 定理陈述(与源文件 Theorem 282 一致): \(\text{若 }f\in C([a,b]),\ \text{则存在一列多项式 }\{P_n\}\text{ 使得 }P_n\to f\ \text{在 }[a,b]\text{ 上一致}.\) 等价的 $\epsilon$ 形式(这是本笔记与思考题中使用的形式,逻辑上等价):$\forall\epsilon>0\ \exists$ 多项式 $P$ 使 $\sup_{x\in[a,b]}\vert f(x)-P(x)\vert <\epsilon$。 量词结构独立写出,务必对照: \(\forall\epsilon>0\ \ \exists\,\text{多项式 }P\ \ \forall x\in[a,b]:\quad \vert f(x)-P(x)\vert <\epsilon .\) 注意 $P$ 只依赖 $\epsilon$,不依赖 $x$——这就是”一致”的全部内容。
  • 源文件的 Remark 281:”This theorem essentially states: Every continuous function on $[a,b]$ is almost a polynomial.“($[a,b]$ 上每个连续函数几乎就是多项式。
  • 证明策略(源文件路线):分三步走。
    • 第一步(归约到 $[0,1]$ 且端点为 $0$):设 $f\in C([0,1])$ 且 $f(0)=f(1)=0$;把 $f$ 延拓成 $\mathbb{R}$ 上连续函数(在 $[0,1]$ 外取 $0$)。若在这个特殊情形证明了结论,则对一般的 $\tilde f\in C([0,1])$,函数 $\tilde f(x)-\tilde f(0)-x(\tilde f(1)-\tilde f(0))$ 在两端点为 $0$,可以用特殊情形逼近为多项式 $P_n$,于是 $\tilde P_n(x)=P_n(x)+\tilde f(0)+x(\tilde f(1)-\tilde f(0))$ 也是多项式并一致逼近 $\tilde f$。再把 $[a,b]$ 线性变换到 $[0,1]$ 即可。
    • 第二步(造”近似 delta”核 $Q_n$):定义 $c_n=\left(\int_{-1}^{1}(1-x^2)^n dx\right)^{-1}$,$Q_n(x)=c_n(1-x^2)^n$。证明三条性质(Theorem 283):积分为 $1$、非负、在 $\vert x\vert \ge\delta$ 上一致趋于 $0$。
    • 第三步(卷积逼近):令 $P_n(x)=\int_0^1f(t)Q_n(t-x)dt$,证明 $P_n$ 是多项式且 $P_n\to f$ 一致。
  • (第二步:Theorem 283 的证明)
    1. 性质 1(归一化):$\int_{-1}^{1}Q_n=c_n\int_{-1}^1(1-x^2)^n dx=1$。(依据:$c_n$ 的定义,$c_n>0$ 因为被积函数 $(1-x^2)^n\ge0$ 且不恒为零,积分严格为正)
    2. 性质 2(非负):对 $x\in[-1,1]$,$1-x^2\ge0$,故 $(1-x^2)^n\ge0$,$c_n>0$,所以 $Q_n(x)\ge0$。(依据:$n$ 次幂保持非负;正数乘非负)
    3. 性质 3(尾部一致趋 $0$):先估计 $c_n$。断言对一切 $n\in\mathbb{N}$ 与 $x\in[-1,1]$, \((1-x^2)^n\ge1-nx^2 .\) (依据:源文件给出的两种证法——课程早前用归纳法证过;也可用已证的微积分:令 $g(x)=(1-x^2)^n-(1-nx^2)$,则 $g(0)=0$ 且 $g^{\prime}(x)=n\cdot2x(1-(1-x^2)^{n-1})\ge0$ 在 $[0,1]$ 上成立,故由 MVT(Lecture 20)得 $g\ge0$ 于 $[0,1]$;$g$ 为偶函数故在整个 $[-1,1]$ 上成立。注意源文件此处写 $g^{\prime}(x)=n\cdot 2x(1-(1-x^2)^{n-1})\ge0$ 在 $[0,1]$ 上——因为 $x\ge0$、$(1-x^2)^{n-1}\le1$,故两项乘积非负。) 于是(注意 $x=1/\sqrt n$ 处 $1-nx^2=0$,且该点在被积区间内只要 $n\ge1$) \(\frac{1}{c_n}=\int_{-1}^{1}(1-x^2)^n dx=2\int_{0}^{1}(1-x^2)^n dx>2\int_{0}^{1/\sqrt n}(1-x^2)^n dx\ge2\int_0^{1/\sqrt n}(1-nx^2)dx\) \(=2\left(\frac{1}{\sqrt n}-\frac{n}{3}\cdot\frac{1}{n^{3/2}}\right)=\frac{4}{3\sqrt n}>\frac{1}{\sqrt n}.\) (依据:偶函数对称性;被积函数非负故缩小积分区间使积分变小;第 1 条估计 $(1-x^2)^n\ge1-nx^2$;直接积分 $\int_0^{a}(1-nx^2)dx=a-\frac{na^3}{3}$ 取 $a=n^{-1/2}$;算术 $\frac43>1$) 因此 $c_n<\sqrt n$。(依据:$1/c_n>1/\sqrt n$ 两边取倒数,注意均为正数)
    4. 尾部估计:对 $\delta\in(0,1)$ 证明 $\sqrt n(1-\delta^2)^n\to0$。用根值判别法的配套手法(源文件):考察 $n$ 次根 \(\lim_{n\to\infty}\Bigl(\sqrt n(1-\delta^2)^n\Bigr)^{1/n}=\lim_{n\to\infty}(n^{1/n})^{1/2}(1-\delta^2)=1\cdot(1-\delta^2)=1-\delta^2<1 .\) (依据:$(ab)^{1/n}=a^{1/n}b^{1/n}$;$(n^{1/n})^{1/2}\to1^{1/2}=1$,Lecture 9 的 Theorem 95 第 3 条;$0<\delta<1\Rightarrow1-\delta^2<1$) 于是(这一步是标准的”根值判别法型推理”:$n$ 次根极限 $<1$ 推出该项趋于 $0$,因为它最终被某个 $r^n$($r<1$)压住) \(\lim_{n\to\infty}\sqrt n(1-\delta^2)^n=0 .\) (依据:取 $\rho$ 使 $1-\delta^2<\rho<1$;则存在 $N_0$ 使 $n\ge N_0$ 时 $\bigl(\sqrt n(1-\delta^2)^n\bigr)^{1/n}<\rho$,于是 $\sqrt n(1-\delta^2)^n<\rho^n\to0$;再用夹逼)
    5. 给定 $\epsilon>0$,取 $M\in\mathbb{N}$ 使 $\forall n\ge M$,$\sqrt n(1-\delta^2)^n<\epsilon$。(依据:第 4 步的极限为 $0$,用收敛定义——注意:这正是 Lecture 24 中”点态一致性”的来源:$M$ 只依赖 $\epsilon$ 和 $\delta$,不依赖 $x$
    6. 于是 $\forall n\ge M$ 与 $\forall x$ 满足 $\delta\le\vert x\vert \le1$: \(\vert Q_n(x)\vert =c_n(1-x^2)^n<\sqrt n(1-x^2)^n\le\sqrt n(1-\delta^2)^n<\epsilon .\) (依据:$\vert Q_n\vert =Q_n$(非负);$c_n<\sqrt n$(第 3 步);在 $\vert x\vert \ge\delta$ 上 $(1-x^2)^n\le(1-\delta^2)^n$,因为 $1-x^2\le1-\delta^2$ 且 $t\mapsto t^n$ 在 $[0,1]$ 上单调递增(Lecture 1/4 的序性质)) 故 $Q_n\to0$ 在 $\{\delta\le\vert x\vert \le1\}$ 上一致。(依据:一致收敛定义)
  • (第三步:主定理的证明,完全按源文件)
    1. 特殊情形:设 $f\in C([0,1])$,$f(0)=f(1)=0$。把 $f$ 延拓到 $\mathbb{R}$:$x\notin[0,1]$ 时令 $f(x)=0$。定义 \(P_n(x)=\int_0^1f(t)Q_n(t-x)\,dt=\int_0^1f(t)\,c_n\bigl(1-(t-x)^2\bigr)^n dt .\)
    2. $P_n$ 是多项式:由于 $t\mapsto c_n(1-(t-x)^2)^n$ 是关于 $t$ 的多项式(次数 $2n$,系数含 $x$),把括号展开后每一项 $\int_0^1f(t)t^k dt$ 都是常数(只依赖 $f$ 与 $k$),乘上 $x$ 的多项式并求和,仍得 $x$ 的多项式。(依据:多项式在 $x$ 上的封闭性;积分是关于 $t$ 的线性运算)源文件原话:”Note that $P_n(x)$ is in fact a polynomial.”
    3. 把积分区间对称化(关键改写):对 $x\in[0,1]$, \(P_n(x)=\int_0^1f(t)Q_n(t-x)dt\overset{t=x+u}{=}\int_{-x}^{1-x}f(x+u)Q_n(u)du=\int_{-1}^{1}f(x+u)Q_n(u)du .\) (依据:换元 $u=t-x$(Lecture 22 的换元公式);最后一步因为 $u\notin[-x,1-x]$ 即 $x+u\notin[0,1]$ 时 $f(x+u)=0$,而 $Q_n$ 在 $[-1,1]$ 外为 $0$,所以扩到 $[-1,1]$ 不改变积分值。源文件此处把变量写成 $t$ 并写 $f(x+t)$,本笔记改用 $u$ 以免与积分变量 $t$ 混淆。
    4. 写出误差:由 Theorem 283 的性质 1($\int_{-1}^1Q_n=1$),对任意 $x$, \(P_n(x)-f(x)=\int_{-1}^{1}f(x+u)Q_n(u)du-f(x)\int_{-1}^1Q_n(u)du=\int_{-1}^{1}\bigl(f(x+u)-f(x)\bigr)Q_n(u)du .\) (依据:$f(x)$ 是常数,可移入积分;$\int Q_n=1$;积分的线性) 【注意源文件的笔误】 源文件写的是 $\int_{-1}^1(f(x-t)-f(t))Q_n(t)dt$,其中把 $f(x+u)$ 误写成 $f(x-t)$ 又混入 $f(t)$;上面的推导给出正确的是 $f(x+u)-f(x)$。本笔记采用正确形式,并说明差异。
    5. 取一致连续性的 $\delta$:设 $\epsilon>0$。$f\in C([0,1])$,$[0,1]$ 紧(Lecture 21),故 $f$ 在 $[0,1]$ 上一致连续,于是 $\exists\delta>0$ 使 $\forall x,y\in[0,1]$,$\vert x-y\vert \le\delta\Rightarrow\vert f(x)-f(y)\vert <\frac{\epsilon}{2}$。(依据:Lecture 21 的定理”紧集上连续 $\Rightarrow$ 一致连续”;这是本证明与 Lecture 21 的关键呼应
    6. 取 $f$ 的界:$C=\sup\{\vert f(x)\vert :x\in[0,1]\}$,由最值定理 (EVT,Lecture 21) 存在且有限(实际上是最大值)。(依据:EVT;若 $f\equiv0$ 则结论平凡,故可设 $C>0$)源文件把 $C$ 写成 $\sup\{f(x)\}$,本笔记取上确界绝对值以处理负值情形($f$ 可为负,用 $2C$ 作振幅界;源文件的写法在 $f\ge0$ 时相同)。
    7. 取 $n$ 充分大:由 Theorem 283 的性质 3,$\sqrt n(1-\delta^2)^n\to0$,故 $\exists M\in\mathbb{N}$ 使 $\forall n\ge M$,$\sqrt n(1-\delta^2)^n<\frac{\epsilon}{8C}$。(依据:极限定义;这里 $C,\epsilon,\delta$ 都已固定,故 $M$ 只依赖 $\epsilon$ 与 $f$)
    8. 误差分成两块:对 $n\ge M$ 与任意 $x\in[0,1]$, \(\vert P_n(x)-f(x)\vert \le\int_{-1}^{1}\bigl\vert f(x+u)-f(x)\bigr\vert Q_n(u)\,du=\underbrace{\int_{\vert u\vert \le\delta}\cdots}_{=:I_1}+\underbrace{\int_{\delta\le\vert u\vert \le1}\cdots}_{=:I_2}.\) (依据:三角不等式;$Q_n\ge0$ 故 $\vert Q_n\vert =Q_n$;把积分域按 $\vert u\vert \le\delta$ 与 $\delta\le\vert u\vert \le1$ 切开)
    9. 第一块(”中心区”):在 $\vert u\vert \le\delta$ 上,$\vert (x+u)-x\vert \le\delta$,故由第 5 步 $\vert f(x+u)-f(x)\vert <\epsilon/2$;又 $\int_{\vert u\vert \le\delta}Q_n\le\int_{-1}^1Q_n=1$,于是 \(I_1\le\frac{\epsilon}{2}\int_{\vert u\vert \le\delta}Q_n(u)du\le\frac{\epsilon}{2}\cdot1=\frac{\epsilon}{2}.\) (依据:$Q_n\ge0$ 时的积分单调性;Theorem 283 性质 1) 注意 $x+u$ 可能跑出 $[0,1]$,那时 $f(x+u)=0$,但一致连续性是在 $f$ 的延拓后的函数上用的——源文件在第一步就把 $f$ 延拓到 $\mathbb{R}$;更干净的做法是对延拓后的连续函数用 Lecture 21 的一致连续性(它在 $\mathbb{R}$ 上不成立!)。这里必须补一个论证:第 5 步的 $\delta$ 只需在 $[0,1]$ 内部保证即可;当 $x+u\notin[0,1]$ 时,由 $f(0)=f(1)=0$、$x\in[0,1]$、$\vert u\vert \le\delta\le1$ 可推出 $\vert f(x+u)-f(x)\vert \le\vert f(x)\vert +\vert f(x+u)\vert $,而 $x+u$ 落在 $[-\delta,0]$ 或 $[1,1+\delta]$ 时 $\vert f(x+u)\vert $ 由”$x+u$ 到端点距离 $\le\delta$ + 端点值为 $0$ + 连续性”控制,仍 $\le\epsilon/2$(必要时把 $\delta$ 再取小)。结论:取更小的 $\delta$ 可保证对一切 $u\in[-1,1]$、$x\in[0,1]$ 都有 $\vert f(x+u)-f(x)\vert <\epsilon/2$ 当 $\vert u\vert \le\delta$——这把”端点外”的情形一并纳入。(依据:端点值为 $0$;一致性;$\epsilon/2$ 折半预留)
    10. 第二块(”尾部”):在 $\delta\le\vert u\vert \le1$ 上,由 Theorem 283 性质 3,$\vert Q_n(u)\vert <\sqrt n(1-\delta^2)^n$;又 $\vert f(x+u)-f(x)\vert \le\vert f(x+u)\vert +\vert f(x)\vert \le2C$(依据:三角不等式、$C$ 的定义): \(I_2\le 2C\int_{\delta\le\vert u\vert \le1}Q_n(u)du<2C\cdot\sqrt n(1-\delta^2)^n\int_{\delta\le\vert u\vert \le1}1\,du\le2C\cdot\sqrt n(1-\delta^2)^n\cdot2 .\) (依据:$\vert Q_n\vert <\sqrt n(1-\delta^2)^n$;积分单调性;区间长度 $2$) 结合第 7 步 $\sqrt n(1-\delta^2)^n<\frac{\epsilon}{8C}$,得 $I_2<2C\cdot\frac{\epsilon}{8C}\cdot2=\frac{\epsilon}{2}$。(依据:代数;$C>0$ 可约去) 源文件的对应式子写作 \(\vert P_n(x)-f(x)\vert \le\frac{\epsilon}{2}\int_{\vert t\vert \le\delta}Q_n(t)dt+\sqrt n(1-\delta^2)^n\int_{\delta\le\vert t\vert \le1}2C<\frac\epsilon2+4C\sqrt n(1-\delta^2)^n<\frac\epsilon2+\frac\epsilon2=\epsilon .\) 与上面的推导一致($4C=2\cdot2C$)。
    11. 收尾:$\vert P_n(x)-f(x)\vert <\epsilon$ 对一切 $x\in[0,1]$ 与一切 $n\ge M$ 成立,故 \(\sup_{x\in[0,1]}\vert P_n(x)-f(x)\vert \le\epsilon\qquad(n\ge M),\) 即 $P_n\to f$ 在 $[0,1]$ 上一致。(依据:一致收敛定义——关键:$M$ 不依赖 $x$,这正是我们要的
    12. 一般情形:对任意 $\tilde f\in C([0,1])$,令 $h(x)=\tilde f(x)-\tilde f(0)-x(\tilde f(1)-\tilde f(0))$。则 $h(0)=0$,$h(1)=\tilde f(1)-\tilde f(0)-1\cdot(\tilde f(1)-\tilde f(0))=0$,且 $h\in C([0,1])$。由第 1–11 步存在多项式 $P_n\to h$ 一致,于是 $\tilde P_n(x):=P_n(x)+\tilde f(0)+x(\tilde f(1)-\tilde f(0))$ 仍为多项式,且 $\tilde P_n\to\tilde f$ 一致。(依据:一致收敛与”加同一个函数”可交换——常数与 $x$ 的线性函数是固定的,逐点相加不改变 $\sup$ 差)
    13. $[a,b]$ 情形:设 $f\in C([a,b])$。令 $g(u)=f(a+(b-a)u)\in C([0,1])$。由第 12 步取多项式 $P_n\to g$ 一致(在 $[0,1]$ 上)。令 $\widehat P_n(x)=P_n\!\left(\frac{x-a}{b-a}\right)$,它是 $x$ 的多项式,且 \(\sup_{x\in[a,b]}\vert f(x)-\widehat P_n(x)\vert =\sup_{u\in[0,1]}\vert g(u)-P_n(u)\vert \to0 .\) (依据:换元 $u=(x-a)/(b-a)$ 是 $[a,b]\to[0,1]$ 的连续双射,故两个 $\sup$ 相等) 定理证毕。
  • 【证明机制解说】
    • ① 为什么这个构造”自然”? 我们要把一个函数 $f$ 变成多项式,而多项式只能做”有限的代数运算”。构造 $P_n(x)=\int_0^1f(t)Q_n(t-x)dt$ 的妙处在于:$x$ 只出现在多项式核 $Q_n$ 里,$f$ 只充当”权重”。于是对每个固定的 $n$,把 $Q_n$ 展开后 $x$ 的部分是干净的多项式,而 $f$ 只贡献常数 $\int f(t)t^kdt$。这就是”用多项式核做卷积,把函数的正则化交给核”——现代分析中滤波器、小波、热核方法的共同思想。
    • ② 那三个性质为什么恰好够用? 误差积分 $\int(f(x+u)-f(x))Q_n(u)du$ 要趋于 $0$,需要两件事同时成立:(i)$Q_n$ 的”质量”归一(否则 $f$ 的常数部分消不掉);(ii)$Q_n$ 的质量集中到 $u\approx0$(否则远处的 $f(x+u)$ 与 $f(x)$ 差得远,无法控制)。性质 1 解决(i),性质 2(非负)让”质量”这个词有意义(否则正负抵消,集中性无从谈起),性质 3 解决(ii)。这就是”近似 delta 函数”的三个公理式条件。
    • ③ 为什么”$\epsilon/2$ + $\epsilon/2$”能配平? 中心区的误差由一致连续性压到 $\epsilon/2$(这是”$f$ 连续”的全部作用);尾部的误差由$Q_n$ 的塌缩速度压到 $\epsilon/2$(这是”$Q_n$ 集中”的全部作用)。两件事相互独立,所以可以先取定 $\delta$(由 $f$ 决定),再取 $n$ 足够大(由 $\delta$ 决定)——注意顺序不能颠倒:如果先取 $n$ 再取 $\delta$,$\delta$ 会依赖 $n$,尾部估计就失效。这个”先 $\delta$ 后 $n$“的顺序与 Lecture 24 的一致收敛定义完全同构。
    • ④ 与 Bernstein 路线的对照(补充直观):源文件的 $Q_n$ 是连续型的局部平均(对 $t$ 积分),Bernstein 多项式是离散型的局部平均(对 $k$ 求和)。两者的证明骨架一致:归一化 + 非负 + 集中性 + 一致连续 + 尾部截断。$Q_n$ 的”集中性”靠 $\sqrt n(1-\delta^2)^n\to0$;Bernstein 的”集中性”靠方差 $\frac{x(1-x)}{n}\le\frac1{4n}\to0$。它们互为”连续/离散”的镜像。
  • 【证明技巧总结】构造近似恒等算子 (approximate identity):归一 + 非负 + 集中 + 一分二“。具体地:(i)设计一族核使 $\int Q_n=1$、$Q_n\ge0$、且核在远离原点处一致塌缩;(ii)把误差写成 $\int(f(x+u)-f(x))Q_n(u)du$;(iii)以 $\delta$ 切开,中心用一致连续性、尾部用核的塌缩;(iv)两半各配 $\epsilon/2$。这个模式在调和分析(Fejér 核、Poisson 核)、概率论(中心极限定理)、偏微分方程(热核)中会反复出现。记住口号:”把不好的函数与一个好的核卷积,坏处就被平均掉了。”

补充定理(Bernstein 多项式的证明;源文件未含,作为第二条构造性证明)

明确声明:本小节是补充材料,源文件用的 $Q_n$ 卷积路线已在上面完整给出。这里补充 Bernstein 路线,是因为它把”权重集中”变成了一次干净的二项式恒等式计算,非常值得掌握;而且它给出的多项式不需要积分,构造更显式。

引理 L1(零阶矩):$\displaystyle\sum_{k=0}^{n}\binom nkx^k(1-x)^{n-k}=1$ 对一切 $x\in\mathbb{R}$。 证明:这就是二项式定理:$(x+(1-x))^n=\sum_{k=0}^n\binom nkx^k(1-x)^{n-k}$,而 $x+(1-x)=1$,$1^n=1$。(依据:二项式定理)

引理 L2(一阶矩):$\displaystyle\sum_{k=0}^{n}k\binom nkx^k(1-x)^{n-k}=nx$。 证明:(1)对 $k=0$ 项为 $0$,故可只对 $k\ge1$ 求和。(2)用恒等式 $k\binom nk=n\binom{n-1}{k-1}$(依据:$\binom nk=\frac{n!}{k!(n-k)!}$,故 $k\binom nk=\frac{n!}{(k-1)!(n-k)!}=n\cdot\frac{(n-1)!}{(k-1)!((n-1)-(k-1))!}=n\binom{n-1}{k-1}$)。(3)令 $j=k-1$: \(\sum_{k=1}^{n}k\binom nkx^k(1-x)^{n-k}=nx\sum_{j=0}^{n-1}\binom{n-1}{j}x^{j}(1-x)^{(n-1)-j}=nx\cdot1=nx .\) (依据:第 2 步提取 $nx$;末步用引理 L1 在 $n-1$ 上的版本)

引理 L3(二阶阶乘矩):$\displaystyle\sum_{k=0}^{n}k(k-1)\binom nkx^k(1-x)^{n-k}=n(n-1)x^2$。 证明:同法。$k(k-1)\binom nk=n(n-1)\binom{n-2}{k-2}$(依据:$\binom nk$ 的定义,两次约分),故 \(\sum_{k=2}^{n}k(k-1)\binom nkx^k(1-x)^{n-k}=n(n-1)x^2\sum_{j=0}^{n-2}\binom{n-2}{j}x^{j}(1-x)^{(n-2)-j}=n(n-1)x^2 .\) (依据:$k=0,1$ 的项为 $0$;令 $j=k-2$;引理 L1 在 $n-2$ 上)

推论 L3’(二阶矩):$\displaystyle\sum_{k=0}^{n}k^2\binom nkx^k(1-x)^{n-k}=nx(1-x)+n^2x^2$。 证明:$k^2=k(k-1)+k$,故由 L2、L3: \(\sum k^2w_k=\sum k(k-1)w_k+\sum k\,w_k=n(n-1)x^2+nx=n^2x^2-nx^2+nx=nx(1-x)+n^2x^2 .\) (依据:代数恒等式 $k^2=k(k-1)+k$;积分的线性;引理 L2、L3)

推论 L4(方差界,本路线的核心):对一切 $x\in[0,1]$ 与一切 $n\ge1$, \(\sum_{k=0}^{n}\left(\frac kn-x\right)^2\binom nkx^k(1-x)^{n-k}=\frac{x(1-x)}{n}\le\frac{1}{4n}.\) 证明:(1)展开平方: \(\sum_k\left(\frac kn-x\right)^2w_k=\frac{1}{n^2}\sum_kk^2w_k-\frac{2x}{n}\sum_kk\,w_k+x^2\sum_kw_k .\) (依据:$(a-b)^2=a^2-2ab+b^2$;和的线性) (2)代入 L1、L2、L3’: \(=\frac{nx(1-x)+n^2x^2}{n^2}-\frac{2x}{n}\cdot nx+x^2\cdot1=\frac{x(1-x)}{n}+x^2-2x^2+x^2=\frac{x(1-x)}{n}.\) (依据:引理 L1、L2、L3’;代数化简) (3)最后,$x(1-x)\le1/4$ 对 $x\in[0,1]$ 成立,因为 $x(1-x)=1/4-(x-1/2)^2\le1/4$。(依据:配方;平方非负)故 $\frac{x(1-x)}{n}\le\frac{1}{4n}$。

Chebyshev 型尾部估计(推论 L5):对任意 $\delta>0$, \(\sum_{\vert k/n-x\vert \ge\delta}\binom nkx^k(1-x)^{n-k}\le\frac{1}{\delta^2}\cdot\frac{x(1-x)}{n}\le\frac{1}{4n\delta^2}.\) 证明:在求和集合 $\{\vert k/n-x\vert \ge\delta\}$ 上,每个被加项都满足 $\frac{(k/n-x)^2}{\delta^2}\ge1$,故 \(\frac{1}{\delta^2}\sum_{\vert k/n-x\vert \ge\delta}\left(\frac kn-x\right)^2w_k\ \ge\ \sum_{\vert k/n-x\vert \ge\delta}w_k .\) 而左边求和至多等于对所有 $k$ 求和,即 $\le\frac{1}{\delta^2}\cdot\frac{x(1-x)}{n}$(用 L4)。(依据:$w_k\ge0$ 故扩大求和范围使和变大;L4)

定理(Bernstein 逼近定理,补充):若 $f\in C([0,1])$,则 $B_n(f)\to f$ 在 $[0,1]$ 上一致。 逐步推导

  1. 设 $\epsilon>0$。$f$ 在紧区间 $[0,1]$ 上连续,故一致连续(Lecture 21):$\exists\delta>0$ 使 $\vert u-v\vert \le\delta\Rightarrow\vert f(u)-f(v)\vert <\frac{\epsilon}{2}$。(依据:Lecture 21)
  2. $f$ 有界:令 $M=\sup_{[0,1]}\vert f\vert <\infty$(EVT,Lecture 21)。(依据:EVT)
  3. 由 L4,$\sum(k/n-x)^2w_k=\frac{x(1-x)}{n}\to0$ 一致地(对 $x$ 一致,界为 $\frac1{4n}$)。取 $N\in\mathbb{N}$ 使 $n\ge N$ 时 $\frac{1}{4n\delta^2}<\frac{\epsilon}{4M}$(设 $M>0$;若 $M=0$ 则 $f\equiv0$,$B_n(f)=0$ 结论平凡)。(依据:Archimedes 性质:$4n\delta^2>\frac{4M}{\epsilon}$ 当 $n>\frac{M}{\epsilon\delta^2}$;取 $N=\lceil \frac{M}{\epsilon\delta^2}\rceil$)
  4. 计算误差。注意由 L1,$\sum_k w_k=1$,故 $f(x)=f(x)\sum_kw_k=\sum_k f(x)w_k$: \(B_n(f)(x)-f(x)=\sum_{k=0}^{n}\Bigl(f\!\left(\frac kn\right)-f(x)\Bigr)w_k .\) (依据:$B_n(f)$ 的定义;L1;和的线性)
  5. 取绝对值并按 $\left\vert \frac kn-x\right\vert $ 是否小于 $\delta$ 分成两块(记 $A=\{k:\vert \frac kn-x\vert <\delta\}$,$A^c$ 为其补): \(\vert B_n(f)(x)-f(x)\vert \le\sum_{k\in A}\left\vert f\!\left(\frac kn\right)-f(x)\right\vert w_k+\sum_{k\in A^c}\left\vert f\!\left(\frac kn\right)-f(x)\right\vert w_k .\) (依据:三角不等式;$w_k\ge0$)
  6. 第一块:在 $A$ 上,$\vert \frac kn-x\vert <\delta$,由第 1 步 $\left\vert f(k/n)-f(x)\right\vert <\frac{\epsilon}{2}$,故第一块 $\le\frac\epsilon2\sum_{k\in A}w_k\le\frac\epsilon2\cdot1=\frac\epsilon2$。(依据:第 1 步;L1;$w_k\ge0$)
  7. 第二块:在 $A^c$ 上,$\left\vert f(k/n)-f(x)\right\vert \le\left\vert f(k/n)\right\vert +\vert f(x)\vert \le2M$,故第二块 $\le2M\sum_{k\in A^c}w_k\le2M\cdot\frac{1}{\delta^2}\cdot\frac{x(1-x)}{n}\le2M\cdot\frac{1}{4n\delta^2}$。(依据:$M$ 的定义;三角不等式;L5;L4)
  8. 由第 3 步,$n\ge N$ 时 $2M\cdot\frac{1}{4n\delta^2}<\frac{\epsilon}{2}$。(依据:第 3 步的取法 $\frac{1}{4n\delta^2}<\frac{\epsilon}{4M}$,两边乘 $2M$)
  9. 合并:$n\ge N$ 时对一切 $x\in[0,1]$,$\vert B_n(f)(x)-f(x)\vert <\frac\epsilon2+\frac\epsilon2=\epsilon$。(依据:第 5、6、7、8 步)
  10. 因此 $\sup_{x\in[0,1]}\vert B_n(f)(x)-f(x)\vert \le\epsilon$ 对一切 $n\ge N$ 成立,即 $B_n(f)\to f$ 一致。(依据:一致收敛定义;$N$ 只依赖 $\epsilon,f$,不依赖 $x$
  11. 一般区间 $[a,b]$:用线性变换 $u=\frac{x-a}{b-a}$ 归约到 $[0,1]$(见”核心定义”第(四)条)。(依据:连续双射下的 $\sup$ 相等)
    • 【证明机制解说】
      • ① 为什么 Bernstein 多项式”自然”? 它是把 $f$ 在等距采样点 $k/n$ 上的值按权重 $w_{n,k}(x)$ 加权平均,而权重在 $k/n\approx x$ 处最集中。换句话说,$B_n(f)(x)$ 是”以 $x$ 为中心的局部平均“——它是一个平滑算子:$B_n$ 不但逼近 $f$,还自动把 $f$ 抹平($B_n(f)$ 恒为多项式,故无穷次可导,哪怕 $f$ 只是连续)。这与源文件的 $Q_n$ 卷积是同一件事的离散版本。注意 $B_n$ 也不插值($B_n(f)(k/n)\ne f(k/n)$ 一般成立),它是”平均”而不是”穿过采样点”。
      • ② 方差界为什么是关键? 因为它是”权重集中”的定量形式。由 L5,落在 $\vert k/n-x\vert \ge\delta$ 之外的总权重被 $\frac{x(1-x)}{n\delta^2}\le\frac{1}{4n\delta^2}$ 控制——也就是”坏点”(离 $x$ 远的采样点)的总影响力随 $n$ 减小到 $0$。这正是大数定律的分析学化身:$\frac{S_n}{n}$ 偏离 $x$ 超过 $\delta$ 的概率 $\le\frac{1}{4n\delta^2}\to0$。如果方差界不成立(例如权重不集中),第二块就无法压小,逼近定理就失效。所以方差界是整条”局部平均”直觉的硬核心
      • ③ 为什么这里又一次需要一致连续? 因为要证的是 $\sup_{x}\vert B_n(f)(x)-f(x)\vert <\epsilon$——对所有的 $x$ 同时成立。第 6 步中,$\delta$ 必须能同时服务于所有 $x$:如果 $\delta$ 依赖 $x$(那是逐点连续性的语言),第 7 步的 $N$ 就会依赖 $x$,得不到一致收敛。(依据:第 1 步用的是”紧区间上连续 $\Rightarrow$ 一致连续”,这是 Lecture 21 的定理。)
      • ④ 与 Lecture 21 的呼应:本证明的两个关键工具——”紧集上连续 $\Rightarrow$ 一致连续”(第 1 步)和”紧集上连续 $\Rightarrow$ 有界且取到最值”(EVT,第 2 步)——都来自 Lecture 21。Lecture 21 用它们证明”连续 $\Rightarrow$ Riemann 可积”;本讲用它们证明”连续 $\Rightarrow$ 可被多项式一致逼近”。 同一个工具,两个方向完全不同的结论:一个说”连续函数积分得起来”,一个说”连续函数能被多项式逼近”。这是本课程”同一工具在不同战场反复出现”的又一个例证。
      • ⑤ 一个”反直觉”的点:$B_n(f)$ 只用了 $f$ 在 $n+1$ 个点上的值,却要逼近整条曲线。可能吗?可能,因为 $f$ 连续(一致连续)意味着它不能在这 $n+1$ 个点之间任意乱跳——采样点越密,$f$ 在整个区间上就被这些采样值”锁住”。这正是”连续”这一条件的力量:连续 = 局部信息可以外推。
    • 【证明技巧总结】构造局部平均算子 + 二项式恒等式算前三阶矩 + 方差界 $\Rightarrow$ 权重集中 + 一致连续处理中心区 + $\frac{2M}{\delta^2}\cdot\frac{1}{4n}$ 处理尾部“。提炼成两个可迁移的要点:(i)要证明”某个线性算子逼近恒等算子”,就检查它对 $1,x,x^2$ 的作用($B_n(1)=1$、$B_n(x)=x$、$B_n(x^2)=x^2+\frac{x-x^2}{n}\to x^2$)——这三个”矩条件”是逼近论的经典入口;(ii)“分块 + 定序”:先由目标函数取定 $\delta$,再由 $\delta$ 取定 $n$,最后两块各配 $\epsilon/2$。顺序一旦颠倒,证明立刻坍塌。

数值验算(Bernstein 三阶矩与方差,$n=5$,脚本核实)

from math import comb
n = 5
for x in [0.3, 0.5, 0.77]:
    w = [comb(n,k)*x**k*(1-x)**(n-k) for k in range(n+1)]
    print(f"x={x}")
    print("  sum w      =", sum(w),                        " 应为 1")
    print("  sum k w    =", sum(k*w[k] for k in range(n+1)),      f" 应为 n x = {n*x}")
    print("  sum k(k-1)w=", sum(k*(k-1)*w[k] for k in range(n+1)), f" 应为 n(n-1)x^2 = {n*(n-1)*x*x}")
    print("  sum k^2 w  =", sum(k**2*w[k] for k in range(n+1)),   f" 应为 nx(1-x)+n^2x^2 = {n*x*(1-x)+n*n*x*x}")
    print("  Var        =", sum((k/n-x)**2*w[k] for k in range(n+1)), f" 应为 x(1-x)/n = {x*(1-x)/n}", f" <= 1/(4n)={1/(4*n)}")

实际输出(节选):

x=0.3:  sum w = 0.9999999999999999
        sum k w       = 1.500000000000   应为 n x = 1.500000000000
        sum k(k-1) w  = 1.800000000000   应为 n(n-1)x^2 = 1.800000000000
        sum k^2 w     = 3.300000000000   应为 nx(1-x)+n^2x^2 = 3.300000000000
        Var           = 0.042000000000   应为 x(1-x)/n = 0.042000000000   <= 1/(4n)=0.050000000000
x=0.5:  sum k w       = 2.500000000000   应为 2.500000000000
        sum k(k-1) w  = 5.000000000000   应为 5.000000000000
        sum k^2 w     = 7.500000000000   应为 7.500000000000
        Var           = 0.050000000000   应为 0.050000000000   (此时取到最大值 1/(4n))
x=0.77: sum k w       = 3.850000000000   应为 3.850000000000
        sum k(k-1) w  = 11.858000000000  应为 11.858000000000
        sum k^2 w     = 15.708000000000  应为 15.708000000000
        Var           = 0.035420000000   应为 0.035420000000   <= 0.050000000000

数值验算($B_n(f)$ 对 $f(x)=x^2$ 的精确公式):由 L1、L2、L3’, \(B_n(x^2)(x)=\sum_k\left(\frac kn\right)^2w_k=\frac{1}{n^2}\Bigl(nx(1-x)+n^2x^2\Bigr)=x^2+\frac{x-x^2}{n}.\) (依据:L3’;代数化简)脚本核实:

for n in [3,5,10]:
    for x in [0.25,0.5,0.8]:
        B = sum(comb(n,k)*x**k*(1-x)**(n-k)*(k/n)**2 for k in range(n+1))
        pred = x*x + (x-x*x)/n
        print(f"n={n} x={x}: B_n(x^2)={B:.12f}  公式 x^2+(x-x^2)/n={pred:.12f}  差={B-pred:.2e}")

输出(差全为机器精度量级):

n=3 x=0.25: B=0.125000000000  公式=0.125000000000  差=0.00e+00
n=3 x=0.50: B=0.333333333333  公式=0.333333333333  差=0.00e+00
n=3 x=0.80: B=0.693333333333  公式=0.693333333333  差=0.00e+00
n=5 x=0.50: B=0.300000000000  公式=0.300000000000  差=5.55e-17
n=10 x=0.25: B=0.081250000000  公式=0.081250000000  差=1.39e-17
n=10 x=0.80: B=0.656000000000  公式=0.656000000000  差=0.00e+00

由 $B_n(x^2)(x)-x^2=\frac{x-x^2}{n}$,立刻得到精确的一致误差 \(\sup_{x\in[0,1]}\bigl\vert B_n(x^2)(x)-x^2\bigr\vert =\frac{1}{n}\sup_{x\in[0,1]}(x-x^2)=\frac{1}{4n}.\) (依据:$x-x^2=1/4-(x-1/2)^2$ 在 $x=1/2$ 取最大值 $1/4$)这给出一个可精确计算的收敛速度:取 $\epsilon=0.01$ 需要 $\frac{1}{4n}<0.01$,即 $n>25$,故 $n\ge26$。脚本核对:$n=25$ 时误差恰为 $0.01000000$(不满足严格小于),$n=26$ 时为 $0.00961538<0.01$。(注意:这是 $f(x)=x^2$ 这一个特殊函数的精确误差,不是逼近定理中一般 $f$ 的误差速度;一般情形只有”存在 $n$”,没有统一的 $O(1/n)$。)

Bernstein 权重的”钟形集中”($x=0.5$,脚本生成)

n=4,  x=0.5  最大权重 0.3750
  k=0  k/n=0.00  w=0.0625 ########
  k=1  k/n=0.25  w=0.2500 #################################
  k=2  k/n=0.50  w=0.3750 ##################################################
  k=3  k/n=0.75  w=0.2500 #################################
  k=4  k/n=1.00  w=0.0625 ########

n=10, x=0.5  最大权重 0.2461
  k=0  k/n=0.00  w=0.0010 
  k=1  k/n=0.10  w=0.0098 ##
  k=2  k/n=0.20  w=0.0439 #########
  k=3  k/n=0.30  w=0.1172 ########################
  k=4  k/n=0.40  w=0.2051 ##########################################
  k=5  k/n=0.50  w=0.2461 ##################################################
  k=6  k/n=0.60  w=0.2051 ##########################################
  k=7  k/n=0.70  w=0.1172 ########################
  k=8  k/n=0.80  w=0.0439 #########
  k=9  k/n=0.90  w=0.0098 ##
  k=10 k/n=1.00  w=0.0010 

n=20, x=0.5  最大权重 0.1762   ← 峰变矮变窄:质量向 k/n=0.5 集中
  k=4  k/n=0.20  w=0.0046 #
  k=6  k/n=0.30  w=0.0370 ##########
  k=8  k/n=0.40  w=0.1201 ##################################
  k=10 k/n=0.50  w=0.1762 ##################################################
  k=12 k/n=0.60  w=0.1201 ##################################
  k=14 k/n=0.70  w=0.0370 ##########
  k=16 k/n=0.80  w=0.0046 #

读图:$n$ 增大时权重分布的宽度按 $\sqrt{x(1-x)/n}$ 缩小(方差 $\propto1/n$),峰值高度 $\approx\frac{1}{\sqrt{2\pi n x(1-x)}}$ 也下降——总质量恒为 $1$,但越来越集中在 $x=0.5$ 附近。这就是”近似 delta”的离散图像。

Bernstein 逼近的实际误差($f(x)=\vert x-1/2\vert $,脚本核实)

n=  10  sup|B_n(f)-f| = 0.123047    (1/sqrt(n) = 0.316228)
n=  50  sup|B_n(f)-f| = 0.056138    (1/sqrt(n) = 0.141421)
n= 100  sup|B_n(f)-f| = 0.039795    (1/sqrt(n) = 0.100000)
n= 500  sup|B_n(f)-f| = 0.017832    (1/sqrt(n) = 0.044721)
n=1000  sup|B_n(f)-f| = 0.012613    (1/sqrt(n) = 0.031623)

注意收敛速度是 $O(1/\sqrt n)$ 量级(比 $x^2$ 情形的 $O(1/n)$ 慢),因为 $f(x)=\vert x-1/2\vert $ 在 $x=1/2$ 处不可导——多项式逼近光滑函数很快,逼近有”尖角”的函数就慢。这是逼近论里”光滑性决定逼近速度”的第一课。

Bernstein 恒等式的两条”移位”版本(供推导 $B_n(x)$ 与 $B_n(x^2)$ 用): \(B_n(1)=1,\qquad B_n(x)=x,\qquad B_n(x^2)=x^2+\frac{x-x^2}{n}.\) 推导 $B_n(x)=x$:由 L2,$B_n(x)(x)=\sum_k\frac kn w_k=\frac1n\cdot nx=x$。(依据:L2)这两条说明”Bernstein 算子至少在 $1$ 与 $x$ 上精确”——这是逼近论里”矩条件”的典型样子。

补充数值验算:源文件 $Q_n$ 核与卷积 $P_n$

按父任务建议,补一组对源文件路线($Q_n$ 与 $P_n$)本身的数值验算,以与上面的 Bernstein 路线互为印证。

(1)$c_n<\sqrt n$ 与归一化 $\int_{-1}^1Q_n=1$

from fractions import Fraction as F
import math
def integ(n):                    # ∫_{-1}^{1}(1-x^2)^n dx = 2*(2n)!!/(2n+1)!!
    num=1; den=1
    for k in range(1,n+1): num*=2*k
    for k in range(1,n+1): den*=2*k+1
    return F(2*num,den)
for n in [1,5,10,50,100,1000]:
    I=integ(n); c=1/I
    print(f"n={n:5d}: int={float(I):.8e}  c_n={float(c):.8f}  sqrt(n)={math.sqrt(n):.4f}  c_n<sqrt(n)? {c<math.sqrt(n)}")

输出:

n=    1: int=1.33333333e+00  c_n=0.75000000  sqrt(n)=1.0000  c_n<sqrt(n)? True
n=    5: int=7.38816739e-01  c_n=1.35351562  sqrt(n)=2.2361  c_n<sqrt(n)? True
n=   10: int=5.40520367e-01  c_n=1.85006905  sqrt(n)=3.1623  c_n<sqrt(n)? True
n=   50: int=2.48802236e-01  c_n=4.01925649  sqrt(n)=7.0711  c_n<sqrt(n)? True
n=  100: int=1.76584159e-01  c_n=5.66302214  sqrt(n)=10.0000  c_n<sqrt(n)? True
n= 1000: int=5.60289044e-02  c_n=17.84793065  sqrt(n)=31.6228  c_n<sqrt(n)? True

读法:$c_n$ 确实始终小于 $\sqrt n$(定理 283 性质 3 的证明所依赖的估计)。并且 $c_n/\sqrt n\to1/\sqrt\pi=0.5641896$($n=100$ 时 $0.5663$,$n=1000$ 时 $0.5644$)——这说明 $c_n<\sqrt n$ 这个界量级正确,只差一个常数 $\sqrt\pi$。

(2)尾部一致塌缩:取 $\delta=0.5$,验证 $\sup_{\delta\le\vert x\vert \le1}Q_n(x)\to0$(即 $\sqrt n(1-\delta^2)^n\to0$):

d=0.5
for n in [10,100,1000,10000]:
    print(f"delta={d}, n={n:6d}: sqrt(n)(1-d^2)^n = {math.sqrt(n)*(1-d*d)**n:.6e}"
          f"   sup_{{|x|>=d}} Q_n <= 这个值")

输出(注意 $Q_n$ 的最大值在 $\vert x\vert =\delta$ 处取到,等于 $c_n(1-\delta^2)^n<\sqrt n(1-\delta^2)^n$):

delta=0.5, n=    10: sqrt(n)(1-d^2)^n = 1.780790e-01
delta=0.5, n=   100: sqrt(n)(1-d^2)^n = 3.207202e-12
delta=0.5, n=  1000: sqrt(n)(1-d^2)^n = 3.641358e-124
delta=0.5, n= 10000: sqrt(n)(1-d^2)^n = 0.000000e+00

更细致地看不同 $\delta$($\delta$ 越小、塌缩越慢,这正是证明中”$\delta$ 由 $f$ 的一致连续性固定后,$n$ 再取得足够大”的必要性):

delta=0.10: n=10:2.860e+00  n=100:3.660e+00  n=1000:1.365e-03  n=10000:2.249e-42
delta=0.25: n=10:1.658e+00  n=100:1.574e-02  n=1000:2.960e-27  n=10000:5.161e-279
delta=0.50: n=10:1.781e-01  n=100:3.207e-12  n=1000:3.641e-124  n=10000:0.000e+00

注意 $\delta=0.1$ 那一行 $n=10,100$ 时该值仍 $>1$(不是单调下降的),但 $n=1000$ 之后已经塌到 $10^{-3}$,$n=10^{4}$ 时是 $10^{-42}$。这就是”极限为 $0$”与”前几步很大”完全可以共存——证明里必须等到 $n\ge M$ 才开始断言 $<\epsilon$。

(3)对具体 $f$ 计算 $P_n(x)=\int_0^1f(t)Q_n(t-x)dt$ 与 $f(x)$ 的差。 取 $f(t)=t(1-t)$(在 $[0,1]$ 两端点为 $0$,正符合源文件归约后的特殊情形;由第 12 步,一般 $f$ 可由此加回线性项)。用细梯形法($20001$ 个节点)数值积分:

def Qn(u,n,c):  return 0.0 if abs(u)>=1 else c*(1-u*u)**n
def Pn(x,n,c,N=20001):
    h=1.0/(N-1); s=0.0
    for i in range(N):
        t=i*h; w = 0.5 if (i==0 or i==N-1) else 1.0
        s += w*Qn(t-x,n,c)*t*(1-t)
    return s*h
for n in [10,20,50,100]:
    c=float(1/integ(n))
    e=max(abs(Pn(x,n,c)-x*(1-x)) for x in [0.1,0.25,0.5,0.75,0.9])
    print(f"n={n:4d}: P_n(0.5)={Pn(0.5,n,c):.8f} (f=0.25)  网格上最大误差={e:.6e}")

输出(误差随 $n$ 稳定下降,这正是 $P_n\to f$ 一致的数值证据):

n=  10: P_n(0.1)=0.09902441 (f=0.09000000) | P_n(0.5)=0.20726618 (f=0.25) | 网格最大误差=4.273382e-02
n=  20: P_n(0.1)=0.09392425 (f=0.09000000) | P_n(0.5)=0.22676197 (f=0.25) | 网格最大误差=2.323803e-02
n=  50: P_n(0.1)=0.08896466 (f=0.09000000) | P_n(0.5)=0.24029126 (f=0.25) | 网格最大误差=9.708737e-03
n= 100: P_n(0.1)=0.08763097 (f=0.09000000) | P_n(0.5)=0.24507389 (f=0.25) | 网格最大误差=4.926108e-03

注意 $P_n$ 是”平滑”的:$f(0.1)=0.09$ 而 $P_{100}(0.1)=0.08763$,误差比 $x=0.5$ 处($0.25$ 对 $0.24507$)大——因为 $x=0.1$ 靠近端点,卷积核的另一半落在 $[0,1]$ 之外(那里 $f$ 已被延拓为 $0$),核质量失衡,误差自然更大。这也解释了为什么源文件要把 $f$ 延拓到 $\mathbb{R}$ 并采用”端点处 $f=0$”的归约:卷积核必须能自由地越过端点采样,才能让误差估计在端点附近也成立。

定理 282 的意义与应用

  • (意义一:多项式在连续函数空间中稠密) 引入一致范数 (uniform norm) \(\vert f\vert _{[a,b]}:=\sup_{x\in[a,b]}\vert f(x)\vert .\) (这是 Lecture 24 的 Remark 269 之前提到的记号,教材 [JL] Exercise 6.1.1 正是练习它的三角不等式)则 Weierstrass 定理的结论可写成:$\vert P_n-f\vert _{[a,b]}\to0$。也就是说:对任意 $f\in C([a,b])$ 与任意 $\epsilon>0$,多项式集合 $\mathcal{P}$ 中存在 $P$ 使 $\vert f-P\vert _{[a,b]}<\epsilon$。 用拓扑语言说:多项式全体在 $(C([a,b]),\vert \cdot\vert _{[a,b]})$ 中稠密 (dense)——与”$\mathbb{Q}$ 在 $\mathbb{R}$ 中稠密”是同一个词!这两件事有惊人的相似性:
    • $\mathbb{Q}$ 稠密:任何实数都能被有理数任意逼近;
    • 多项式稠密:任何连续函数都能被多项式一致逼近。 两个”稠密”都说明了”用简单对象可以逼近复杂对象“这一分析学的中心主题。
  • (意义二:数值分析的基础) 计算机只会做有限次加乘(多项式),不会做”取极限”。Weierstrass 定理保证了:只要函数连续,我们就可以放心地用有限次加乘去近似它——这是数值积分、插值、函数求值、图形渲染等一切数值方法的合法性来源。Bernstein 多项式路线尤其贴心:它只用到 $f$ 在 $n+1$ 个点上的值,且 $B_n(f)$ 始终被 $\min f$ 与 $\max f$ 夹住(因为权重非负归一的凸组合),完全不会像高次插值那样剧烈震荡(Runge 现象)。这正是 Bézier 曲线在计算机图形学中采用 Bernstein 基的原因。
  • (意义三:它是”稠密性论证 (density argument)”的原型——以 Lecture 22 的 Riemann–Lebesgue 引理为例) (请注意:Riemann–Lebesgue 引理本身属于 Lecture 22(其 Lemma 254),不是本讲内容;此处只把它当作一个”用到 Weierstrass 逼近思想”的应用举例。) Lecture 22 的 Riemann–Lebesgue 引理假设 $f$ 连续可微($f^{\prime}\in C([-\pi,\pi])$),证明中用了分部积分——分部积分需要 $f^{\prime}$ 存在。若 $f$ 只是连续,这条引理怎么办?标准做法正是 Weierstrass 定理:取多项式 $P$ 使 $\vert f-P\vert <\epsilon$,对多项式处理(多项式当然可微),再用三角不等式把误差转移,最后让 $\epsilon\to0$。这就是”先把一般情形化归到好情形,再取极限回去”的典型(density argument,稠密性论证)——它展示了 Weierstrass 定理作为一种通用工具的用法,而不是本讲的一个结论。
  • (意义四:名字的巧合——Weierstrass 在这门课出现两次) 本课程中 Weierstrass 的名字出现在两个截然不同的结果里:
    • Lecture 18 的 Theorem 210(Weierstrass):函数 $f(x)=\sum_{k=0}^{\infty}\frac{\cos(160^kx)}{4^k}$ 处处连续但处处不可微(nowhere differentiable)。这是对”连续性是否蕴含可微性”(Lecture 18 的核心问题)的否定回答,由”aka the Godfather”(源文件原话)给出的病态函数。
    • 本讲 Theorem 282(Weierstrass Approximation Theorem):连续函数可被多项式一致逼近。 两个结果看似方向相反,其实共同刻画了”连续”这一概念的丰富性
    • 逼近定理说:连续函数局部上看起来像多项式(就一致范数而言,离多项式要多近有多近);
    • 病态函数说:连续函数整体上可以完全不像任何光滑函数(逐点都不可微)。 两者并不矛盾,因为”一致逼近”只控制函数值的差,完全不控制导数。$f$ 可以被多项式列 $\{P_n\}$ 一致逼近,同时 $P_n^{\prime}$ 的震荡越来越剧烈,以至于极限 $f$ 处处没有导数。这正是”一致范数看不见导数”的深刻教训:记忆中”逼近得好 $\Rightarrow$ 性质好”是错的;一致收敛(Theorem 274)只保证连续性,不保证可微性(这正与 Theorem 277 额外要求 $f_n^{\prime}$ 一致收敛相呼应)。
  • (意义五:与 Lectures 23–24 的闭环) 本讲的整体结构是一个漂亮的闭环:
    • Lecture 23 提出问题:幂级数的和函数是否连续/可导/可积?(Question 262)
    • Lecture 24 提供工具:一致收敛 + M-判别法 + 三条交换定理。
    • Lecture 25(本讲)收口:幂级数在紧子区间上一致收敛(Theorem 278)$\Rightarrow$ 交换定理可用 $\Rightarrow$ 和函数无穷次可导(Theorem 279 + Remark 280)$\Rightarrow$ 是 Taylor 级数、展开唯一。
    • 然后反向提问:”多项式的极限能表示什么?” 得到 Weierstrass 定理:能表示一切连续函数“从幂级数到任意连续函数”——这就是本课程最后一步的跨度。

整门课的依赖链总图(收束)

Lecture 1–2   实数系与 LUB(最小上界性质)、Archimedes 性质
        │
        ▼
Lecture 4–8   序列、极限、子列、Cauchy 列、Bolzano–Weierstrass、limsup/liminf
        │
        ▼
Lecture 10–13 级数:几何级数、比较判别法、比值/根值/交错判别法、
        │    绝对收敛、重排                       ← 本讲算收敛半径用的就是这一层
        ▼
Lecture 14–17 开集/闭集、紧性、连通性
        │
        ▼
Lecture 18–21 连续:连续性、最值定理 EVT、介值定理 IVT、
        │    一致连续(紧区间上连续 ⇒ 一致连续)   ← Weierstrass 证明的两个直接依赖
        ▼
Lecture 20    可微:中值定理、Taylor 定理(带余项!)
        │                                        ← 与 Remark 280 遥相呼应
        ▼
Lecture 21–22 Riemann 积分、FTC、换元、分部积分(Riemann–Lebesgue 引理属 Lecture 22)
        │                                        ← Theorem 279/282 都靠 FTC 与换元
        ▼
Lecture 23    函数列的逐点收敛、一致收敛的定义、幂级数的定义与收敛半径
        │
        ▼
Lecture 24    一致收敛的三条交换定理(连续 / 积分 / 求导)、Weierstrass M-判别法
        │
        ▼
Lecture 25 ★  幂级数在紧子区间上一致收敛 → 逐项求导/逐项积分 → a_n = f^(n)(x₀)/n!
              → 展开唯一(幂级数 = Taylor 级数)
              → Weierstrass 逼近定理(Bernstein 或 Q_n 卷积)
              → 多项式在 C([a,b]) 中稠密

主线一句话:
  LUB → 序列 → 极限 → 连续 → 可微 → 积分 → 一致收敛 → 逼近
   ("集合与证明"(Lecture 1)走到"用多项式逼近任意连续函数"(Lecture 25))

与教材的对应

  • 对应 [JL] §6.1 “Pointwise and uniform convergence”(幂级数一致收敛所需的语言)
    • Definition 6.1.1(逐点收敛)、Definition 6.1.6(一致收敛)——本讲所有”一致”陈述的语言基础(对应本课 Lecture 23 的 Definition 263/264)。
    • Proposition 6.1.5(逐点收敛的 $\epsilon$-$N$ 重述)——本讲”常见误区”里量词顺序问题的教材依据。
    • 6.1.3 节 “Convergence in uniform norm” 引入一致范数 $\vert f\vert _{[a,b]}$——正是本节”意义一”中”多项式稠密”的范数语言。
    • Exercise 6.1.1(一致范数的三角不等式 $\vert f+g\vert \le\vert f\vert +\vert g\vert $)——本讲”意义一”用到这个范数时的合法性依据。
    • Exercise 6.1.2(求 $e^{x/n}/n$ 的逐点极限,并问在 $\mathbb{R}$ 上、在 $[0,1]$ 上是否一致)——练”一致 vs 逐点”的判定,与本讲 Question 273 的三个反例同型。
    • Exercise 6.1.5(若 $f_n\to f$、$g_n\to g$ 一致,则 $f_n+g_n\to f+g$ 一致)——这是 Assignment 12 第 5 题,见下。
  • 对应 [JL] §6.2 “Interchange of limits”
    • §6.2.1 连续性(对应本讲 Theorem 274)、§6.2.2 积分(Theorem 275)、§6.2.3 求导(Theorem 277)。
    • §6.2.4 “Convergence of power series” 正是本讲 Theorem 278–279 与 Remark 280:幂级数在紧子区间一致收敛、可逐项求导、可逐项积分。
    • §6.2.5 Exercises:其中 Exercise 6.2.x 一类练习逐项求导/积分的合法性,与本讲”常见误区”中”忘了先检查一致收敛就逐项求导”的错误对应。
  • 对应 OCW Assignment 7(Reading Sections 2.5, 2.6, 3.1)
    • 第 2 题(本讲核心练习):”Find all real numbers $x$ so that the series converges.” 四小问: (a) $\sum_{n=0}^{\infty}2^nx^n$ —— 收敛半径 $p=1/2$,两端点都发散,收敛域 $(-1/2,1/2)$; (b) $\sum_{n=0}^{\infty}nx^n$ —— $p=1$,两端点都发散,收敛域 $(-1,1)$; (c) $\sum_{n=0}^{\infty}\frac{(x-10)^n}{(2n)!}$ —— $p=\infty$,收敛域 $\mathbb{R}$; (d) $\sum_{n=0}^{\infty}n!\,x^n$ —— $p=0$,收敛域 $\{0\}$。 这题练的是”算 $p$ + 单独讨论端点”这一标准流程(本笔记”核心定义”第(二)条已全部做完并数值验算)。
    • 第 3 题(Cauchy–Schwarz 不等式)——与本讲不直接相关,但它是”用 $\sum\vert x_n\vert ^2$ 这类二次量做估计”的技法,与本讲 Chebyshev 型方差估计精神相通。
  • 对应 OCW Assignment 12(Reading: The Riemann Integral lecture notes, Section 6.1)
    • 第 5 题 = Exercise 6.1.5:设 $\{f_n\},\{g_n\}$ 在集合 $A$ 上一致收敛到 $f,g$,证明 $f_n+g_n$ 在 $A$ 上一致收敛到 $f+g$。该题练的是”一致收敛的 $\epsilon/2$ 相加”这一最基本的操作:$\forall\epsilon>0$ 取 $N=\max\{N_1(\epsilon/2),N_2(\epsilon/2)\}$,则 $n\ge N$ 时 $\vert (f_n+g_n)-(f+g)\vert \le\vert f_n-f\vert +\vert g_n-g\vert <\epsilon/2+\epsilon/2=\epsilon$,且 $N$ 不依赖 $x$。这正是本讲 Theorem 274、279 里反复出现的”$\epsilon/2$ 或 $\epsilon/3$ 配平”技巧的练习版。
    • 第 4 题 = Exercise 6.1.2($e^{x/n}/n$ 的逐点/一致极限)——与 Assign. 12 同卷出现,说明本讲内容与 §6.1 的练习是配套的。
    • 第 1(a) 题($\int_a^bf=0$、$f\ge0$ 连续 $\Rightarrow f\equiv0$)——用到 Lecture 21–22,与本讲 Theorem 275(积分交换)同属”积分与函数性质相互作用”的一族。
  • 对应 OCW Midterm 第 5(b) 题(本讲题目的”预热版”):”Find all real numbers $x$ such that the series converges. Find all real numbers $x$ such that the series converges absolutely.” (i) $\sum_{n=0}^{\infty}\frac{(-1)^n}{2020^n}(x-10)^n$;(ii) $\sum_{n=0}^{\infty}\frac{n!}{n^n}x^n$。
    • (i) 是几何型:系数绝对值 $2020^{-n}$,$p=2020$,收敛域 $10-2020<x<10+2020$,两端点($\vert x-10\vert =2020$)通项为 $(\mp1)^n\not\to0$,发散;绝对收敛域同为开区间。
    • (ii) 用比值法:$\frac{\vert u_{n+1}\vert }{\vert u_n\vert }=\frac{(n+1)!/(n+1)^{n+1}}{n!/n^n}\vert x\vert =\left(\frac{n}{n+1}\right)^n\vert x\vert \to\frac{\vert x\vert }{e}$,故 $p=e$;在 $\vert x\vert =e$ 处利用 $\left(\frac{n}{n+1}\right)^n\nearrow e^{-1}$,通项不趋于 $0$,发散。这题说明”比值极限可以是 $e$ 这样的超越数”,也说明”$\vert x\vert =p$ 时必须单独分析”这条规则的普适性。
  • 对应 OCW Final(综合)
    • 第 5(a) 题:”Let $R>0$. Prove that for all $x\in[-R,R]$, $\left\vert e^x-\sum_{j=0}^{n}\frac{x^j}{j!}\right\vert \le\frac{e^RR^{n+1}}{(n+1)!}$。” 这是幂级数展开 + 余项估计的题:它本质上要你先证明 $e^x=\sum x^j/j!$($p=\infty$),再给出带余项的定量误差。本讲 Remark 280 说明”若可展成幂级数,则一定是 Taylor 级数”,但保证余项速度;这个题是 Lecture 20 的 Taylor 定理(带余项)与本讲幂级数理论的一次合流。
    • 第 5(b) 题:$f(x)=f(c)+f^{\prime}(c)(x-c)+\int_c^xf^{\prime\prime}(t)(x-t)dt$——Taylor 定理的积分余项形式(Hint:用”parts”结尾的定理 = 分部积分)。与本讲 Remark 280 的”幂级数版 Taylor”形成对照(那里余项自动为 $0$,这里余项是显式积分)。
    • 第 7(a) 题:”给出一个 $(0,1)$ 上连续函数列逐点收敛到连续函数但不一致收敛的显式例子。” 这正是本讲 Question 273 主题的反面(本讲给的例子是”极限不连续”或”积分不交换”);一个标准答案是 $f_n(x)=x^n$ 限制在 $(0,1)$ 上(逐点趋 $0$,但 $\sup_{(0,1)}\vert f_n\vert =1$ 不趋 $0$)。这题直接练本讲”逐点 $\ne$ 一致”这一核心区分。
    • 第 7(b) 题:由 $\vert f^{\prime}\vert \le L$ 证 Lipschitz 连续,并证 $f_n(x)=f(x+1/n)$ 在 $\mathbb{R}$ 上一致收敛到 $f$。这题是”用一致连续性/Lipschitz 性把 $n\to\infty$ 的误差一次性压住”的练习,与本讲 Bernstein 证明第 1 步(一致连续取 $\delta$)和第 3 步(取 $N$)的机制完全同构:$\vert f(x+1/n)-f(x)\vert \le L/n$ 对所有 $x$ 同时成立,故 $\sup_{\mathbb{R}}\vert f_n-f\vert \le L/n\to0$。
    • 第 6(b)(c) 题($\lim\int_0^1x^n\sin x\,dx=0$、$\lim\int_{-\pi}^{\pi}\sin(nx)f(x)dx=0$)——这属于 Lecture 22 的 Riemann–Lebesgue 引理一族(该引理不属于本讲),但正如本讲”意义三”所说:把 $f$ 从 $C^1$ 放宽到 $C$ 的典型手段就是 Weierstrass 逼近。这是一道”用本讲定理去补另一讲的缺口”的综合题。

与其他讲次的关联

  • 直接依赖 Lecture 23(幂级数的定义与收敛半径):本讲全部结论都以 Lecture 23 的 Definition 258(幂级数)、Theorem 259($R=\lim\vert a_m\vert ^{1/m}$、$p=1/R$)、Definition 260(收敛半径)为出发点。Theorem 278 的证明第 2 步明确使用了”$p^{-1}=\lim\vert a_j\vert ^{1/j}$”这一条来自 Lecture 23 的假设。
  • 直接依赖 Lecture 24(一致收敛 + M-判别法 + 三条交换定理):Theorem 278 的最后一击是 Weierstrass M-判别法 (Theorem 268);Theorem 279 的求导部分用 Theorem 277、积分部分用 Theorem 275;而 Theorem 274(连续性)在本讲开头被重新证明(源文件第 65–80 行)作为整章的原型。没有 Lecture 24,本讲一个字都推不动。
  • 直接依赖 Lecture 12(比值判别法与根值判别法):Theorem 278 证明中”$\sum\vert a_j\vert r^j$ 收敛”用的是根值判别法 (Theorem 142);Theorem 279 求导部分”$\sum j\rho^{j-1}$ 收敛”用的是比值判别法 (Theorem 138);Theorem 283 中”$\sqrt n(1-\delta^2)^n\to0$”也是根值判别法式的推理。本讲是 Lecture 12 的三个判别法在”函数级数”层次上的总演习。
  • 依赖 Lecture 21(紧区间上连续 $\Rightarrow$ 一致连续;EVT):Weierstrass 定理(两条路线都)用到了”$f\in C([a,b])$ 一致连续”(取 $\delta$)与”$C=\sup\vert f\vert <\infty$”(控尾部)。这与 Lecture 21 证明”连续 $\Rightarrow$ Riemann 可积”用的是同一个工具,是本课程”一器多用”的最佳例证。
  • 依赖 Lecture 22(FTC、积分绝对值不等式、换元):Theorem 279 的积分公式靠 FTC 与换元;Theorem 277 的证明靠 FTC 把求导归约成积分;Theorem 282 中 $Q_n$ 卷积的对称化靠换元 $u=t-x$。
  • 依赖 Lecture 20(可微性、Taylor 定理)Remark 280 是 Lecture 20 的 Taylor 定理的”幂级数版”:那里的余项 $R_n$ 必须单独估计,这里的”余项”是级数尾项、自动可忽略。本讲正是把 Taylor 定理中”余项”这一最麻烦的部分彻底解决掉的一讲。
  • 向前呼应 Lecture 18(Weierstrass 处处连续处处不可微函数):见上文”意义四”。这两个 Weierstrass 结果一起说明:一致逼近不控制导数,因此”连续的病态性”与”逼近的可行性”完全可以共存。
  • 为后续课程([JL] 第二卷 §11.3、§11.7)铺路:本讲的”幂级数 $\Rightarrow$ 解析函数 (analytic function)”是复分析与解析数论的开端;”Weierstrass 逼近 $\Rightarrow$ Stone–Weierstrass 定理”是泛函分析中逼近论的主定理。
  • 收束句(整门课):本课程从 Lecture 1 的集合与证明出发,经由 LUB(最小上界性质)→ 序列与极限 → 连续 → 可微 → 积分 → 函数列与一致收敛,最终抵达 Lecture 25 的逼近每一个连续函数都是多项式的极限。 这条主线可以用一句话概括:分析学的工作就是把”无穷”换成”可控的有限”,而本讲给出的收尾答案是——连”连续”这么一般的对象,也能被”多项式”这么具体的对象从有限步内逼近。

关键要点

  1. 收敛半径三分性:若 $\sum_j a_j(x-x_0)^j$ 的收敛半径为 $p$,则 $\vert x-x_0\vert <p$ 时绝对收敛、$\vert x-x_0\vert >p$ 时发散、$\vert x-x_0\vert =p$ 时必须单独判断。三种特例:$p=\infty$(处处收敛,如 $\sum(x-10)^n/(2n)!$)、$0<p<\infty$(如 $\sum nx^n$,$p=1$)、$p=0$(只在中心收敛,如 $\sum n!x^n$)。Assignment 7 第 2 题的四个答案就是这四个数字:$1/2,\ 1,\ \infty,\ 0$。
  2. 幂级数在紧子区间上一致收敛(Theorem 278):$\forall r\in(0,p)$,$\sum_j a_j(x-x_0)^j$ 在 $[x_0-r,x_0+r]$ 上一致收敛。证明三件套:”收缩到 $\vert x-x_0\vert \le r$ 取 $M_j=\vert a_j\vert r^j$ + $r<p$ 保证 $\sum M_j$ 收敛(根值判别法)+ M-判别法”。$r<p$ 严格不能放宽为 $r\le p$(反例:$\sum x^n/n$ 在 $[0,1]$ 上不一致收敛,$\sup_{[0,1]}\vert S_{2m}-S_m\vert \ge1/2$)。
  3. 幂级数的三条交换定理(Theorem 279):在 $(x_0-p,x_0+p)$ 内,幂级数的和函数连续可逐项积分可逐项求导,且 \(\frac{d}{dx}\sum_{j\ge0}a_j(x-x_0)^j=\sum_{j\ge1}j\,a_j(x-x_0)^{j-1},\qquad \int_a^b\sum_{j\ge0}a_j(x-x_0)^j\,dx=\sum_{j\ge0}\frac{a_j}{j+1}\bigl[(b-x_0)^{j+1}-(a-x_0)^{j+1}\bigr],\) 求导与积分都不改变收敛半径 $p$(理由:收敛半径只由 $\lim_j\vert a_j\vert ^{1/j}$ 决定,而 $j$ 或 $1/(j+1)$ 这类多项式因子的 $j$ 次根趋于 $1$)。
  4. 幂级数 = Taylor 级数(Remark 280:$f(x)=\sum_{j\ge0}a_j(x-x_0)^j\Rightarrow f$ 在收敛区间内无穷次可导,且 \(a_j=\frac{f^{(j)}(x_0)}{j!}\qquad(j\ge0).\) 推论:展开唯一——同一个函数在同一个中心的幂级数展开至多只有一个。这是”写幂级数展开”这一操作的全部合法性所在。
  5. Weierstrass 逼近定理(Theorem 282):$\forall f\in C([a,b])\ \exists\{P_n\}$ 多项式使 $P_n\to f$ 一致;等价地 $\forall\epsilon>0\ \exists$ 多项式 $P$ 使 $\vert f-P\vert _{[a,b]}<\epsilon$,即多项式在 $(C([a,b]),\vert \cdot\vert _{[a,b]})$ 中稠密。证明机制:”归一 + 非负 + 集中的核 + 一致连续处理中心区 + 尾部塌缩处理远处 + 各配 $\epsilon/2$”。源文件用 $Q_n=c_n(1-x^2)^n$ 卷积($c_n<\sqrt n$、$\sqrt n(1-\delta^2)^n\to0$);补充路线用 Bernstein 多项式(方差 $\frac{x(1-x)}{n}\le\frac1{4n}$)。
  6. 一句收束LUB → 序列 → 极限 → 连续 → 可微 → 积分 → 一致收敛 → 逼近;本讲是这条链的终点:从”集合与证明”(Lecture 1)到”用多项式逼近任意连续函数”(Lecture 25)

常见误区与注意事项

  • 【误区 1】把”收敛半径”的定义当成”收敛域”。错误做法:算出 $p=1$ 就写”收敛域是 $[x_0-1,x_0+1]$”。为什么错:Theorem 259 只在 $\vert x-x_0\vert <p$ 与 $>p$ 时表态,端点处毫无信息。正确做法:算出 $p$ 后必须逐个检查端点(代入 $x=x_0\pm p$,看通项是否趋于 $0$、是否绝对收敛)。反例:$\sum x^n/n$ 与 $\sum x^n/n^2$ 的 $p$ 都是 $1$,但前者的收敛域是 $[-1,1)$、后者是 $[-1,1]$。
  • 【误区 2】把 Theorem 278 的”$r<p$”写成”$r\le p$”,或声称幂级数在收敛区间上一致收敛。错误做法:直接用 M-判别法取 $M_n=\vert a_n\vert p^n$,然后”由 $\sum\vert a_n\vert p^n$ 收敛”……但这最后一句可能就是错的。正确做法:只对 $r<p$ 断言一致收敛;要判断整个闭区间 $[x_0-p,x_0+p]$ 上是否一致收敛,必须另证 $\sum\vert a_n\vert p^n<\infty$ 或直接估计 $\sup$ 与尾项的差。反例:$\sum x^n/n$ 在 $[0,1]$ 上不一致收敛(块差 $\ge1/2$),尽管它在每个 $[0,r]$($r<1$)上一致收敛。这个误区的根源是把”局部性质”误当成”整体性质”。
  • 【误区 3】逐项求导/积分时忘记先验证一致收敛。错误做法:看到 $\sum x^n/n^2$ 就直接写”导数 $=\sum x^{n-1}/n$,在 $x=1$ 处收敛”——错,$\sum 1/n$ 发散。正确做法:只在 $\vert x-x_0\vert <p$ 的内部做逐项运算(那里由 Theorem 278 保证一致收敛);在端点处逐项求导后的级数可能有不同的收敛行为(本例中求导后 $p$ 仍是 $1$,但在 $x=1$ 处新级数发散)。记忆法则:Theorem 279 的结论只在开区间 $(x_0-p,x_0+p)$ 内成立。
  • 【误区 4】把”幂级数一致收敛”与”函数列一致收敛”的量词顺序混淆。错误做法:写”$\forall x\ \exists N\ \forall n\ge N\ \forall\epsilon$”($N$ 依赖 $x$)。正确做法:$\forall\epsilon>0\ \exists N\ \forall n\ge N\ \forall x\in S$,$\vert f_n(x)-f(x)\vert <\epsilon$——$N$ 只能依赖 $\epsilon$(在幂级数情形还可以依赖 $r$,因为定理是对每个固定 $r$ 分别断言的,但不能依赖 $x$)。这和 Weierstrass 逼近里”多项式 $P$ 只依赖 $\epsilon$、不依赖 $x$”是同一件事。
  • 【误区 5】以为”一致逼近”能传递可导性/导数信息。错误做法:由 $P_n\to f$ 一致推出 $P_n^{\prime}\to f^{\prime}$ 或”$f$ 可微”。为什么错:一致范数只控制函数值的差,完全不管导数(导数是差商的极限,涉及两个点的信息)。反例:Lecture 18 的 Weierstrass 函数处处连续、处处不可微,但它当然可被多项式一致逼近(Theorem 282);这直接说明”一致逼近不蕴含可微”。要传递导数,必须像 Theorem 277 那样额外假设 $f_n^{\prime}$ 一致收敛。
  • 【误区 6】用”系数被 $f$ 唯一决定”去断言”任意 $C^\infty$ 函数都等于它的 Taylor 级数”。为什么错:Remark 280 的前提是”$f$ 已经等于一个幂级数”,结论是这个幂级数若存在则唯一。它断言每个无穷次可导函数的 Taylor 级数都收敛到它自己(经典反例 $f(x)=e^{-1/x^2}$($x\ne0$)、$f(0)=0$ 的 Taylor 级数在 $0$ 处恒为 $0\ne f$)。正确做法:区分”解析函数(等于自己的 Taylor 级数)”与”仅 $C^\infty$ 的函数”;本讲只处理前者。
  • 【误区 7】Weierstrass 逼近证明中”先取 $n$ 再取 $\delta$”。为什么错:$\delta$ 依赖 $n$ 时,尾部的界 $\frac{2M}{\delta^2}\cdot\frac1{4n}$ 就不能保证趋于 $0$($\delta$ 可能随 $n$ 变得很小,把界顶回去)。正确做法:先由 $f$ 的一致连续性取定 $\delta$(只依赖 $\epsilon$ 与 $f$),再由 $\delta,\epsilon,M$ 取定 $n$;顺序不可交换。这与”一致收敛定义中 $N$ 不能依赖 $x$”是同一种顺序纪律。
  • 【误区 8】把 Bernstein 多项式当成插值多项式。为什么错:$B_n(f)(k/n)\ne f(k/n)$ 一般成立:例如 $f(x)=x^2$、$n=2$、$x=1$,$B_2(f)(1)=1$(巧合相等);但 $x=1/2$ 时 $B_2(f)(1/2)=0.375\ne0.25$。正确认识:$B_n$ 是局部平均算子,它保证整体一致逼近,不保证逐点插值;反过来它有一个插值不具备的稳定性:$\min f\le B_n(f)\le\max f$(凸组合)。

思考题(带答案)

Q1. 求幂级数 \(\sum_{n=1}^{\infty}\frac{n^2}{3^n}\bigl(x+2\bigr)^{n}\) 的收敛半径,并求它的收敛域(即所有使级数收敛的实数 $x$)。

答案 **第一步:找出中心与系数。** 这是关于 $x_0=-2$ 的幂级数,系数 $a_n=\\frac{n^2}{3^n}$($n\\ge1$)。 **第二步:用比值判别法算收敛半径 $p$。** 对固定 $x$,设 $u_n=\\frac{n^2}{3^n}(x+2)^n$。由 Lecture 12 的 Theorem 138, $$\frac{\vert u_{n+1}\vert }{\vert u_n\vert }=\frac{(n+1)^2}{3^{n+1}}\cdot\frac{3^n}{n^2}\cdot\vert x+2\vert =\left(\frac{n+1}{n}\right)^2\frac{\vert x+2\vert }{3}\longrightarrow\frac{\vert x+2\vert }{3}.$$ (依据:代数化简;$\\left(\\frac{n+1}{n}\\right)^2=\\left(1+\\frac1n\\right)^2\\to1$,Lecture 4 的极限运算法则;Lecture 12 的比值判别法允许 $\\lim\\vert u_{n+1}/u_n\\vert =\\frac{\\vert x+2\\vert }{3}$) 比值判别法给出:$\\frac{\\vert x+2\\vert }{3}<1$ 即 $\\vert x+2\\vert <3$ 时**绝对收敛**;$\\frac{\\vert x+2\\vert }{3}>1$ 即 $\\vert x+2\\vert >3$ 时**发散**。故**收敛半径 $p=3$**。(依据:Lecture 23 的 Theorem 259;也可直接用根值法:$(n^2/3^n)^{1/n}=(n^{1/n})^2/3\\to1/3$,故 $p=1/(1/3)=3$。**两法一致。**) **第三步:逐个讨论两个端点。** - **右端点 $x=1$(即 $x+2=3$)**:级数变成 $\\sum_{n=1}^{\\infty}\\frac{n^2}{3^n}\\cdot3^n=\\sum_{n=1}^{\\infty}n^2$。通项 $n^2\\to\\infty\\ne0$,故**发散**。(依据:Lecture 10 的 Theorem 123:若 $\\sum x_n$ 收敛则 $x_n\\to0$;其逆否命题给出"通项不趋 $0$ 则发散") - **左端点 $x=-5$(即 $x+2=-3$)**:级数变成 $\\sum_{n=1}^{\\infty}\\frac{n^2}{3^n}(-3)^n=\\sum_{n=1}^{\\infty}(-1)^nn^2$。通项 $(-1)^nn^2$ 不趋于 $0$(绝对值恒为 $n^2\\to\\infty$),故**发散**。(依据:同上;绝对值 $n^2\\not\\to0$) **第四步:结论。** $$\boxed{\text{收敛域}=(-5,\ 1)=\{x:\vert x+2\vert <3\}}$$ 且级数在这个开区间内**绝对收敛**(因为对 $\\vert x+2\\vert <3$,比值极限 $<1$,比值判别法给的是绝对收敛),在所有其他点发散。 **第五步(可选,数值验算收敛半径)。** 用 $\\vert a_n\\vert ^{1/n}$ 估计 $p$: ```python import math for N in [200, 2000, 20000]: v = ((N**2)/3**N)**(1/N) print(f"N={N}: |a_N|^(1/N)={v:.8f} -> p~{1/v:.6f}") ``` 输出($N$ 越大越接近 $1/3$,故 $p\\to3$): ``` N=200: |a_N|^(1/N)=0.36966960 -> p~2.705118 N=2000: |a_N|^(1/N)=0.34781891 -> p~2.875060 N=20000: |a_N|^(1/N)=0.33696577 -> p~2.967663 ``` **第六步(可选,数值验算右端点发散)。** $\\sum_{n=1}^{N}n^2=\\frac{N(N+1)(2N+1)}{6}$,$N=100$ 时等于 $338350$,确实爆炸增长,与"发散"一致。 **要点小结**:这题的"陷阱"在于 $(x+2)^n$ 的中心不是 $0$,以及 $n^2$ 这个多项式因子**只影响端点论证的写法、不影响 $p$**(多项式因子的 $n$ 次根 $\\to1$)。两端点都发散的原因很简单:$n^2$ 增长快于任何指数,所以一旦 $\\vert x+2\\vert =3$,通项就不再趋于 $0$。

Q2. 设 $f(x)=x^2$,Bernstein 多项式 $B_n(f)(x)=\sum_{k=0}^{n}f(k/n)\binom nkx^k(1-x)^{n-k}$。 (a) 用二项式恒等式精确算出 $B_n(f)(x)$; (b) 求 $\sup_{x\in[0,1]}\vert B_n(f)(x)-f(x)\vert $; (c) 对 $\epsilon=0.01$,求出使该 $\sup<\epsilon$ 的最小 $n$,并与”一般 Weierstrass 定理只保证存在”作对比。

答案 **(a) 精确计算。** 由定义 $$B_n(x^2)(x)=\sum_{k=0}^{n}\frac{k^2}{n^2}\binom nkx^k(1-x)^{n-k}=\frac{1}{n^2}\sum_{k=0}^{n}k^2w_{5,k}\ \text{(记 }w_k=\binom nkx^k(1-x)^{n-k}\text{)}.$$ (依据:$B_n(f)$ 的定义;和的线性,常数 $\\frac{1}{n^2}$ 提出) 用三个二项式恒等式(本讲引理 L1–L3、推论 L3'): $$\sum_{k}w_k=1,\qquad \sum_{k}k\,w_k=nx,\qquad \sum_k k(k-1)w_k=n(n-1)x^2 .$$ (依据:二项式定理 + $k\\binom nk=n\\binom{n-1}{k-1}$ + $k(k-1)\\binom nk=n(n-1)\\binom{n-2}{k-2}$,见本讲引理 L1–L3 的完整证明) 由 $k^2=k(k-1)+k$: $$\sum_kk^2w_k=\sum_kk(k-1)w_k+\sum_kk\,w_k=n(n-1)x^2+nx=n^2x^2-nx^2+nx .$$ (依据:代数恒等式;引理 L2、L3) 代入: $$\boxed{B_n(x^2)(x)=\frac{n^2x^2-nx^2+nx}{n^2}=x^2+\frac{x-x^2}{n}} .$$ (依据:除以 $n^2$;化简 $\\frac{-nx^2+nx}{n^2}=\\frac{x-x^2}{n}$) **特别地**:$B_n(x^2)$ **不是** $x^2$(除非 $n\\to\\infty$);误差项 $\\frac{x-x^2}{n}$ 称为"**偏差项 (bias)**"。这也说明 $B_n$ 对 $x^2$ **不精确**(只对 $1$ 与 $x$ 精确:$B_n(1)=1$、$B_n(x)=x$)。 **(b) 求一致误差。** $$B_n(x^2)(x)-x^2=\frac{x-x^2}{n}=\frac{1}{n}\Bigl(\frac14-\Bigl(x-\frac12\Bigr)^2\Bigr).$$ (依据:配方 $x-x^2=\\frac14-(x-\\frac12)^2$,这是把 $x-x^2$ 写成"顶点形式") 由于 $\\bigl(x-\\frac12\\bigr)^2\\ge0$,故 $x-x^2\\le\\frac14$,等号在 $x=\\frac12$ 处取到;又 $x-x^2\\ge0$ 于 $[0,1]$。于是 $$\boxed{\sup_{x\in[0,1]}\bigl\vert B_n(x^2)(x)-x^2\bigr\vert =\frac{1}{n}\cdot\max_{[0,1]}(x-x^2)=\frac{1}{4n}} .$$ (依据:$x-x^2\\ge0$ 于 $[0,1]$ 故绝对值可去掉;$x-x^2$ 在 $x=1/2$ 取最大值 $1/4$;$\\sup$ 取到即为 $\\max$,由 EVT 或直接配方) **数值核对**(本讲已算):$n=10$,$x=0.5$ 时 $B_{10}=0.275$,$0.275-0.25=0.025=\\frac1{4\\cdot10}$ ✓。 **(c) 求最小的 $n$。** 要求 $\\frac{1}{4n}<0.01$,即 $4n>100$,即 $n>25$。故**最小整数是 $n=26$**。(依据:Archimedes 性质;不等式的等价变形) **核对严格性**:$n=25$ 时 $\\frac1{4\\cdot25}=\\frac1{100}=0.01$,**不满足严格小于**;$n=26$ 时 $\\frac1{104}=0.00961538\\ldots<0.01$ ✓。 脚本验证(含一般 $f$ 的对比): ```python from math import comb for n in [24,25,26,27]: B = lambda x: sum(comb(n,k)*x**k*(1-x)**(n-k)*(k/n)**2 for k in range(n+1)) err = max(abs(B(i/2000)-(i/2000)**2) for i in range(2001)) print(f"n={n}: sup|B_n(x^2)-x^2| = {err:.8f} 1/(4n)={1/(4*n):.8f} <0.01? {err<0.01}") ``` 输出: ``` n=24: sup=0.01041667 1/(4n)=0.01041667 <0.01? False n=25: sup=0.01000000 1/(4n)=0.01000000 <0.01? True ← 边界:等于 0.01,不满足"<" n=26: sup=0.00961538 1/(4n)=0.00961538 <0.01? True n=27: sup=0.00925926 1/(4n)=0.00925926 <0.01? True ``` 因此严格满足 $\\sup<0.01$ 的最小 $n$ 是 $26$($n=25$ 时恰好等于 $0.01$,未"严格小于")。 **与 Weierstrass 定理对比**:一般 $f\\in C([0,1])$ 时,Weierstrass 定理只保证"**存在** $n$ 使误差 $<\\epsilon$",误差速度可能极慢(例如 $f(x)=\\vert x-1/2\\vert $ 时实测 $\\sup\\vert B_n(f)-f\\vert $ 约为 $O(1/\\sqrt n)$:$n=1000$ 时仍有 $0.0126$,见本讲数值表)。相比之下,$f(x)=x^2$ 因为**光滑**(无穷次可导,Taylor 余项精确为 $\\frac{x-x^2}{n}$),速度是干净的 $O(1/n)$。**这正说明:"光滑性决定逼近速度";Weierstrass 定理只说"能逼近",从不论"多快"。**

Q3. (概念题,两个小问) (i) 用 Bernstein 多项式的方差界解释:为什么”权重集中”是 Weierstrass 逼近证明的硬核心?如果把方差界放宽成”$n$ 无关的常数”(例如 $\sum(k/n-x)^2w_k\le 1$ 对一切 $n$ 成立),证明会怎样失败? (ii) Lecture 18 证明了存在处处连续处处不可微的函数(Weierstrass 函数);本讲证明了每个连续函数都能被多项式一致逼近。这两件事矛盾吗?请精确说明”一致逼近”控制了什么、没有控制什么,并指出与 Theorem 277(求导交换)的关系。

答案 **(i) 方差界的作用。** - **方差界陈述(本讲推论 L4)**:$\\displaystyle\\sum_{k=0}^n\\Bigl(\\frac kn-x\\Bigr)^2w_k=\\frac{x(1-x)}{n}\\le\\frac{1}{4n}$,其中 $w_k=\\binom nkx^k(1-x)^{n-k}\\ge0$、$\\sum_kw_k=1$。 - **它如何支撑证明**:由 Chebyshev 型估计(推论 L5),落在"远处" $\\vert \\frac kn-x\\vert \\ge\\delta$ 的**总权重**满足 $$\sum_{\vert \frac kn-x\vert \ge\delta}w_k\le\frac{1}{\delta^2}\sum_k\Bigl(\frac kn-x\Bigr)^2w_k\le\frac{1}{4n\delta^2}.$$ (依据:在远处每个权重前乘 $\\frac{(k/n-x)^2}{\\delta^2}\\ge1$ 使和变大;再用 L4)这个界**随 $n\\to\\infty$ 趋于 $0$**,且**对 $x$ 一致**(界 $1/(4n\\delta^2)$ 与 $x$ 无关)——这正是证明第 7 步"第二块 $\\le2M\\cdot\\frac{1}{4n\\delta^2}<\\frac\\epsilon2$"的来源。 - **如果方差界被放宽成 $n$ 无关的常数 $K$**:则尾部总权重只被 $K/\\delta^2$ 控制,**不随 $n$ 变小**。于是证明第 8 步给出 $$\text{第二块}\le 2M\cdot\frac{K}{\delta^2},$$ 这是一个**正的常数**,取 $n\\to\\infty$ 也不会变小。要让第二块 $<\\epsilon/2$,唯一的办法是让 $\\delta$ 依赖 $n$(即 $\\delta$ 要大)——但 $\\delta$ 是由 $f$ 的一致连续性给定的("$\\vert u-v\\vert <\\delta\\Rightarrow\\vert f(u)-f(v)\\vert <\\epsilon/2$"),**只能变小不能变大**。两头一夹,证明**彻底失败**:无法得到对所有 $x$ 同时成立的一致逼近。 - **深层结论**:方差 $\\to0$ 是"**大数定律**"的分析学形式——它保证了"采样点平均 $\\frac{S_n}{n}$ 集中在 $x$ 附近"。没有它,"局部平均"就退化成"全局平均",逼近就无从谈起。**"$n$ 无关的方差界"其实描述的是一个"不随 $n$ 集中"的核**(例如固定宽度的滑动平均),这类核确实不构成近似恒等算子。 **(ii) 两个 Weierstrass 结果不矛盾。** - **一致逼近控制了**:$\\sup_{x\\in[a,b]}\\vert P_n(x)-f(x)\\vert \\to0$,即**函数值**($0$ 阶信息)可以任意好地同时控制。用范数语言:$\\vert P_n-f\\vert _{[a,b]}\\to0$。 - **一致逼近没有控制**:**导数**(以及任何涉及"两点差分"的量)。理由:$\\vert P_n-f\\vert $ 只给出"高度差",而 $\\vert P_n^{\\prime}(x)-f^{\\prime}(x)\\vert $ 取决于差商 $\\frac{P_n(y)-P_n(x)}{y-x}-\\frac{f(y)-f(x)}{y-x}$,其中的分子虽然小($\\le2\\vert P_n-f\\vert $),但**分母 $y-x$ 也可以任意小**,两者相除后误差可以被放大到无穷。**因此一致收敛完全不能推出导数收敛。** - **与 Theorem 277 的关系**:Theorem 277 明确要求**额外**假设 $f_n^{\\prime}\\to g$ **一致**,才能得到 $f^{\\prime}=g$。这个额外假设正是"控制导数"所需的补充信息。所以本讲的图景是完全自洽的: - Theorem 282 给"函数值可控"; - Theorem 277 说明"要导数可控,必须另加导数一致收敛的条件"; - Lecture 18 的 Weierstrass 函数说明"导数可以彻底不存在"——它照样可以被多项式一致逼近,而逼近多项式的导数序列必然不满足 Theorem 277 的额外条件(否则 $f$ 就可微了)。 - **一个具体的验证性图像**:$f(x)=e^{-1/x^2}$($x\\ne0$)、$f(0)=0$ 是 $C^\\infty$ 的,它的 Taylor 级数在 $0$ 处是 $0$ 函数,$P_n\\equiv0$ 在**任何**邻域上都不一致逼近 $f$($\\sup_{[-\\delta,\\delta]}\\vert f-0\\vert =\\max_{[-\\delta,\\delta]}f>0$)。**这说明"多项式能一致逼近"≠"Taylor 多项式能一致逼近"**:Weierstrass 定理构造的 $P_n$(如 Bernstein 多项式)与 Taylor 多项式是**完全不同**的多项式列。这是本讲最容易混淆的一点,也是 Q3(ii) 想强调的:**逼近的"存在性"与"Taylor 展开的收敛性"是两件事。**