Lecture 30: Linear Transformations and Their Matrices
Lecture 30: Linear Transformations and Their Matrices
概述
本讲把视角从”矩阵”抬升到”变换”:线性变换 $T$ 是先于矩阵存在的几何对象,而矩阵只是它在某一组基下的坐标记录。核心操作只有一句话——问 $T$ 对每个基向量做了什么,把答案按列排好。我们会在标准基、多项式基、矩阵空间基上反复演练这个操作,并用 $P_x R_{90^\circ} \neq R_{90^\circ}P_x$ 说明”矩阵乘法 = 变换复合,且次序不可交换”。最后把讲次 6–10 的四个子空间语言翻译成变换语言:零空间 = 核(kernel),列空间 = 像(image)。
核心概念的几何直觉
线性变换(linear transformation)
- 定义与目的:设 $V,W$ 是向量空间。映射 $T:V\to W$ 称为线性的,若对所有 $\mathbf{v},\mathbf{w}\in V$ 与所有标量 $c,d$ 成立 \(T(c\mathbf{v}+d\mathbf{w}) = c\,T(\mathbf{v}) + d\,T(\mathbf{w}).\) 两个特例值得单独记住:
- 可加性:$T(\mathbf{v}+\mathbf{w}) = T(\mathbf{v})+T(\mathbf{w})$;
- 齐次性:$T(c\mathbf{v}) = c\,T(\mathbf{v})$。 反过来,若两条都成立,则一般式自动成立。目的:把”可以做加法与数乘”的所有操作一次性抓住——线性代数研究的就是这类操作。
几何直觉(它在空间中是什么样子?):取 $c=d=0$,得到最重要的推论 \(T(\mathbf{0}) = \mathbf{0}.\) 即线性变换必定把原点送到原点。更形象的图景:把 $\mathbb{R}^2$ 想成一张无限延伸的方格纸,线性变换把这张格子拉成另一张仍然等距平行的方格纸——直线的像仍是直线,原点不动,$\mathbf{v}$ 与 $\mathbf{w}$ 的中点映到像的中点。任何会把原点挪走、或把直线掰弯的操作,都不是线性的。
- 具体示例:$T(x,y)=((x+y)/2,\,(x+y)/2)$(投影到直线 $y=x$)。 \(T(1,0) = (\tfrac12,\tfrac12),\qquad T(0,1)=(\tfrac12,\tfrac12),\) \(T(c_1(1,0)+c_2(0,1)) = c_1(\tfrac12,\tfrac12)+c_2(\tfrac12,\tfrac12),\) 与直接代入 $T(c_1,c_2) = (\frac{c_1+c_2}{2},\frac{c_1+c_2}{2})$ 完全一致,线性成立。
矩阵是变换的坐标记录(matrix = the record of $T$ in a basis)
定义与目的:给定 $V$ 的基 $\mathbf{v}_1,\dots,\mathbf{v}_n$ 与 $W$ 的基 $\mathbf{w}_1,\dots,\mathbf{w}_m$,$T$ 对应的矩阵 $A$ 的第 $j$ 列是 $T(\mathbf{v}_j)$ 在输出基下的坐标向量: \(T(\mathbf{v}_j) = \sum_{i=1}^{m} a_{ij}\mathbf{w}_i \quad\Longleftrightarrow\quad \text{$A$ 的第 } j \text{ 列} = (a_{1j},\dots,a_{mj})^{\mathsf T}.\) 于是”$A\mathbf{x}$”的每一步都有了含义:$\mathbf{x}$ 是先组合 $\mathbf{v}_j$ 的配料表,$A\mathbf{x}$ 是像的配料表(用 $\mathbf{w}_i$ 计量)。
几何直觉(它在空间中是什么样子?):变换是”物体”,矩阵是”照片”。同一个物体从不同角度拍,得到不同的照片(讲次 31 的换基就是换拍摄角度)。所以问”$T$ 的矩阵是什么”是不完整的——必须补上”在哪组基下”。
这也解释了为什么同一变换可以有很多矩阵,而不同变换不可能有同一个矩阵(在同一组基下)。
具体示例:$\mathbb{R}^2$ 上”横坐标翻倍、纵坐标不动”的拉伸 $T(x,y)=(2x,y)$。标准基下 $T(1,0)=(2,0)$、$T(0,1)=(0,1)$,所以 \(A=\begin{bmatrix}2&0\\0&1\end{bmatrix}.\) 若改用基 $\mathbf{v}_1=(1,0),\mathbf{v}_2=(1,1)$,则 $T(\mathbf{v}_1)=(2,0)=2\mathbf{v}_1+0\mathbf{v}_2$;$T(\mathbf{v}_2)=(2,1)=1\mathbf{v}_1+1\mathbf{v}_2$。新矩阵是 \(B=\begin{bmatrix}2&1\\0&1\end{bmatrix}.\) 同一个变换,两张”照片”,都正确。
核(kernel)与像(image)
- 定义与目的:
- 核 $\ker T = \{\mathbf{v}\in V : T(\mathbf{v})=\mathbf{0}\}$,正是零空间 $N(A)$;
- 像 $\operatorname{im} T = \{T(\mathbf{v}) : \mathbf{v}\in V\}$,正是列空间 $C(A)$。 两者都是子空间(核在输入空间里,像在输出空间里)。它们不依赖基的选择,因此是变换的内在属性。
几何直觉(它在空间中是什么样子?):核是”被压扁到原点的那一坨”(投影时是与投影方向垂直的整条线);像是”这张方格纸在输出空间里实际铺到的地方”(投影时是一条线,而不是全平面)。秩—零化度定理 $\dim\ker T + \dim\operatorname{im}T = n$ 说的就是:输入空间被分成”被压死的”与”被真正送出去的”两部分,维数加起来正好是全部。
- 具体示例:投影 $P=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$:$P(1,-1)^{\mathsf T}=(0,0)^{\mathsf T}$ 所以 $\ker T=\operatorname{span}\{(1,-1)\}$(1 维);$P(1,1)^{\mathsf T}=(1,1)^{\mathsf T}$ 所以 $\operatorname{im}T=\operatorname{span}\{(1,1)\}$(1 维)。$1+1=2=n$。数值验算:$\operatorname{rank}P=1$,$\dim N(P)=1$。
线性变换的例子谱与反例
| 变换 | 定义 | 线性? | 关键点 |
|---|---|---|---|
| 投影 | $P\mathbf{x}$,$P^2=P$ | 是 | 核与像互补 |
| 旋转 | 绕原点转 $\theta$ | 是 | 保长、保角,$\det=1$ |
| 反射 | 关于过原点直线 | 是 | $S^2=I$,$\det=-1$ |
| 求导 | $\frac{d}{dx}$ 作用在多项式/函数上 | 是 | 奇异,核 = 常函数 |
| 积分 | $\int_0^x p(t)\,dt$ | 是 | 把 $n$ 维送到 $n+1$ 维 |
| 转置 | $T(M)=M^{\mathsf T}$ 作用在矩阵空间 | 是 | 矩阵空间本身是向量空间 |
| 平移 | $T(\mathbf{x})=\mathbf{x}+\mathbf{x}_0$ | 否 | $T(\mathbf{0})=\mathbf{x}_0\neq\mathbf{0}$ |
| 取模 | $T(x)=\vert x\vert $ | 否 | $\vert {-1}\cdot 1\vert \neq -1\cdot\vert 1\vert $ |
| 取范数 | $T(\mathbf{x})=\vert \mathbf{x}\vert $ | 否 | 输出是标量且 $T(-\mathbf{v})\neq-T(\mathbf{v})$ |
| 求最大值 | $T(p)=p(x_0)$ | 是 | 求值是线性泛函 |
反例的精细讨论:为什么平移不是线性的
设 $T(\mathbf{x})=\mathbf{x}+\mathbf{x}_0$,$\mathbf{x}_0=(1,1)$。三种检测方式都会失败:
T(0,0) = (1,1) ≠ (0,0) ← 最快速的检测
T((1,0)+(0,1)) = T(1,1) = (2,2)
T(1,0)+T(0,1) = (2,1)+(1,2) = (3,3) ← (2,2) ≠ (3,3)
但要注意一个反直觉的事实:平移保持平行与等距,它把方格纸平移成另一张方格纸,仍旧保持”格子的直线性与平行性”。所以”保持网格”只是必要而非充分条件;充要条件是原点不动 + 网格等距。这也说明为什么仿射变换(affine map)$T(\mathbf{x})=A\mathbf{x}+\mathbf{x}_0$ 需要额外加一笔常数项——它比线性变换多一个自由度。
计算步骤与手算演示
示例 1:绕原点旋转 $\theta$ 的矩阵(用标准基推导)
步骤 1:确定输入空间 $\mathbb{R}^2$ 的基,取标准基 $\mathbf{e}_1=(1,0)^{\mathsf T},\mathbf{e}_2=(0,1)^{\mathsf T}$;输出空间也用标准基。
步骤 2:求 $T(\mathbf{e}_1)$。向量 $(1,0)$ 指向正 $x$ 轴,长度 $1$,与 $x$ 轴夹角 $0$。逆时针转 $\theta$ 后,长度仍是 $1$,与 $x$ 轴夹角变成 $\theta$,所以 \(T(\mathbf{e}_1)=(\cos\theta,\ \sin\theta)^{\mathsf T}.\)
步骤 3:求 $T(\mathbf{e}_2)$。$(0,1)$ 指向正 $y$ 轴,与 $x$ 轴夹角 $\pi/2$。转后夹角 $\pi/2+\theta$,坐标 \(T(\mathbf{e}_2)=\bigl(\cos(\tfrac{\pi}{2}+\theta),\ \sin(\tfrac{\pi}{2}+\theta)\bigr)^{\mathsf T}=(-\sin\theta,\ \cos\theta)^{\mathsf T}.\)
步骤 4:把这两个输出按列写进矩阵: \(R_\theta=\begin{bmatrix}\cos\theta & -\sin\theta\\ \sin\theta & \cos\theta\end{bmatrix}.\)
步骤 5:数值检验。取 $\theta=90^\circ$:$\cos=0,\sin=1$, \(R_{90^\circ}=\begin{bmatrix}0&-1\\1&0\end{bmatrix},\qquad R_{90^\circ}\mathbf{e}_1=(0,1)^{\mathsf T},\quad R_{90^\circ}\mathbf{e}_2=(-1,0)^{\mathsf T}.\) 两次 $90^\circ$ 旋转应等于 $180^\circ$ 旋转: \(R_{90^\circ}^2=\begin{bmatrix}0&-1\\1&0\end{bmatrix}\begin{bmatrix}0&-1\\1&0\end{bmatrix}=\begin{bmatrix}-1&0\\0&-1\end{bmatrix}=-I.\) 与 $R_{180^\circ}=\begin{bmatrix}-1&0\\0&-1\end{bmatrix}$ 完全一致(脚本验算通过)。
步骤 6:取 $\theta=60^\circ$,$\cos 60^\circ=\frac12$,$\sin 60^\circ=\frac{\sqrt3}{2}$: \(R_{60^\circ}=\begin{bmatrix}1/2&-\sqrt3/2\\ \sqrt3/2&1/2\end{bmatrix},\quad \operatorname{tr}R_{60^\circ}=1=2\cos 60^\circ,\quad \det R_{60^\circ}=1.\) $R_{60^\circ}(1,0)^{\mathsf T}=(0.5,\ 0.866025)^{\mathsf T}$,验算通过。
【计算机制解说】:为什么”按列摆放”就是对的?因为矩阵乘法天生按列运作。设 $\mathbf{v}=\sum_j x_j\mathbf{v}j$,由线性性 \(T(\mathbf{v})=\sum_j x_j T(\mathbf{v}_j)=\sum_j x_j\Bigl(\sum_i a_{ij}\mathbf{w}_i\Bigr)=\sum_i\Bigl(\sum_j a_{ij}x_j\Bigr)\mathbf{w}_i.\) 括号里的 $\sum_j a{ij}x_j$ 恰好是 $A\mathbf{x}$ 的第 $i$ 个分量。也就是说,“线性”这个性质把无限多条信息压缩成 $n$ 个数字:只要知道 $T$ 在基上的取值,$T$ 在任意向量上的取值就完全确定。这正是矩阵能”代表”变换的全部理由,也是为什么”线性”是值得单独定义的性质。旋转的推导里,我们没有解任何方程,只用”旋转保持长度与夹角”这一几何事实就写出了 $T(\mathbf{e}_1),T(\mathbf{e}_2)$——这就是无坐标视角的威力。
示例 2:投影到直线 $y=x$ 上的矩阵(并验证它是投影)
步骤 1:先写出投影公式。直线 $y=x$ 的单位方向向量 $\mathbf{u}=\frac{1}{\sqrt2}(1,1)^{\mathsf T}$。向量 $\mathbf{x}=(x,y)^{\mathsf T}$ 在该直线上的投影是 \(T(\mathbf{x})=\frac{\mathbf{u}^{\mathsf T}\mathbf{x}}{\mathbf{u}^{\mathsf T}\mathbf{u}}\,\mathbf{u}=\frac{x+y}{\sqrt2}\cdot\frac{1}{\sqrt2}\begin{bmatrix}1\\1\end{bmatrix}=\begin{bmatrix}(x+y)/2\\ (x+y)/2\end{bmatrix}.\)
步骤 2:求基向量的像。 \(T(\mathbf{e}_1)=T(1,0)=\begin{bmatrix}1/2\\1/2\end{bmatrix},\qquad T(\mathbf{e}_2)=T(0,1)=\begin{bmatrix}1/2\\1/2\end{bmatrix}.\)
步骤 3:按列摆放: \(P=\begin{bmatrix}1/2&1/2\\1/2&1/2\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}.\)
步骤 4:验证对称性 $P=P^{\mathsf T}$:矩阵两行相同、两列相同,转置把第 $i$ 行搬到第 $i$ 列:$P$ 的两行都是 $(\frac12,\frac12)$、两列也都是 $(\frac12,\frac12)$,所以转置后每个位置的值不变,$P^{\mathsf T}=P$ ✓。
步骤 5:验证幂等性 $P^2=P$。 \(P^2=\frac14\begin{bmatrix}1&1\\1&1\end{bmatrix}\begin{bmatrix}1&1\\1&1\end{bmatrix}=\frac14\begin{bmatrix}1+1&1+1\\1+1&1+1\end{bmatrix}=\frac14\begin{bmatrix}2&2\\2&2\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=P.\ \checkmark\)
步骤 6:几何抽样。取 $\mathbf{x}=(3,1)^{\mathsf T}$: \(P\begin{bmatrix}3\\1\end{bmatrix}=\begin{bmatrix}0.5\cdot 3+0.5\cdot 1\\ 0.5\cdot 3+0.5\cdot 1\end{bmatrix}=\begin{bmatrix}2\\2\end{bmatrix},\) 与公式 $\bigl(\frac{3+1}{2},\frac{3+1}{2}\bigr)=(2,2)$ 一致(脚本验算通过)。
步骤 7:读出不变量(特征向量)。 \(P\begin{bmatrix}1\\1\end{bmatrix}=\begin{bmatrix}1\\1\end{bmatrix}\ (=1\cdot\mathbf{v}),\qquad P\begin{bmatrix}1\\-1\end{bmatrix}=\begin{bmatrix}0\\0\end{bmatrix}\ (=0\cdot\mathbf{v}).\) 沿直线方向的向量原封不动(特征值 $1$),垂直方向的向量被压成 $0$(特征值 $0$)。迹 $=1+0=1$,行列式 $=1\cdot 0=0$——脚本验算:$\operatorname{tr}P=1$,$\det P=0$。
步骤 8:核与像。$\ker T=\operatorname{span}\{(1,-1)\}$(垂直于直线),$\operatorname{im}T=\operatorname{span}\{(1,1)\}$(就是直线本身)。两者维数 $1+1=2=n$,秩—零化度定理成立,且 $\operatorname{rank}P=1$(脚本验算通过)。
【计算机制解说】:为什么投影矩阵必须对称且幂等?
- 幂等 $P^2=P$:投影一次之后向量已经在直线上,再投影一次毫无变化。几何上就是”影子再投一次还是它自己”。
- 对称 $P=P^{\mathsf T}$:这是正交投影(投影方向垂直于目标子空间)的标志。若用斜投影,$P^2=P$ 仍成立但 $P$ 不对称。
- 迹 = 1 = 目标子空间维数:一般地,投影矩阵 $P$ 的迹等于它所投影到的子空间的维数(因为特征值只有 $1$ 和 $0$,$1$ 的重数就是维数)。这一条是快速检查投影矩阵是否算错的好办法。
- 行列式 = 0:投影必然降维(把 2 维压成 1 维),所以不可逆,这是”$P$ 奇异”的几何含义。
示例 3:求导变换 $T=\frac{d}{dx}$ 在多项式空间 $\mathcal{P}_2$ 上的矩阵(必看,含基约定说明)
这是一个在函数空间上的线性变换,它证明线性代数远不止于 $\mathbb{R}^n$。
约定(务必先声明):取输入基与输出基都是 $\{1,x,x^2\}$,并按此顺序排列;多项式 $p(x)=a+bx+cx^2$ 的坐标向量是列向量 $(a,b,c)^{\mathsf T}$。即 \(p(x)=a\cdot 1+b\cdot x+c\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}a\\b\\c\end{bmatrix}.\)
步骤 1:逐个基向量求导,再把结果用输出基表示。 \(T(1)=0=0\cdot 1+0\cdot x+0\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}0\\0\\0\end{bmatrix},\) \(T(x)=1=1\cdot 1+0\cdot x+0\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}1\\0\\0\end{bmatrix},\) \(T(x^2)=2x=0\cdot 1+2\cdot x+0\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}0\\2\\0\end{bmatrix}.\)
步骤 2:按列摆放(第 $j$ 列 = 第 $j$ 个输入基向量的像的坐标): \(D=\begin{bmatrix}0&1&0\\0&0&2\\0&0&0\end{bmatrix}.\)
步骤 3:数值检验。取 $p(x)=3+5x+7x^2$,坐标 $(3,5,7)^{\mathsf T}$。 \(D\begin{bmatrix}3\\5\\7\end{bmatrix}=\begin{bmatrix}0\cdot3+1\cdot5+0\cdot7\\ 0\cdot3+0\cdot5+2\cdot7\\ 0\cdot3+0\cdot5+0\cdot7\end{bmatrix}=\begin{bmatrix}5\\14\\0\end{bmatrix}\ \longleftrightarrow\ 5+14x.\) 直接求导:$\frac{d}{dx}(3+5x+7x^2)=5+14x$。一致(脚本验算通过)。
步骤 4:算 $D^2$(二阶导)。 \(D^2=\begin{bmatrix}0&1&0\\0&0&2\\0&0&0\end{bmatrix}\begin{bmatrix}0&1&0\\0&0&2\\0&0&0\end{bmatrix}=\begin{bmatrix}0&0&2\\0&0&0\\0&0&0\end{bmatrix}.\) 作用于 $(3,5,7)^{\mathsf T}$:$D^2(3,5,7)^{\mathsf T}=(14,0,0)^{\mathsf T}\ \longleftrightarrow\ 14$。直接算:$\frac{d^2}{dx^2}(3+5x+7x^2)=14$。一致。
步骤 5:$D^3=O$(零矩阵)。三阶导把 $\mathcal{P}_2$ 中一切都打成零——这也说明 $D$ 是幂零的(nilpotent)。
步骤 6:秩与核。$D$ 有两行独立(第 1、2 行),$\operatorname{rank}D=2$;$\dim N(D)=3-2=1$。零空间是什么?解 $D(a,b,c)^{\mathsf T}=(b,2c,0)^{\mathsf T}=\mathbf{0}$ 得 $b=c=0$,$a$ 任取,即 \(N(D)=\Bigl\{(a,0,0)^{\mathsf T}\Bigr\}=\operatorname{span}\Bigl\{\begin{bmatrix}1\\0\\0\end{bmatrix}\Bigr\}\ \longleftrightarrow\ \text{常函数}.\) 脚本验算:$\operatorname{rank}D=2$,$\dim N(D)=1$。完美对应”$\frac{d}{dx}(\text{常数})=0$”。
步骤 7:一个漂亮的对比——用基 $\{1,x,x^2/2\}$ 会得到什么?留给读者推(提示:$T(x^2/2)=x$,矩阵会变成每列只有第 $j+1$ 行是 $1$ 的”移位”矩阵)。
【计算机制解说】:这个例子同时完成了三件事。
- 证明函数空间是向量空间,求导是线性变换。核心是微积分里的两个基本法则:$(\,p+q)’=p^{\prime}+q^{\prime}$ 与 $(cp)’=cp^{\prime}$。线性代数的定理(秩—零化度、奇异 ⇔ 有非零核)因此直接翻译成微积分的定理:“求导在 $\mathcal{P}_2$ 上丢掉 1 维信息,丢掉的正是常数”。
- 显示”基约定”会改变矩阵的样子,但不变换秩。若采用行向量约定(系数横排,$T$ 左作用在行向量上,或等价地取转置),同一个 $D$ 会写成 \(\begin{bmatrix}0&0&0\\1&0&0\\0&2&0\end{bmatrix}.\) 两个都”对”,取决于你把坐标当列还是当行。写作时必须在开头声明约定,否则讨论特征值、$\det$、$D^2$ 时会自相矛盾。本文全程用列向量约定。
- 上三角形态反映”基按次数递增排列”。$D$ 把 $x^k$ 送到低一次的 $kx^{k-1}$,所以在这组有序基下必然是上三角且对角全 $0$——对角线为 $0$ 直接说明所有特征值为 $0$,与幂零性一致。
示例 4:复合变换 = 矩阵乘法(”先旋转 $90^\circ$,再投影到 $x$ 轴”)
步骤 1:定义两个变换。
- $R$:逆时针旋转 $90^\circ$,$R=\begin{bmatrix}0&-1\\1&0\end{bmatrix}$;
- $P_x$:投影到 $x$ 轴,即 $T(x,y)=(x,0)$,$P_x=\begin{bmatrix}1&0\\0&0\end{bmatrix}$。
步骤 2:写出复合 $T(\mathbf{x})=P_x\bigl(R\mathbf{x}\bigr)$,按矩阵结合的写法就是 $T\mathbf{x}=(P_xR)\mathbf{x}$。所以复合的矩阵是 $P_xR$。
步骤 3:算乘积。 \(P_xR=\begin{bmatrix}1&0\\0&0\end{bmatrix}\begin{bmatrix}0&-1\\1&0\end{bmatrix}=\begin{bmatrix}0&-1\\0&0\end{bmatrix}.\)
步骤 4:用基向量核验”复合”的含义。$\mathbf{e}_1=(1,0)^{\mathsf T}$:先转 $90^\circ$ 得 $(0,1)^{\mathsf T}$,再投影得 $(0,0)^{\mathsf T}$;而 $(P_xR)\mathbf{e}_1=(0,0)^{\mathsf T}$ ✓。 $\mathbf{e}_2=(0,1)^{\mathsf T}$:先转得 $(-1,0)^{\mathsf T}$,再投影得 $(-1,0)^{\mathsf T}$;而 $(P_xR)\mathbf{e}_2=(-1,0)^{\mathsf T}$ ✓。
步骤 5:用一个一般向量 $\mathbf{v}=(2,3)^{\mathsf T}$ 双重验算。先旋转:$R\mathbf{v}=(-3,2)^{\mathsf T}$;再投影:$(-3,0)^{\mathsf T}$。而 $(P_xR)\mathbf{v}=(-3,0)^{\mathsf T}$ ✓(脚本验算通过)。
步骤 6:展示次序不可交换。反过来先投影再旋转: \(RP_x=\begin{bmatrix}0&-1\\1&0\end{bmatrix}\begin{bmatrix}1&0\\0&0\end{bmatrix}=\begin{bmatrix}0&0\\1&0\end{bmatrix}\neq P_xR.\) 两个结果的差别不是数值误差,而是本质的:$RP_x$ 把 $\mathbf{v}=(2,3)^{\mathsf T}$ 送到 $(0,2)^{\mathsf T}$,与 $(-3,0)^{\mathsf T}$ 完全不同。
步骤 7:几何解释。$P_xR$ 的像 = $x$ 轴(1 维),核 = $\operatorname{span}\{(1,0)\}$(旋转后落到 $y$ 轴,被投影杀掉)。$RP_x$ 的像 = $y$ 轴,核 = $\operatorname{span}\{(0,1)\}$。两个复合是不同的变换,只是恰好都是秩 1 的投影类映射。
【计算机制解说】:为什么 $(P_xR)\mathbf{x}=P_x(R\mathbf{x})$?因为矩阵乘法天生满足结合律:$(AB)\mathbf{x}=A(B\mathbf{x})$ 是定义层面的恒等式(把 $\mathbf{x}$ 的系数逐个分配即可验证)。由此得到的哲学结论是:
变换的世界 矩阵的世界
┌──────────────────┐ ┌──────────────────┐
│ 先做 R,再做 P_x │ ⟷ │ 矩阵乘积 P_x R │
│ 复合是"串联" │ │ 乘法是"左乘作用" │
└──────────────────┘ └──────────────────┘
“先做”的那个变换写在右边。这是线性代数里最常被记反的一点:$P_xR$ 意味着先 $R$ 后 $P_x$(从右往左读,像函数的复合 $f(g(x))$ 一样)。
示例 5(附加):反射关于直线 $y=x$,$S=\begin{bmatrix}0&1\\1&0\end{bmatrix}$
按列构造:$S\mathbf{e}_1=(0,1)^{\mathsf T}$,$S\mathbf{e}_2=(1,0)^{\mathsf T}$。所以 $S=\begin{bmatrix}0&1\\1&0\end{bmatrix}$。性质(脚本验算):$S^{\mathsf T}=S$,$S^2=I$,$\det S=-1$,特征值 $+1$(沿 $y=x$,不动)与 $-1$(沿 $y=-x$,被翻转)。$S(3,1)^{\mathsf T}=(1,3)^{\mathsf T}$ ✓。
反射与旋转的对比:旋转 $90^\circ$ 给出 $R^2=-I$、$\det=1$(保向);反射给出 $S^2=I$、$\det=-1$(反向)。行列式的符号记录了”手性”是否被翻转。
示例 6(附加):转置作为 $2\times2$ 矩阵空间上的线性变换
取矩阵空间的基 $E_{11},E_{12},E_{21},E_{22}$(即 $\begin{bmatrix}1&0\\0&0\end{bmatrix},\begin{bmatrix}0&1\\0&0\end{bmatrix},\begin{bmatrix}0&0\\1&0\end{bmatrix},\begin{bmatrix}0&0\\0&1\end{bmatrix}$),坐标向量 $(a,b,c,d)^{\mathsf T}$ 代表 $\begin{bmatrix}a&b\\c&d\end{bmatrix}$。变换 $T(M)=M^{\mathsf T}$ 把 $(a,b,c,d)$ 送到 $(a,c,b,d)$。按列构造: \(T=\begin{bmatrix}1&0&0&0\\0&0&1&0\\0&1&0&0\\0&0&0&1\end{bmatrix}.\) 性质(脚本验算):$T^2=I_4$(转置两次还原),$\operatorname{tr}T=2$,$\operatorname{rank}T=4$,特征值 $+1$(重数 3)与 $-1$(重数 1)。特征值 $+1$ 的特征空间 = 对称矩阵(3 维),$-1$ 的特征空间 = 反对称矩阵(1 维),$3+1=4$ ✓。这再次说明矩阵空间也是向量空间,”矩阵的函数”也可以是线性变换(呼应讲次 11–12)。
示例 7(附加):积分算子在 $\mathcal{P}_2$ 上——输出空间维数更高
$T(p)=\int_0^x p(t)\,dt$。用输入基 $\{1,x,x^2\}$、输出基 $\{1,x,x^2,x^3\}$: \(T(1)=x,\qquad T(x)=\tfrac{x^2}{2},\qquad T(x^2)=\tfrac{x^3}{3}.\) 按列摆放得到 $4\times3$ 矩阵 \(I_4=\begin{bmatrix}0&0&0\\1&0&0\\0&1/2&0\\0&0&1/3\end{bmatrix}.\) 检验:$I_4(3,5,7)^{\mathsf T}=(0,3,2.5,7/3)^{\mathsf T}\approx(0,3,2.5,2.333333)^{\mathsf T}$,对应 $3x+\frac52x^2+\frac73x^3$,与直接积分一致(脚本验算通过)。注意这是一个 $4\times3$ 矩阵——变换的矩阵可以是长方形的,因为输入输出空间的维数可以不同。
矩阵分解的核心思想
本讲不引入新的分解,但它给出了理解所有分解的统一语言:分解 = 把一个变换拆成几个结构简单的变换的复合。
- $A=LU$(讲次 1–5):消元法把变换拆成”下三角变换 $\circ$ 上三角变换”。上三角意味着在特定基下”只把第 $k$ 个分量往上送”,与示例 3 中的求导矩阵形态同源。
- $A=S\Lambda S^{-1}$(讲次 21–25):矩阵”照片”之间的换算规则,本讲已埋下伏笔——它就是讲次 31 的换基 $B=W^{-1}AW$。$\Lambda=\operatorname{diag}(\lambda_i)$ 意味着:在这组特殊基下,变换 $T$ 退化成”每个方向各自拉伸 $\lambda_i$ 倍”,方向之间互不干扰(解耦)。
- $A=Q\Lambda Q^{\mathsf T}$(对称矩阵):正交基下的解耦,保长且数值稳定。
- $A=U\Sigma V^{\mathsf T}$(SVD,讲次 29):$A$ 的像空间与输入空间各配一组正交基,变换 = 旋转 $\circ$ 缩放 $\circ$ 旋转。
- 投影 $P=P^{\mathsf T}=P^2$:既是本讲的算例,也说明幂等分解 $P$ 的”最小多项式是 $t^2-t$”,即 $P$ 只可能有两个特征值 $0,1$。
一句话:矩阵的”形状”反映的是基选得好不好;变换的”本性”(秩、核、像、特征值)不随基改变。
与其他讲次的关联
- 与讲次 1–5(消元、$A=LU$):本讲首次把矩阵从”数的表格”提升为”变换的记录”。消元中的初等矩阵 $E_{ij}$ 本身就是线性变换(把第 $j$ 行减去 $l$ 倍第 $i$ 行),$E_{ij}^{-1}$ 存在且易求。
- 与讲次 6–10(四个基本子空间):本讲给出翻译表:$N(A)=\ker T$,$C(A)=\operatorname{im}T$,$C(A^{\mathsf T})=\operatorname{im}T^$(转置变换的像),$N(A^{\mathsf T})=\ker T^$。秩—零化度定理就是维数公式。
- 与讲次 11–12(矩阵空间、图):矩阵空间 $\mathbb{R}^{m\times n}$ 是 $mn$ 维向量空间,本讲的转置示例是标准演练;图上的关联矩阵 $A$ 把”节点电位差”变成”边上的电流”,也是一个线性变换。
- 与讲次 14–17(正交、投影):示例 2 的 $P$ 是正交投影的特例;一般地 $P=A(A^{\mathsf T}A)^{-1}A^{\mathsf T}$,本讲的”对称 + 幂等”验证方法完全通用。
- 与讲次 18–20(行列式):$\det R=1$(旋转保体积)、$\det S=-1$(反射翻手性)、$\det P=0$(投影降维),本讲的例子就是行列式几何意义的最佳素材。
- 与讲次 21–25(特征值):特征向量 = “被变换只拉伸不转向”的方向,示例 2、5、6 都直接读出了特征向量。
- 与讲次 27–29(正定、Jordan、SVD):$D$ 的幂零性预告了 Jordan 形;SVD 的两组基预告了讲次 31 的换基。
- 与讲次 31(换基):本讲反复强调”矩阵依赖基”,下一讲立刻给出换基公式 $B=W^{-1}AW$。
- 与讲次 33(伪逆):本讲把投影看成变换;讲次 33 会把 $AA^{+}$、$A^{+}A$ 解释为幂等的投影变换,正好接续本讲示例 2 的检验方法。
关键要点
- 线性变换的两个判据:$T(\mathbf{v}+\mathbf{w})=T(\mathbf{v})+T(\mathbf{w})$ 与 $T(c\mathbf{v})=cT(\mathbf{v})$;等价地 $T(c\mathbf{v}+d\mathbf{w})=cT(\mathbf{v})+dT(\mathbf{w})$。最快检测:$T(\mathbf{0})=\mathbf{0}$(平移立刻出局)。
- 造矩阵的黄金操作:问 $T$ 对第 $j$ 个基向量做了什么,把答案按列放进第 $j$ 列。 输出必须用输出空间的基表示。
- 矩阵乘法 = 变换复合:$(AB)\mathbf{x}=A(B\mathbf{x})$,从右往左读(右边的先作用)。次序不可交换:$P_xR\neq RP_x$。
- 核 = 零空间,像 = 列空间:$\dim\ker T+\dim\operatorname{im}T=\dim V$。变换的秩与核不依赖基,矩阵的具体数字依赖基。
- 投影矩阵的三项体检:$P^2=P$(幂等)、$P^{\mathsf T}=P$(正交投影)、$\operatorname{tr}P=\dim(\text{目标子空间})$、$\det P=0$(除恒等外必降维)。
常见误区与注意事项
- 把”按列摆放”写成”按行摆放”。矩阵 $A$ 的第 $j$ 列 = $T(\mathbf{v}_j)$ 的坐标。若写成行,得到的其实是 $A^{\mathsf T}$,后续所有特征值、幂等性验证都会错。求导示例中若不声明约定,上三角与下三角两种写法都会出现,必须自己统一。
- 误以为”保持直线与平行”就是线性。平移保持直线与平行但不是线性。判据是原点不动 + 可加 + 齐次。
- 忘记复合的次序。$P_xR$ 是”先 $R$ 后 $P_x$”。写代码时也要注意:想让向量先乘 $R$ 再乘 $P_x$,应写
Px @ (R @ v)或(Px @ R) @ v,而不是R @ Px @ v。 - 把”投影到直线”与”投影到直线所在的方向向量”混淆。$T(\mathbf{x})=\frac{\mathbf{u}^{\mathsf T}\mathbf{x}}{\mathbf{u}^{\mathsf T}\mathbf{u}}\mathbf{u}$ 中分母必须有 $\mathbf{u}^{\mathsf T}\mathbf{u}$。若 $\mathbf{u}$ 是单位向量才可省略。用非单位向量 $\mathbf{u}=(1,1)^{\mathsf T}$ 算投影:$\frac{1}{2}\begin{bmatrix}1&1\\1&1\end{bmatrix}$——分母 $2$ 就是 $\mathbf{u}^{\mathsf T}\mathbf{u}$。
- 以为”非方阵不可能是变换的矩阵”。示例 7 的求导/积分证明长方形矩阵完全合法。输入 $n$ 维、输出 $m$ 维,矩阵就是 $m\times n$。
- 把 $\ker T$ 与 $\operatorname{im}T$ 放错空间。$\ker T\subseteq V$(输入空间),$\operatorname{im}T\subseteq W$(输出空间)。投影到 $y=x$ 时,$\ker$ 和 $\operatorname{im}$ 都恰好是 $\mathbb{R}^2$ 的子空间,容易造成”都在同一个空间”的错觉;换成求导($3$ 维 $\to$ 常数维)就更清楚。
- 误以为”矩阵相同 = 变换相同”。同一矩阵在不同基下代表不同变换;同一变换在不同基下是不同的矩阵。“矩阵 = 变换” 这句话只在基固定时成立。
思考题(带答案)
Q1.(纯计算)设 $T:\mathbb{R}^2\to\mathbb{R}^2$ 满足 $T(1,1)^{\mathsf T}=(2,0)^{\mathsf T}$ 且 $T(1,-1)^{\mathsf T}=(0,2)^{\mathsf T}$。求 $T$ 在标准基下的矩阵,并求 $T(3,1)^{\mathsf T}$。
答案
**方法:先用"作用于基"求出 $T$ 对标准基的作用,再按列摆放。** 已知的两个输入 $\\mathbf{u}_1=(1,1)^{\\mathsf T},\\mathbf{u}_2=(1,-1)^{\\mathsf T}$ 恰好构成一组基(它们不正交但线性无关)。先求它们的像的坐标:$T(\\mathbf{u}_1)=(2,0)^{\\mathsf T}$,$T(\\mathbf{u}_2)=(0,2)^{\\mathsf T}$。 由线性性, $$T\begin{bmatrix}1\\0\end{bmatrix}=T\Bigl(\frac{\mathbf{u}_1+\mathbf{u}_2}{2}\Bigr)=\frac{T(\mathbf{u}_1)+T(\mathbf{u}_2)}{2}=\frac{(2,0)+(0,2)}{2}=\begin{bmatrix}1\\1\end{bmatrix},$$ $$T\begin{bmatrix}0\\1\end{bmatrix}=T\Bigl(\frac{\mathbf{u}_1-\mathbf{u}_2}{2}\Bigr)=\frac{T(\mathbf{u}_1)-T(\mathbf{u}_2)}{2}=\frac{(2,0)-(0,2)}{2}=\begin{bmatrix}1\\-1\end{bmatrix}.$$ 按列摆放: $$A=\begin{bmatrix}1&1\\1&-1\end{bmatrix}.$$ 于是 $$T\begin{bmatrix}3\\1\end{bmatrix}=A\begin{bmatrix}3\\1\end{bmatrix}=\begin{bmatrix}1\cdot3+1\cdot1\\1\cdot3+(-1)\cdot1\end{bmatrix}=\begin{bmatrix}4\\2\end{bmatrix}.$$ **核对**:直接算 $T(\\mathbf{u}_1)=A(1,1)^{\\mathsf T}=(2,0)^{\\mathsf T}$ ✓;$T(\\mathbf{u}_2)=A(1,-1)^{\\mathsf T}=(0,2)^{\\mathsf T}$ ✓。另外 $\\det A=-2\\neq0$,所以 $T$ 可逆——它把基 $\\{\\mathbf{u}_1,\\mathbf{u}_2\\}$ 送到 $\\{(2,0),(0,2)\\}$,是一个保持独立性的变换。Q2.(概念理解)判断下列变换是否线性,并给出理由。 (a) $T(x,y)=(x+1,\ y)$;(b) $T(x,y)=(2x,\ 3y)$;(c) $T(x,y)=(xy,\ 0)$;(d) $T(p)=p^{\prime\prime}+2p^{\prime}$ 作用在 $\mathcal{P}_3$ 上;(e) $T(x,y)=(\vert (x,y)\vert ,0)$。
答案
(a) **不是**。$T(0,0)=(1,0)\\neq(0,0)$。它是沿 $x$ 方向的平移。 (b) **是**。$T(c(x,y)+d(u,v))=(2(cx+du),\\,3(cy+dv))=c(2x,3y)+d(2u,3v)$。矩阵是 $\\operatorname{diag}(2,3)$。 (c) **不是**。$T(1,0)=(0,0)$、$T(0,1)=(0,0)$,但 $T(1,1)=(1,0)\\neq(0,0)+ (0,0)$,破坏可加性。它连 $T(\\mathbf{e}_1+\\mathbf{e}_2)=T(\\mathbf{e}_1)+T(\\mathbf{e}_2)$ 都不满足。(注意它是二次型,不是线性变换;但 $xy$ 作为 $\\mathbb{R}^2$ 上的函数对应双线性形式。) (d) **是**。导数是线性的:$(p+q)^{\\prime\\prime}+2(p+q)'=(p^{\\prime\\prime}+2p^{\\prime})+(q^{\\prime\\prime}+2q^{\\prime})$,且 $(cp)^{\\prime\\prime}+2(cp)'=c(p^{\\prime\\prime}+2p^{\\prime})$。在基 $\\{1,x,x^2,x^3\\}$ 下,$T(1)=0$,$T(x)=2$,$T(x^2)=2+4x$,$T(x^3)=6x+6x^2$,所以 $$A=\begin{bmatrix}0&2&2&0\\0&0&4&6\\0&0&0&6\\0&0&0&0\end{bmatrix}.$$ (e) **不是**。$T(-\\mathbf{x})=(\\vert \\mathbf{x}\\vert ,0)=T(\\mathbf{x})$,但要求 $T(-\\mathbf{x})=-T(\\mathbf{x})$,即 $(\\vert \\mathbf{x}\\vert ,0)=(-\\vert \\mathbf{x}\\vert ,0)$,只有 $\\mathbf{x}=\\mathbf{0}$ 成立。齐次性被破坏。Q3.(计算 + 推理)设 $P=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$ 是投影到 $y=x$ 的矩阵,$S=\begin{bmatrix}0&1\\1&0\end{bmatrix}$ 是关于 $y=x$ 的反射。计算 $PS$、$SP$、$SPS$,并用几何语言解释每个结果。
答案
$$PS=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}\begin{bmatrix}0&1\\1&0\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=P,$$ (逐项:第 1 行第 1 列 $=0\\cdot1+1\\cdot1=1$,除以 $2$ 得 $1/2$;其余同理。) $$SP=\begin{bmatrix}0&1\\1&0\end{bmatrix}\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=P.$$ $$SPS=S(PS)=SP=P.$$ **几何解释**:$S$ 是沿直线 $y=x$ 的反射。反射后再投影到该直线,与直接投影结果相同——因为反射**不改变向量在直线上的分量**(只翻转垂直分量),而投影只保留沿直线分量。同理先投影再反射:投影结果已在直线上,反射不动它。所以 $PS=SP=P$,即 **$P$ 与 $S$ 可交换**。三个结果都是 $P$。 **额外收获**:$SPS=P$ 且 $S^2=I$,所以 $S$ 给出 $P$ 的一个"相似矩阵仍为自己"的例子——这对矩阵在基变换下保持不变(讲次 31)。附录 A:变换前后的向量图(几何总览)
下面这张图把本讲最重要的四个变换画在同一张 $\mathbb{R}^2$ 图上:原始网格 → 变换后网格。看”网格变成什么形状”,比记矩阵更快。
┌─────────────────────────────┐ ┌─────────────────────────────┐
│ 原始 R²(标准网格) │ │ 投影到 y = x 之后 │
│ │ │ │
│ y │ │ y │
│ │ ╱ │ │ │ ╱ │
│ │ ● v=(3,1) │ │ │ ╱ │
│ │ ╱ │ │ │ ● Pv=(2,2) ← 落到直线上│
│ │ ╱ │ │ ├─╱──────────── y=x │
│ ────┼──────────► x │ │ ────┼──────────► x │
│ │ │ │ │ │
│ 整张平面(2 维) │ │ 只剩一条直线(1 维)! │
│ 垂直方向 (1,-1) 也被保留 │ │ 垂直分量被"压掉" │
└─────────────────────────────┘ └─────────────────────────────┘
网格仍是"方的" 网格被压成一条线(退化了)
┌─────────────────────────────┐ ┌─────────────────────────────┐
│ 绕原点旋转 90° │ │ 沿 x 方向拉伸 2 倍 │
│ │ │ │
│ y │ │ y │
│ │ ● Rv=(-1,3) │ │ │ ● Tv=(6,1) │
│ │ ╱ │ │ │ ╱ │
│ │ ╱ │ │ │╱ │
│ │╱ ● v=(3,1) │ │ ├────────────────► x │
│ ────┼──────────► x │ │ │ │
│ │ │ │ 网格仍是"方的"但 x 方向拉长 │
│ 网格整体转动 90°(保长、保角)│ │ det = 2(面积放大 2 倍) │
└─────────────────────────────┘ └─────────────────────────────┘
判据速记:
┌────────────┬──────────┬──────────┬──────────┬──────────────┐
│ 变换 │ 原点动? │ 网格形状 │ 行列式 │ 可逆? │
├────────────┼──────────┼──────────┼──────────┼──────────────┤
│ 投影 │ 不动 │ 压成线 │ 0 │ 不可逆 │
│ 旋转 │ 不动 │ 方形(转)│ +1 │ 可逆 │
│ 反射 │ 不动 │ 方形(翻)│ −1 │ 可逆 │
│ 拉伸(2,3倍) │ 不动 │ 长方形 │ +6 │ 可逆 │
│ 平移 │ 动了! │ 方形(移)│ — │ (非线性的) │
└────────────┴──────────┴──────────┴──────────┴──────────────┘
← 最后一行的"原点动了"就是平移唯一的破绽
附录 B:常见线性变换矩阵速查表($\mathbb{R}^2$,标准基)
| 变换 | 定义式 | 矩阵 | 迹 | 行列式 | 特征值 | 核 |
|---|---|---|---|---|---|---|
| 恒等 | $\mathbf{x}\mapsto\mathbf{x}$ | $\begin{bmatrix}1&0\\0&1\end{bmatrix}$ | 2 | 1 | $1,1$ | $\{\mathbf{0}\}$ |
| 零变换 | $\mathbf{x}\mapsto\mathbf{0}$ | $\begin{bmatrix}0&0\\0&0\end{bmatrix}$ | 0 | 0 | $0,0$ | $\mathbb{R}^2$ |
| 投影到 $x$ 轴 | $(x,y)\mapsto(x,0)$ | $\begin{bmatrix}1&0\\0&0\end{bmatrix}$ | 1 | 0 | $1,0$ | $y$ 轴 |
| 投影到 $y=x$ | $(x,y)\mapsto\frac{x+y}{2}(1,1)$ | $\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$ | 1 | 0 | $1,0$ | $\operatorname{span}(1,-1)$ |
| 投影到 $y=-x$ | $(x,y)\mapsto\frac{x-y}{2}(1,-1)$ | $\frac12\begin{bmatrix}1&-1\\-1&1\end{bmatrix}$ | 1 | 0 | $1,0$ | $\operatorname{span}(1,1)$ |
| 旋转 $\theta$ | 逆时针转 $\theta$ | $\begin{bmatrix}\cos\theta&-\sin\theta\\ \sin\theta&\cos\theta\end{bmatrix}$ | $2\cos\theta$ | 1 | $e^{\pm i\theta}$ | $\{\mathbf{0}\}$ |
| 旋转 $90^\circ$ | — | $\begin{bmatrix}0&-1\\1&0\end{bmatrix}$ | 0 | 1 | $\pm i$ | $\{\mathbf{0}\}$ |
| 反射($y$ 轴) | $(x,y)\mapsto(-x,y)$ | $\begin{bmatrix}-1&0\\0&1\end{bmatrix}$ | 0 | $-1$ | $1,-1$ | $\{\mathbf{0}\}$ |
| 反射($y=x$) | $(x,y)\mapsto(y,x)$ | $\begin{bmatrix}0&1\\1&0\end{bmatrix}$ | 0 | $-1$ | $1,-1$ | $\{\mathbf{0}\}$ |
| 拉伸 | $(x,y)\mapsto(2x,3y)$ | $\begin{bmatrix}2&0\\0&3\end{bmatrix}$ | 5 | 6 | $2,3$ | $\{\mathbf{0}\}$ |
| 剪切 | $(x,y)\mapsto(x+y,y)$ | $\begin{bmatrix}1&1\\0&1\end{bmatrix}$ | 2 | 1 | $1,1$(不可对角化) | $\{\mathbf{0}\}$ |
三条自检规则:
- 行列式 $=0$ ⇔ 有非零核 ⇔ 不可逆 ⇔ 降维。
- 迹 $=$ 特征值之和;对称矩阵/三角矩阵的迹与行列式最容易手算($\det=ad-bc$)。
- 若 $\det$ 为负,变换翻转手性(左右手互换);若 $\vert \det\vert =1$,面积保持不变。
验算样例(脚本通过):投影 $y=x$ 的 $\operatorname{tr}=1$、$\det=0$、特征值 $1,0$;反射 $y=x$ 的 $S^2=I$、$\det=-1$、特征值 $1,-1$;拉伸 $(2,3)$ 的 $\operatorname{tr}=5$、$\det=6$、特征值 $2,3$。
附录 C:离散求导——从多项式求导到差分矩阵
示例 3 的求导算子 $D$ 有一个极其有用的离散版本。把区间 $[0,1]$ 上的函数 $f$ 在节点 $h=\frac1n$ 处采样得 $\mathbf{f}=(f_1,\dots,f_n)^{\mathsf T}$,用前向差分近似导数: \((D\mathbf{f})_i=\frac{f_{i+1}-f_i}{h}.\) 这给出一个 $(n-1)\times n$ 矩阵。取 $n=4$、$h=1$: \(D_4=\begin{bmatrix}-1&1&0&0\\0&-1&1&0\\0&0&-1&1\end{bmatrix}.\) 核验(脚本验算):$D_4(1,1,1,1)^{\mathsf T}=(0,0,0)^{\mathsf T}$ ✓ —— 常函数的导数为零,与连续情形完全一致。 $D_4(1,2,3,4)^{\mathsf T}=(1,1,1)^{\mathsf T}$ ✓($D_4$ 是 $3\times4$,结果按定义是 $3$ 维)—— 对 $f_i=c\cdot i$ 得到常数斜率,也一致。 秩与核:$D_4$ 是 $3\times4$,它的三行是 $(-1,1,0,0)$、$(0,-1,1,0)$、$(0,0,-1,1)$——逐行看,第 1 行的首个非零元在第 1 位,第 2 行在第 2 位,第 3 行在第 3 位,首非零元的位置严格递增,故线性无关(行阶梯形判据),$\operatorname{rank}=3$,$\dim N(D_4)=4-3=1$,零空间正是常数向量 $\operatorname{span}\{(1,1,1,1)\}$。
与示例 3 的对照:
| 连续求导 $D$ | 离散差分 $D_4$ | |
|---|---|---|
| 形状 | $3\times3$ | $3\times4$ |
| 秩 | 2 | 3 |
| $\dim N$ | 1(常函数) | 1(常数向量) |
| 形态 | 上三角 | 双对角(带状) |
| 幂零性 | $D^3=O$ | 不成立(非方阵) |
这个对照的意义:连续求导是方阵但奇异(因为多项式空间”闭合”),离散差分是长方形且满行秩(因为网格边界少一个点)。同一个数学操作,在不同空间的基下呈现完全不同的矩阵形状——这正是”矩阵依赖基、变换不依赖基”的最佳注解。
附录 D:判定与构造的完整工作流
面对”$T$ 是什么样的线性变换”这类问题,按下面五步走,不会出错:
步骤 1 检查 T(0) = 0 ? ← 不等则直接判定"非线性",结束
────────────────────────────────────────────────────────────
步骤 2 检查 T(cv+dw) = cT(v)+dT(w) ? ← 用符号推导,别只试数字
────────────────────────────────────────────────────────────
步骤 3 确定输入空间的基 v1..vn ← 以及输出空间的基 w1..wm
────────────────────────────────────────────────────────────
步骤 4 逐个求 T(vj),并把它写成输出基的线性组合
(这部分是"解小方程组",别偷懒跳过)
────────────────────────────────────────────────────────────
步骤 5 按列摆放:A 的第 j 列 = 步骤 4 的系数向量
────────────────────────────────────────────────────────────
检查 用几个随机向量验证 A x 与 T(x) 是否一致
检查 rank(A) = dim im T,n - rank(A) = dim ker T
为什么第 4 步最容易出错:如果输出基不是标准基,”写成分解式”这一步就真的有算术量。例如示例 3 中 $T(x^2)=2x$,在基 $\{1,x,x^2\}$ 下坐标是 $(0,2,0)$ 而不是 $(0,0,2)$——必须让第 2 个位置(对应 $x$)拿到系数 2。
验算流程(可直接照抄):
// 用脚本验证"矩阵 = 变换"的一致性
const A = [[0,1,0],[0,0,2],[0,0,0]]; // 约定:基 1,x,x^2,列向量
const Tpoly = (a,b,c) => [b, 2*c, 0]; // T = d/dx:a+bx+cx^2 -> b+2cx
const coords = [3,5,7]; // p = 3+5x+7x^2
const viaMatrix = A.map(r => r.reduce((s,v,i) => s+v*coords[i], 0));
console.log(viaMatrix, Tpoly(...coords)); // 两者必须相等 -> [5,14,0]
附录 E:核与像的维数账本(把讲次 6–10 翻译过来)
设 $T:\mathbb{R}^n\to\mathbb{R}^m$,矩阵 $A$($m\times n$),$r=\operatorname{rank}A$。四个基本子空间的变换语言版本:
| 子空间 | 讲次 6–10 的说法 | 变换语言 | 维数 | 住在哪 |
|---|---|---|---|---|
| $C(A)$ | 列空间 | $\operatorname{im}T$(像) | $r$ | $\mathbb{R}^m$(输出空间) |
| $N(A)$ | 零空间 | $\ker T$(核) | $n-r$ | $\mathbb{R}^n$(输入空间) |
| $C(A^{\mathsf T})$ | 行空间 | $\operatorname{im}T^{*}$(转置变换的像) | $r$ | $\mathbb{R}^n$(输入空间) |
| $N(A^{\mathsf T})$ | 左零空间 | $\ker T^{*}$ | $m-r$ | $\mathbb{R}^m$(输出空间) |
正交关系(讲次 10)在变换语言下:$\ker T=(\operatorname{im}T^{})^{\perp}$,$\ker T^{}=(\operatorname{im}T)^{\perp}$。即核是”像的正交补”,反过来也成立。
用投影 $P=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$ 核验账本($n=m=2$,$r=1$):
- $C(P)=\operatorname{span}\{(1,1)\}$,维数 1 ✓
- $N(P)=\operatorname{span}\{(1,-1)\}$,维数 $2-1=1$ ✓
- $C(P^{\mathsf T})=C(P)=\operatorname{span}\{(1,1)\}$(对称!),维数 1 ✓
- $N(P^{\mathsf T})=N(P)=\operatorname{span}\{(1,-1)\}$,维数 $2-1=1$ ✓
- 正交:$(1,-1)\cdot(1,1)=1-1=0$ ✓
- 核与像的维数和 $1+1=2=n$ ✓
翻译三条定理:
- 秩—零化度:$\dim\ker T+\dim\operatorname{im}T=n$ → “被压死的 + 被送出的 = 全部输入”。
- 可逆性:$T$ 可逆 ⇔ $\ker T=\{\mathbf{0}\}$ 且 $\operatorname{im}T=W$ → “$T$ 既单又满”。
- 一对一:$\ker T=\{\mathbf{0}\}$ ⇔ $T$ 是单射 → “没有两个不同的输入被送到同一个输出”。
附录 F:变换复合的两种读法与测验
测验:下面的等式是否成立? \(\text{(i) }(AB)^{\mathsf T}=B^{\mathsf T}A^{\mathsf T}\qquad\text{(ii) }(AB)^{-1}=B^{-1}A^{-1}\qquad\text{(iii) }(AB)^2=A^2B^2.\)
答案与变换解释:
- (i) 成立。用变换语言:$B$ 先作用、$A$ 后作用;转置(伴随)会把顺序颠倒——先转置的变成后转置的。
- (ii) 成立(当两者都可逆)。”先 $B$ 后 $A$”的逆必须是”先撤销 $A$ 再撤销 $B$”,所以是 $B^{-1}A^{-1}$。穿鞋脱鞋顺序相反。
- (iii) 一般不成立!$(AB)(AB)=ABAB\neq AABB$,除非 $A,B$ 可交换($AB=BA$)。几何上:先拉伸再旋转,与拉伸两次,完全是两回事。
验算例(脚本通过): \(A=\begin{bmatrix}1&1\\0&1\end{bmatrix}\text{(剪切)},\quad B=\begin{bmatrix}2&0\\0&1\end{bmatrix}\text{(拉伸)},\quad AB=\begin{bmatrix}2&1\\0&1\end{bmatrix},\quad BA=\begin{bmatrix}2&2\\0&1\end{bmatrix},\) \(AB\neq BA,\qquad (AB)^2=\begin{bmatrix}4&3\\0&1\end{bmatrix}\neq A^2B^2=\begin{bmatrix}1&2\\0&1\end{bmatrix}\begin{bmatrix}4&0\\0&1\end{bmatrix}=\begin{bmatrix}4&2\\0&1\end{bmatrix}.\) 结论:非交换性是变换复合的内在属性,不是矩阵的缺陷。
附录 G:三条延伸思考(不附答案,供自测)
- 设 $T:\mathbb{R}^{2\times2}\to\mathbb{R}^{2\times2}$ 定义为 $T(M)=M+M^{\mathsf T}$。它是线性的吗?它的核与像是什么?(提示:核 = 反对称矩阵,像 = 对称矩阵,两个维数相加 $1+3=4$ ✓。用附录 E 的转置示例数据可验证。)
- 设 $T(p)=p(x)p^{\prime}(x)$ 作用在多项式上。它是线性的吗?(提示:考察 $T(p+q)$,会发现交叉项 $p^{\prime}q+pq^{\prime}$ 无法消去。)
- 若 $T:\mathbb{R}^3\to\mathbb{R}^3$ 把每个向量投影到平面 $x+y+z=0$ 上,$T$ 的矩阵是什么?它的迹是多少?(提示:先求平面法向 $\mathbf{n}=(1,1,1)^{\mathsf T}$,投影矩阵 $P=I-\frac{\mathbf{n}\mathbf{n}^{\mathsf T}}{\mathbf{n}^{\mathsf T}\mathbf{n}}$,迹 $=3-1=2$ = 平面维数 ✓。)
