Lecture 30: Linear Transformations and Their Matrices

目录 · ← l27 · l29 →

Lecture 30: Linear Transformations and Their Matrices

概述

本讲把视角从”矩阵”抬升到”变换”:线性变换 $T$ 是先于矩阵存在的几何对象,而矩阵只是它在某一组基下的坐标记录。核心操作只有一句话——问 $T$ 对每个基向量做了什么,把答案按列排好。我们会在标准基、多项式基、矩阵空间基上反复演练这个操作,并用 $P_x R_{90^\circ} \neq R_{90^\circ}P_x$ 说明”矩阵乘法 = 变换复合,且次序不可交换”。最后把讲次 6–10 的四个子空间语言翻译成变换语言:零空间 = 核(kernel),列空间 = 像(image)

核心概念的几何直觉

线性变换(linear transformation)

  • 定义与目的:设 $V,W$ 是向量空间。映射 $T:V\to W$ 称为线性的,若对所有 $\mathbf{v},\mathbf{w}\in V$ 与所有标量 $c,d$ 成立 \(T(c\mathbf{v}+d\mathbf{w}) = c\,T(\mathbf{v}) + d\,T(\mathbf{w}).\) 两个特例值得单独记住:
    • 可加性:$T(\mathbf{v}+\mathbf{w}) = T(\mathbf{v})+T(\mathbf{w})$;
    • 齐次性:$T(c\mathbf{v}) = c\,T(\mathbf{v})$。 反过来,若两条都成立,则一般式自动成立。目的:把”可以做加法与数乘”的所有操作一次性抓住——线性代数研究的就是这类操作。
  • 几何直觉(它在空间中是什么样子?):取 $c=d=0$,得到最重要的推论 \(T(\mathbf{0}) = \mathbf{0}.\) 即线性变换必定把原点送到原点。更形象的图景:把 $\mathbb{R}^2$ 想成一张无限延伸的方格纸,线性变换把这张格子拉成另一张仍然等距平行的方格纸——直线的像仍是直线,原点不动,$\mathbf{v}$ 与 $\mathbf{w}$ 的中点映到像的中点。任何会把原点挪走、或把直线掰弯的操作,都不是线性的。

  • 具体示例:$T(x,y)=((x+y)/2,\,(x+y)/2)$(投影到直线 $y=x$)。 \(T(1,0) = (\tfrac12,\tfrac12),\qquad T(0,1)=(\tfrac12,\tfrac12),\) \(T(c_1(1,0)+c_2(0,1)) = c_1(\tfrac12,\tfrac12)+c_2(\tfrac12,\tfrac12),\) 与直接代入 $T(c_1,c_2) = (\frac{c_1+c_2}{2},\frac{c_1+c_2}{2})$ 完全一致,线性成立。

矩阵是变换的坐标记录(matrix = the record of $T$ in a basis)

  • 定义与目的:给定 $V$ 的基 $\mathbf{v}_1,\dots,\mathbf{v}_n$ 与 $W$ 的基 $\mathbf{w}_1,\dots,\mathbf{w}_m$,$T$ 对应的矩阵 $A$ 的第 $j$ 是 $T(\mathbf{v}_j)$ 在输出基下的坐标向量: \(T(\mathbf{v}_j) = \sum_{i=1}^{m} a_{ij}\mathbf{w}_i \quad\Longleftrightarrow\quad \text{$A$ 的第 } j \text{ 列} = (a_{1j},\dots,a_{mj})^{\mathsf T}.\) 于是”$A\mathbf{x}$”的每一步都有了含义:$\mathbf{x}$ 是先组合 $\mathbf{v}_j$ 的配料表,$A\mathbf{x}$ 是像的配料表(用 $\mathbf{w}_i$ 计量)。

  • 几何直觉(它在空间中是什么样子?):变换是”物体”,矩阵是”照片”。同一个物体从不同角度拍,得到不同的照片(讲次 31 的换基就是换拍摄角度)。所以问”$T$ 的矩阵是什么”是不完整的——必须补上”在哪组基下”。

    这也解释了为什么同一变换可以有很多矩阵,而不同变换不可能有同一个矩阵(在同一组基下)。

  • 具体示例:$\mathbb{R}^2$ 上”横坐标翻倍、纵坐标不动”的拉伸 $T(x,y)=(2x,y)$。标准基下 $T(1,0)=(2,0)$、$T(0,1)=(0,1)$,所以 \(A=\begin{bmatrix}2&0\\0&1\end{bmatrix}.\) 若改用基 $\mathbf{v}_1=(1,0),\mathbf{v}_2=(1,1)$,则 $T(\mathbf{v}_1)=(2,0)=2\mathbf{v}_1+0\mathbf{v}_2$;$T(\mathbf{v}_2)=(2,1)=1\mathbf{v}_1+1\mathbf{v}_2$。新矩阵是 \(B=\begin{bmatrix}2&1\\0&1\end{bmatrix}.\) 同一个变换,两张”照片”,都正确。

核(kernel)与像(image)

  • 定义与目的
    • 核 $\ker T = \{\mathbf{v}\in V : T(\mathbf{v})=\mathbf{0}\}$,正是零空间 $N(A)$;
    • 像 $\operatorname{im} T = \{T(\mathbf{v}) : \mathbf{v}\in V\}$,正是列空间 $C(A)$。 两者都是子空间(核在输入空间里,像在输出空间里)。它们不依赖基的选择,因此是变换的内在属性。
  • 几何直觉(它在空间中是什么样子?):核是”被压扁到原点的那一坨”(投影时是与投影方向垂直的整条线);像是”这张方格纸在输出空间里实际铺到的地方”(投影时是一条线,而不是全平面)。秩—零化度定理 $\dim\ker T + \dim\operatorname{im}T = n$ 说的就是:输入空间被分成”被压死的”与”被真正送出去的”两部分,维数加起来正好是全部。

  • 具体示例:投影 $P=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$:$P(1,-1)^{\mathsf T}=(0,0)^{\mathsf T}$ 所以 $\ker T=\operatorname{span}\{(1,-1)\}$(1 维);$P(1,1)^{\mathsf T}=(1,1)^{\mathsf T}$ 所以 $\operatorname{im}T=\operatorname{span}\{(1,1)\}$(1 维)。$1+1=2=n$。数值验算:$\operatorname{rank}P=1$,$\dim N(P)=1$。

线性变换的例子谱与反例

变换定义线性?关键点
投影$P\mathbf{x}$,$P^2=P$核与像互补
旋转绕原点转 $\theta$保长、保角,$\det=1$
反射关于过原点直线$S^2=I$,$\det=-1$
求导$\frac{d}{dx}$ 作用在多项式/函数上奇异,核 = 常函数
积分$\int_0^x p(t)\,dt$把 $n$ 维送到 $n+1$ 维
转置$T(M)=M^{\mathsf T}$ 作用在矩阵空间矩阵空间本身是向量空间
平移$T(\mathbf{x})=\mathbf{x}+\mathbf{x}_0$$T(\mathbf{0})=\mathbf{x}_0\neq\mathbf{0}$
取模$T(x)=\vert x\vert $$\vert {-1}\cdot 1\vert \neq -1\cdot\vert 1\vert $
取范数$T(\mathbf{x})=\vert \mathbf{x}\vert $输出是标量且 $T(-\mathbf{v})\neq-T(\mathbf{v})$
求最大值$T(p)=p(x_0)$求值是线性泛函

反例的精细讨论:为什么平移不是线性的

设 $T(\mathbf{x})=\mathbf{x}+\mathbf{x}_0$,$\mathbf{x}_0=(1,1)$。三种检测方式都会失败:

 T(0,0) = (1,1) ≠ (0,0)                     ← 最快速的检测
 T((1,0)+(0,1)) = T(1,1) = (2,2)
 T(1,0)+T(0,1) = (2,1)+(1,2) = (3,3)        ← (2,2) ≠ (3,3)

但要注意一个反直觉的事实:平移保持平行与等距,它把方格纸平移成另一张方格纸,仍旧保持”格子的直线性与平行性”。所以”保持网格”只是必要而非充分条件;充要条件是原点不动 + 网格等距。这也说明为什么仿射变换(affine map)$T(\mathbf{x})=A\mathbf{x}+\mathbf{x}_0$ 需要额外加一笔常数项——它比线性变换多一个自由度。

计算步骤与手算演示

示例 1:绕原点旋转 $\theta$ 的矩阵(用标准基推导)

步骤 1:确定输入空间 $\mathbb{R}^2$ 的基,取标准基 $\mathbf{e}_1=(1,0)^{\mathsf T},\mathbf{e}_2=(0,1)^{\mathsf T}$;输出空间也用标准基。

步骤 2:求 $T(\mathbf{e}_1)$。向量 $(1,0)$ 指向正 $x$ 轴,长度 $1$,与 $x$ 轴夹角 $0$。逆时针转 $\theta$ 后,长度仍是 $1$,与 $x$ 轴夹角变成 $\theta$,所以 \(T(\mathbf{e}_1)=(\cos\theta,\ \sin\theta)^{\mathsf T}.\)

步骤 3:求 $T(\mathbf{e}_2)$。$(0,1)$ 指向正 $y$ 轴,与 $x$ 轴夹角 $\pi/2$。转后夹角 $\pi/2+\theta$,坐标 \(T(\mathbf{e}_2)=\bigl(\cos(\tfrac{\pi}{2}+\theta),\ \sin(\tfrac{\pi}{2}+\theta)\bigr)^{\mathsf T}=(-\sin\theta,\ \cos\theta)^{\mathsf T}.\)

步骤 4:把这两个输出按列写进矩阵: \(R_\theta=\begin{bmatrix}\cos\theta & -\sin\theta\\ \sin\theta & \cos\theta\end{bmatrix}.\)

步骤 5:数值检验。取 $\theta=90^\circ$:$\cos=0,\sin=1$, \(R_{90^\circ}=\begin{bmatrix}0&-1\\1&0\end{bmatrix},\qquad R_{90^\circ}\mathbf{e}_1=(0,1)^{\mathsf T},\quad R_{90^\circ}\mathbf{e}_2=(-1,0)^{\mathsf T}.\) 两次 $90^\circ$ 旋转应等于 $180^\circ$ 旋转: \(R_{90^\circ}^2=\begin{bmatrix}0&-1\\1&0\end{bmatrix}\begin{bmatrix}0&-1\\1&0\end{bmatrix}=\begin{bmatrix}-1&0\\0&-1\end{bmatrix}=-I.\) 与 $R_{180^\circ}=\begin{bmatrix}-1&0\\0&-1\end{bmatrix}$ 完全一致(脚本验算通过)。

步骤 6:取 $\theta=60^\circ$,$\cos 60^\circ=\frac12$,$\sin 60^\circ=\frac{\sqrt3}{2}$: \(R_{60^\circ}=\begin{bmatrix}1/2&-\sqrt3/2\\ \sqrt3/2&1/2\end{bmatrix},\quad \operatorname{tr}R_{60^\circ}=1=2\cos 60^\circ,\quad \det R_{60^\circ}=1.\) $R_{60^\circ}(1,0)^{\mathsf T}=(0.5,\ 0.866025)^{\mathsf T}$,验算通过。

【计算机制解说】:为什么”按列摆放”就是对的?因为矩阵乘法天生按列运作。设 $\mathbf{v}=\sum_j x_j\mathbf{v}j$,由线性性 \(T(\mathbf{v})=\sum_j x_j T(\mathbf{v}_j)=\sum_j x_j\Bigl(\sum_i a_{ij}\mathbf{w}_i\Bigr)=\sum_i\Bigl(\sum_j a_{ij}x_j\Bigr)\mathbf{w}_i.\) 括号里的 $\sum_j a{ij}x_j$ 恰好是 $A\mathbf{x}$ 的第 $i$ 个分量。也就是说,“线性”这个性质把无限多条信息压缩成 $n$ 个数字:只要知道 $T$ 在基上的取值,$T$ 在任意向量上的取值就完全确定。这正是矩阵能”代表”变换的全部理由,也是为什么”线性”是值得单独定义的性质。旋转的推导里,我们没有解任何方程,只用”旋转保持长度与夹角”这一几何事实就写出了 $T(\mathbf{e}_1),T(\mathbf{e}_2)$——这就是无坐标视角的威力。


示例 2:投影到直线 $y=x$ 上的矩阵(并验证它是投影)

步骤 1:先写出投影公式。直线 $y=x$ 的单位方向向量 $\mathbf{u}=\frac{1}{\sqrt2}(1,1)^{\mathsf T}$。向量 $\mathbf{x}=(x,y)^{\mathsf T}$ 在该直线上的投影是 \(T(\mathbf{x})=\frac{\mathbf{u}^{\mathsf T}\mathbf{x}}{\mathbf{u}^{\mathsf T}\mathbf{u}}\,\mathbf{u}=\frac{x+y}{\sqrt2}\cdot\frac{1}{\sqrt2}\begin{bmatrix}1\\1\end{bmatrix}=\begin{bmatrix}(x+y)/2\\ (x+y)/2\end{bmatrix}.\)

步骤 2:求基向量的像。 \(T(\mathbf{e}_1)=T(1,0)=\begin{bmatrix}1/2\\1/2\end{bmatrix},\qquad T(\mathbf{e}_2)=T(0,1)=\begin{bmatrix}1/2\\1/2\end{bmatrix}.\)

步骤 3:按列摆放: \(P=\begin{bmatrix}1/2&1/2\\1/2&1/2\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}.\)

步骤 4:验证对称性 $P=P^{\mathsf T}$:矩阵两行相同、两列相同,转置把第 $i$ 行搬到第 $i$ 列:$P$ 的两行都是 $(\frac12,\frac12)$、两列也都是 $(\frac12,\frac12)$,所以转置后每个位置的值不变,$P^{\mathsf T}=P$ ✓。

步骤 5:验证幂等性 $P^2=P$。 \(P^2=\frac14\begin{bmatrix}1&1\\1&1\end{bmatrix}\begin{bmatrix}1&1\\1&1\end{bmatrix}=\frac14\begin{bmatrix}1+1&1+1\\1+1&1+1\end{bmatrix}=\frac14\begin{bmatrix}2&2\\2&2\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=P.\ \checkmark\)

步骤 6:几何抽样。取 $\mathbf{x}=(3,1)^{\mathsf T}$: \(P\begin{bmatrix}3\\1\end{bmatrix}=\begin{bmatrix}0.5\cdot 3+0.5\cdot 1\\ 0.5\cdot 3+0.5\cdot 1\end{bmatrix}=\begin{bmatrix}2\\2\end{bmatrix},\) 与公式 $\bigl(\frac{3+1}{2},\frac{3+1}{2}\bigr)=(2,2)$ 一致(脚本验算通过)。

步骤 7:读出不变量(特征向量)。 \(P\begin{bmatrix}1\\1\end{bmatrix}=\begin{bmatrix}1\\1\end{bmatrix}\ (=1\cdot\mathbf{v}),\qquad P\begin{bmatrix}1\\-1\end{bmatrix}=\begin{bmatrix}0\\0\end{bmatrix}\ (=0\cdot\mathbf{v}).\) 沿直线方向的向量原封不动(特征值 $1$),垂直方向的向量被压成 $0$(特征值 $0$)。迹 $=1+0=1$,行列式 $=1\cdot 0=0$——脚本验算:$\operatorname{tr}P=1$,$\det P=0$。

步骤 8:核与像。$\ker T=\operatorname{span}\{(1,-1)\}$(垂直于直线),$\operatorname{im}T=\operatorname{span}\{(1,1)\}$(就是直线本身)。两者维数 $1+1=2=n$,秩—零化度定理成立,且 $\operatorname{rank}P=1$(脚本验算通过)。

【计算机制解说】:为什么投影矩阵必须对称且幂等

  • 幂等 $P^2=P$:投影一次之后向量已经在直线上,再投影一次毫无变化。几何上就是”影子再投一次还是它自己”。
  • 对称 $P=P^{\mathsf T}$:这是正交投影(投影方向垂直于目标子空间)的标志。若用斜投影,$P^2=P$ 仍成立但 $P$ 不对称。
  • 迹 = 1 = 目标子空间维数:一般地,投影矩阵 $P$ 的迹等于它所投影到的子空间的维数(因为特征值只有 $1$ 和 $0$,$1$ 的重数就是维数)。这一条是快速检查投影矩阵是否算错的好办法。
  • 行列式 = 0:投影必然降维(把 2 维压成 1 维),所以不可逆,这是”$P$ 奇异”的几何含义。

示例 3:求导变换 $T=\frac{d}{dx}$ 在多项式空间 $\mathcal{P}_2$ 上的矩阵(必看,含基约定说明)

这是一个在函数空间上的线性变换,它证明线性代数远不止于 $\mathbb{R}^n$。

约定(务必先声明):取输入基与输出基都是 $\{1,x,x^2\}$,并按此顺序排列;多项式 $p(x)=a+bx+cx^2$ 的坐标向量是列向量 $(a,b,c)^{\mathsf T}$。即 \(p(x)=a\cdot 1+b\cdot x+c\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}a\\b\\c\end{bmatrix}.\)

步骤 1:逐个基向量求导,再把结果用输出基表示。 \(T(1)=0=0\cdot 1+0\cdot x+0\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}0\\0\\0\end{bmatrix},\) \(T(x)=1=1\cdot 1+0\cdot x+0\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}1\\0\\0\end{bmatrix},\) \(T(x^2)=2x=0\cdot 1+2\cdot x+0\cdot x^2\ \longleftrightarrow\ \begin{bmatrix}0\\2\\0\end{bmatrix}.\)

步骤 2:按列摆放(第 $j$ 列 = 第 $j$ 个输入基向量的像的坐标): \(D=\begin{bmatrix}0&1&0\\0&0&2\\0&0&0\end{bmatrix}.\)

步骤 3:数值检验。取 $p(x)=3+5x+7x^2$,坐标 $(3,5,7)^{\mathsf T}$。 \(D\begin{bmatrix}3\\5\\7\end{bmatrix}=\begin{bmatrix}0\cdot3+1\cdot5+0\cdot7\\ 0\cdot3+0\cdot5+2\cdot7\\ 0\cdot3+0\cdot5+0\cdot7\end{bmatrix}=\begin{bmatrix}5\\14\\0\end{bmatrix}\ \longleftrightarrow\ 5+14x.\) 直接求导:$\frac{d}{dx}(3+5x+7x^2)=5+14x$。一致(脚本验算通过)。

步骤 4:算 $D^2$(二阶导)。 \(D^2=\begin{bmatrix}0&1&0\\0&0&2\\0&0&0\end{bmatrix}\begin{bmatrix}0&1&0\\0&0&2\\0&0&0\end{bmatrix}=\begin{bmatrix}0&0&2\\0&0&0\\0&0&0\end{bmatrix}.\) 作用于 $(3,5,7)^{\mathsf T}$:$D^2(3,5,7)^{\mathsf T}=(14,0,0)^{\mathsf T}\ \longleftrightarrow\ 14$。直接算:$\frac{d^2}{dx^2}(3+5x+7x^2)=14$。一致

步骤 5:$D^3=O$(零矩阵)。三阶导把 $\mathcal{P}_2$ 中一切都打成零——这也说明 $D$ 是幂零的(nilpotent)。

步骤 6:秩与核。$D$ 有两行独立(第 1、2 行),$\operatorname{rank}D=2$;$\dim N(D)=3-2=1$。零空间是什么?解 $D(a,b,c)^{\mathsf T}=(b,2c,0)^{\mathsf T}=\mathbf{0}$ 得 $b=c=0$,$a$ 任取,即 \(N(D)=\Bigl\{(a,0,0)^{\mathsf T}\Bigr\}=\operatorname{span}\Bigl\{\begin{bmatrix}1\\0\\0\end{bmatrix}\Bigr\}\ \longleftrightarrow\ \text{常函数}.\) 脚本验算:$\operatorname{rank}D=2$,$\dim N(D)=1$。完美对应”$\frac{d}{dx}(\text{常数})=0$”。

步骤 7:一个漂亮的对比——用基 $\{1,x,x^2/2\}$ 会得到什么?留给读者推(提示:$T(x^2/2)=x$,矩阵会变成每列只有第 $j+1$ 行是 $1$ 的”移位”矩阵)。

【计算机制解说】:这个例子同时完成了三件事。

  1. 证明函数空间是向量空间,求导是线性变换。核心是微积分里的两个基本法则:$(\,p+q)’=p^{\prime}+q^{\prime}$ 与 $(cp)’=cp^{\prime}$。线性代数的定理(秩—零化度、奇异 ⇔ 有非零核)因此直接翻译成微积分的定理:“求导在 $\mathcal{P}_2$ 上丢掉 1 维信息,丢掉的正是常数”
  2. 显示”基约定”会改变矩阵的样子,但不变换秩。若采用行向量约定(系数横排,$T$ 左作用在行向量上,或等价地取转置),同一个 $D$ 会写成 \(\begin{bmatrix}0&0&0\\1&0&0\\0&2&0\end{bmatrix}.\) 两个都”对”,取决于你把坐标当列还是当行。写作时必须在开头声明约定,否则讨论特征值、$\det$、$D^2$ 时会自相矛盾。本文全程用列向量约定。
  3. 上三角形态反映”基按次数递增排列”。$D$ 把 $x^k$ 送到低一次的 $kx^{k-1}$,所以在这组有序基下必然是上三角且对角全 $0$——对角线为 $0$ 直接说明所有特征值为 $0$,与幂零性一致。

示例 4:复合变换 = 矩阵乘法(”先旋转 $90^\circ$,再投影到 $x$ 轴”)

步骤 1:定义两个变换。

  • $R$:逆时针旋转 $90^\circ$,$R=\begin{bmatrix}0&-1\\1&0\end{bmatrix}$;
  • $P_x$:投影到 $x$ 轴,即 $T(x,y)=(x,0)$,$P_x=\begin{bmatrix}1&0\\0&0\end{bmatrix}$。

步骤 2:写出复合 $T(\mathbf{x})=P_x\bigl(R\mathbf{x}\bigr)$,按矩阵结合的写法就是 $T\mathbf{x}=(P_xR)\mathbf{x}$。所以复合的矩阵是 $P_xR$。

步骤 3:算乘积。 \(P_xR=\begin{bmatrix}1&0\\0&0\end{bmatrix}\begin{bmatrix}0&-1\\1&0\end{bmatrix}=\begin{bmatrix}0&-1\\0&0\end{bmatrix}.\)

步骤 4:用基向量核验”复合”的含义。$\mathbf{e}_1=(1,0)^{\mathsf T}$:先转 $90^\circ$ 得 $(0,1)^{\mathsf T}$,再投影得 $(0,0)^{\mathsf T}$;而 $(P_xR)\mathbf{e}_1=(0,0)^{\mathsf T}$ ✓。 $\mathbf{e}_2=(0,1)^{\mathsf T}$:先转得 $(-1,0)^{\mathsf T}$,再投影得 $(-1,0)^{\mathsf T}$;而 $(P_xR)\mathbf{e}_2=(-1,0)^{\mathsf T}$ ✓。

步骤 5:用一个一般向量 $\mathbf{v}=(2,3)^{\mathsf T}$ 双重验算。先旋转:$R\mathbf{v}=(-3,2)^{\mathsf T}$;再投影:$(-3,0)^{\mathsf T}$。而 $(P_xR)\mathbf{v}=(-3,0)^{\mathsf T}$ ✓(脚本验算通过)。

步骤 6展示次序不可交换。反过来先投影再旋转: \(RP_x=\begin{bmatrix}0&-1\\1&0\end{bmatrix}\begin{bmatrix}1&0\\0&0\end{bmatrix}=\begin{bmatrix}0&0\\1&0\end{bmatrix}\neq P_xR.\) 两个结果的差别不是数值误差,而是本质的:$RP_x$ 把 $\mathbf{v}=(2,3)^{\mathsf T}$ 送到 $(0,2)^{\mathsf T}$,与 $(-3,0)^{\mathsf T}$ 完全不同。

步骤 7:几何解释。$P_xR$ 的像 = $x$ 轴(1 维),核 = $\operatorname{span}\{(1,0)\}$(旋转后落到 $y$ 轴,被投影杀掉)。$RP_x$ 的像 = $y$ 轴,核 = $\operatorname{span}\{(0,1)\}$。两个复合是不同的变换,只是恰好都是秩 1 的投影类映射。

【计算机制解说】:为什么 $(P_xR)\mathbf{x}=P_x(R\mathbf{x})$?因为矩阵乘法天生满足结合律:$(AB)\mathbf{x}=A(B\mathbf{x})$ 是定义层面的恒等式(把 $\mathbf{x}$ 的系数逐个分配即可验证)。由此得到的哲学结论是:

            变换的世界                矩阵的世界
       ┌──────────────────┐      ┌──────────────────┐
       │  先做 R,再做 P_x │  ⟷  │   矩阵乘积 P_x R  │
       │  复合是"串联"     │      │  乘法是"左乘作用" │
       └──────────────────┘      └──────────────────┘

“先做”的那个变换写在右边。这是线性代数里最常被记反的一点:$P_xR$ 意味着先 $R$ 后 $P_x$(从右往左读,像函数的复合 $f(g(x))$ 一样)。

示例 5(附加):反射关于直线 $y=x$,$S=\begin{bmatrix}0&1\\1&0\end{bmatrix}$

按列构造:$S\mathbf{e}_1=(0,1)^{\mathsf T}$,$S\mathbf{e}_2=(1,0)^{\mathsf T}$。所以 $S=\begin{bmatrix}0&1\\1&0\end{bmatrix}$。性质(脚本验算):$S^{\mathsf T}=S$,$S^2=I$,$\det S=-1$,特征值 $+1$(沿 $y=x$,不动)与 $-1$(沿 $y=-x$,被翻转)。$S(3,1)^{\mathsf T}=(1,3)^{\mathsf T}$ ✓。

反射与旋转的对比:旋转 $90^\circ$ 给出 $R^2=-I$、$\det=1$(保向);反射给出 $S^2=I$、$\det=-1$(反向)。行列式的符号记录了”手性”是否被翻转

示例 6(附加):转置作为 $2\times2$ 矩阵空间上的线性变换

取矩阵空间的基 $E_{11},E_{12},E_{21},E_{22}$(即 $\begin{bmatrix}1&0\\0&0\end{bmatrix},\begin{bmatrix}0&1\\0&0\end{bmatrix},\begin{bmatrix}0&0\\1&0\end{bmatrix},\begin{bmatrix}0&0\\0&1\end{bmatrix}$),坐标向量 $(a,b,c,d)^{\mathsf T}$ 代表 $\begin{bmatrix}a&b\\c&d\end{bmatrix}$。变换 $T(M)=M^{\mathsf T}$ 把 $(a,b,c,d)$ 送到 $(a,c,b,d)$。按列构造: \(T=\begin{bmatrix}1&0&0&0\\0&0&1&0\\0&1&0&0\\0&0&0&1\end{bmatrix}.\) 性质(脚本验算):$T^2=I_4$(转置两次还原),$\operatorname{tr}T=2$,$\operatorname{rank}T=4$,特征值 $+1$(重数 3)与 $-1$(重数 1)。特征值 $+1$ 的特征空间 = 对称矩阵(3 维),$-1$ 的特征空间 = 反对称矩阵(1 维),$3+1=4$ ✓。这再次说明矩阵空间也是向量空间,”矩阵的函数”也可以是线性变换(呼应讲次 11–12)。

示例 7(附加):积分算子在 $\mathcal{P}_2$ 上——输出空间维数更高

$T(p)=\int_0^x p(t)\,dt$。用输入基 $\{1,x,x^2\}$、输出基 $\{1,x,x^2,x^3\}$: \(T(1)=x,\qquad T(x)=\tfrac{x^2}{2},\qquad T(x^2)=\tfrac{x^3}{3}.\) 按列摆放得到 $4\times3$ 矩阵 \(I_4=\begin{bmatrix}0&0&0\\1&0&0\\0&1/2&0\\0&0&1/3\end{bmatrix}.\) 检验:$I_4(3,5,7)^{\mathsf T}=(0,3,2.5,7/3)^{\mathsf T}\approx(0,3,2.5,2.333333)^{\mathsf T}$,对应 $3x+\frac52x^2+\frac73x^3$,与直接积分一致(脚本验算通过)。注意这是一个 $4\times3$ 矩阵——变换的矩阵可以是长方形的,因为输入输出空间的维数可以不同。

矩阵分解的核心思想

本讲不引入新的分解,但它给出了理解所有分解的统一语言:分解 = 把一个变换拆成几个结构简单的变换的复合

  • $A=LU$(讲次 1–5):消元法把变换拆成”下三角变换 $\circ$ 上三角变换”。上三角意味着在特定基下”只把第 $k$ 个分量往上送”,与示例 3 中的求导矩阵形态同源。
  • $A=S\Lambda S^{-1}$(讲次 21–25):矩阵”照片”之间的换算规则,本讲已埋下伏笔——它就是讲次 31 的换基 $B=W^{-1}AW$。$\Lambda=\operatorname{diag}(\lambda_i)$ 意味着:在这组特殊基下,变换 $T$ 退化成”每个方向各自拉伸 $\lambda_i$ 倍”,方向之间互不干扰(解耦)
  • $A=Q\Lambda Q^{\mathsf T}$(对称矩阵):正交基下的解耦,保长且数值稳定。
  • $A=U\Sigma V^{\mathsf T}$(SVD,讲次 29):$A$ 的像空间与输入空间各配一组正交基,变换 = 旋转 $\circ$ 缩放 $\circ$ 旋转。
  • 投影 $P=P^{\mathsf T}=P^2$:既是本讲的算例,也说明幂等分解 $P$ 的”最小多项式是 $t^2-t$”,即 $P$ 只可能有两个特征值 $0,1$。

一句话:矩阵的”形状”反映的是基选得好不好;变换的”本性”(秩、核、像、特征值)不随基改变。

与其他讲次的关联

  • 与讲次 1–5(消元、$A=LU$):本讲首次把矩阵从”数的表格”提升为”变换的记录”。消元中的初等矩阵 $E_{ij}$ 本身就是线性变换(把第 $j$ 行减去 $l$ 倍第 $i$ 行),$E_{ij}^{-1}$ 存在且易求。
  • 与讲次 6–10(四个基本子空间):本讲给出翻译表:$N(A)=\ker T$,$C(A)=\operatorname{im}T$,$C(A^{\mathsf T})=\operatorname{im}T^$(转置变换的像),$N(A^{\mathsf T})=\ker T^$。秩—零化度定理就是维数公式。
  • 与讲次 11–12(矩阵空间、图):矩阵空间 $\mathbb{R}^{m\times n}$ 是 $mn$ 维向量空间,本讲的转置示例是标准演练;图上的关联矩阵 $A$ 把”节点电位差”变成”边上的电流”,也是一个线性变换。
  • 与讲次 14–17(正交、投影):示例 2 的 $P$ 是正交投影的特例;一般地 $P=A(A^{\mathsf T}A)^{-1}A^{\mathsf T}$,本讲的”对称 + 幂等”验证方法完全通用。
  • 与讲次 18–20(行列式):$\det R=1$(旋转保体积)、$\det S=-1$(反射翻手性)、$\det P=0$(投影降维),本讲的例子就是行列式几何意义的最佳素材。
  • 与讲次 21–25(特征值):特征向量 = “被变换只拉伸不转向”的方向,示例 2、5、6 都直接读出了特征向量。
  • 与讲次 27–29(正定、Jordan、SVD):$D$ 的幂零性预告了 Jordan 形;SVD 的两组基预告了讲次 31 的换基。
  • 与讲次 31(换基):本讲反复强调”矩阵依赖基”,下一讲立刻给出换基公式 $B=W^{-1}AW$。
  • 与讲次 33(伪逆):本讲把投影看成变换;讲次 33 会把 $AA^{+}$、$A^{+}A$ 解释为幂等的投影变换,正好接续本讲示例 2 的检验方法。

关键要点

  1. 线性变换的两个判据:$T(\mathbf{v}+\mathbf{w})=T(\mathbf{v})+T(\mathbf{w})$ 与 $T(c\mathbf{v})=cT(\mathbf{v})$;等价地 $T(c\mathbf{v}+d\mathbf{w})=cT(\mathbf{v})+dT(\mathbf{w})$。最快检测:$T(\mathbf{0})=\mathbf{0}$(平移立刻出局)。
  2. 造矩阵的黄金操作问 $T$ 对第 $j$ 个基向量做了什么,把答案按列放进第 $j$ 列。 输出必须用输出空间的基表示。
  3. 矩阵乘法 = 变换复合:$(AB)\mathbf{x}=A(B\mathbf{x})$,从右往左读(右边的先作用)。次序不可交换:$P_xR\neq RP_x$。
  4. 核 = 零空间,像 = 列空间:$\dim\ker T+\dim\operatorname{im}T=\dim V$。变换的秩与核不依赖基,矩阵的具体数字依赖基。
  5. 投影矩阵的三项体检:$P^2=P$(幂等)、$P^{\mathsf T}=P$(正交投影)、$\operatorname{tr}P=\dim(\text{目标子空间})$、$\det P=0$(除恒等外必降维)。

常见误区与注意事项

  1. 把”按列摆放”写成”按行摆放”。矩阵 $A$ 的第 $j$ 列 = $T(\mathbf{v}_j)$ 的坐标。若写成行,得到的其实是 $A^{\mathsf T}$,后续所有特征值、幂等性验证都会错。求导示例中若不声明约定,上三角与下三角两种写法都会出现,必须自己统一。
  2. 误以为”保持直线与平行”就是线性。平移保持直线与平行但不是线性。判据是原点不动 + 可加 + 齐次
  3. 忘记复合的次序。$P_xR$ 是”先 $R$ 后 $P_x$”。写代码时也要注意:想让向量先乘 $R$ 再乘 $P_x$,应写 Px @ (R @ v)(Px @ R) @ v,而不是 R @ Px @ v
  4. 把”投影到直线”与”投影到直线所在的方向向量”混淆。$T(\mathbf{x})=\frac{\mathbf{u}^{\mathsf T}\mathbf{x}}{\mathbf{u}^{\mathsf T}\mathbf{u}}\mathbf{u}$ 中分母必须有 $\mathbf{u}^{\mathsf T}\mathbf{u}$。若 $\mathbf{u}$ 是单位向量才可省略。用非单位向量 $\mathbf{u}=(1,1)^{\mathsf T}$ 算投影:$\frac{1}{2}\begin{bmatrix}1&1\\1&1\end{bmatrix}$——分母 $2$ 就是 $\mathbf{u}^{\mathsf T}\mathbf{u}$。
  5. 以为”非方阵不可能是变换的矩阵”。示例 7 的求导/积分证明长方形矩阵完全合法。输入 $n$ 维、输出 $m$ 维,矩阵就是 $m\times n$。
  6. 把 $\ker T$ 与 $\operatorname{im}T$ 放错空间。$\ker T\subseteq V$(输入空间),$\operatorname{im}T\subseteq W$(输出空间)。投影到 $y=x$ 时,$\ker$ 和 $\operatorname{im}$ 都恰好是 $\mathbb{R}^2$ 的子空间,容易造成”都在同一个空间”的错觉;换成求导($3$ 维 $\to$ 常数维)就更清楚。
  7. 误以为”矩阵相同 = 变换相同”。同一矩阵在不同基下代表不同变换;同一变换在不同基下是不同的矩阵。“矩阵 = 变换” 这句话只在基固定时成立。

思考题(带答案)

Q1.(纯计算)设 $T:\mathbb{R}^2\to\mathbb{R}^2$ 满足 $T(1,1)^{\mathsf T}=(2,0)^{\mathsf T}$ 且 $T(1,-1)^{\mathsf T}=(0,2)^{\mathsf T}$。求 $T$ 在标准基下的矩阵,并求 $T(3,1)^{\mathsf T}$。

答案 **方法:先用"作用于基"求出 $T$ 对标准基的作用,再按列摆放。** 已知的两个输入 $\\mathbf{u}_1=(1,1)^{\\mathsf T},\\mathbf{u}_2=(1,-1)^{\\mathsf T}$ 恰好构成一组基(它们不正交但线性无关)。先求它们的像的坐标:$T(\\mathbf{u}_1)=(2,0)^{\\mathsf T}$,$T(\\mathbf{u}_2)=(0,2)^{\\mathsf T}$。 由线性性, $$T\begin{bmatrix}1\\0\end{bmatrix}=T\Bigl(\frac{\mathbf{u}_1+\mathbf{u}_2}{2}\Bigr)=\frac{T(\mathbf{u}_1)+T(\mathbf{u}_2)}{2}=\frac{(2,0)+(0,2)}{2}=\begin{bmatrix}1\\1\end{bmatrix},$$ $$T\begin{bmatrix}0\\1\end{bmatrix}=T\Bigl(\frac{\mathbf{u}_1-\mathbf{u}_2}{2}\Bigr)=\frac{T(\mathbf{u}_1)-T(\mathbf{u}_2)}{2}=\frac{(2,0)-(0,2)}{2}=\begin{bmatrix}1\\-1\end{bmatrix}.$$ 按列摆放: $$A=\begin{bmatrix}1&1\\1&-1\end{bmatrix}.$$ 于是 $$T\begin{bmatrix}3\\1\end{bmatrix}=A\begin{bmatrix}3\\1\end{bmatrix}=\begin{bmatrix}1\cdot3+1\cdot1\\1\cdot3+(-1)\cdot1\end{bmatrix}=\begin{bmatrix}4\\2\end{bmatrix}.$$ **核对**:直接算 $T(\\mathbf{u}_1)=A(1,1)^{\\mathsf T}=(2,0)^{\\mathsf T}$ ✓;$T(\\mathbf{u}_2)=A(1,-1)^{\\mathsf T}=(0,2)^{\\mathsf T}$ ✓。另外 $\\det A=-2\\neq0$,所以 $T$ 可逆——它把基 $\\{\\mathbf{u}_1,\\mathbf{u}_2\\}$ 送到 $\\{(2,0),(0,2)\\}$,是一个保持独立性的变换。

Q2.(概念理解)判断下列变换是否线性,并给出理由。 (a) $T(x,y)=(x+1,\ y)$;(b) $T(x,y)=(2x,\ 3y)$;(c) $T(x,y)=(xy,\ 0)$;(d) $T(p)=p^{\prime\prime}+2p^{\prime}$ 作用在 $\mathcal{P}_3$ 上;(e) $T(x,y)=(\vert (x,y)\vert ,0)$。

答案 (a) **不是**。$T(0,0)=(1,0)\\neq(0,0)$。它是沿 $x$ 方向的平移。 (b) **是**。$T(c(x,y)+d(u,v))=(2(cx+du),\\,3(cy+dv))=c(2x,3y)+d(2u,3v)$。矩阵是 $\\operatorname{diag}(2,3)$。 (c) **不是**。$T(1,0)=(0,0)$、$T(0,1)=(0,0)$,但 $T(1,1)=(1,0)\\neq(0,0)+ (0,0)$,破坏可加性。它连 $T(\\mathbf{e}_1+\\mathbf{e}_2)=T(\\mathbf{e}_1)+T(\\mathbf{e}_2)$ 都不满足。(注意它是二次型,不是线性变换;但 $xy$ 作为 $\\mathbb{R}^2$ 上的函数对应双线性形式。) (d) **是**。导数是线性的:$(p+q)^{\\prime\\prime}+2(p+q)'=(p^{\\prime\\prime}+2p^{\\prime})+(q^{\\prime\\prime}+2q^{\\prime})$,且 $(cp)^{\\prime\\prime}+2(cp)'=c(p^{\\prime\\prime}+2p^{\\prime})$。在基 $\\{1,x,x^2,x^3\\}$ 下,$T(1)=0$,$T(x)=2$,$T(x^2)=2+4x$,$T(x^3)=6x+6x^2$,所以 $$A=\begin{bmatrix}0&2&2&0\\0&0&4&6\\0&0&0&6\\0&0&0&0\end{bmatrix}.$$ (e) **不是**。$T(-\\mathbf{x})=(\\vert \\mathbf{x}\\vert ,0)=T(\\mathbf{x})$,但要求 $T(-\\mathbf{x})=-T(\\mathbf{x})$,即 $(\\vert \\mathbf{x}\\vert ,0)=(-\\vert \\mathbf{x}\\vert ,0)$,只有 $\\mathbf{x}=\\mathbf{0}$ 成立。齐次性被破坏。

Q3.(计算 + 推理)设 $P=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$ 是投影到 $y=x$ 的矩阵,$S=\begin{bmatrix}0&1\\1&0\end{bmatrix}$ 是关于 $y=x$ 的反射。计算 $PS$、$SP$、$SPS$,并用几何语言解释每个结果。

答案 $$PS=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}\begin{bmatrix}0&1\\1&0\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=P,$$ (逐项:第 1 行第 1 列 $=0\\cdot1+1\\cdot1=1$,除以 $2$ 得 $1/2$;其余同理。) $$SP=\begin{bmatrix}0&1\\1&0\end{bmatrix}\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}=P.$$ $$SPS=S(PS)=SP=P.$$ **几何解释**:$S$ 是沿直线 $y=x$ 的反射。反射后再投影到该直线,与直接投影结果相同——因为反射**不改变向量在直线上的分量**(只翻转垂直分量),而投影只保留沿直线分量。同理先投影再反射:投影结果已在直线上,反射不动它。所以 $PS=SP=P$,即 **$P$ 与 $S$ 可交换**。三个结果都是 $P$。 **额外收获**:$SPS=P$ 且 $S^2=I$,所以 $S$ 给出 $P$ 的一个"相似矩阵仍为自己"的例子——这对矩阵在基变换下保持不变(讲次 31)。

附录 A:变换前后的向量图(几何总览)

下面这张图把本讲最重要的四个变换画在同一张 $\mathbb{R}^2$ 图上:原始网格 → 变换后网格。看”网格变成什么形状”,比记矩阵更快

   ┌─────────────────────────────┐        ┌─────────────────────────────┐
   │  原始 R²(标准网格)         │        │  投影到 y = x 之后           │
   │                             │        │                             │
   │      y                      │        │      y                      │
   │      │    ╱                 │        │      │    ╱                 │
   │      │   ● v=(3,1)          │        │      │   ╱                 │
   │      │  ╱                   │        │      │  ● Pv=(2,2) ← 落到直线上│
   │      │ ╱                    │        │      ├─╱──────────── y=x     │
   │  ────┼──────────► x         │        │  ────┼──────────► x         │
   │      │                     │        │      │                     │
   │   整张平面(2 维)           │        │   只剩一条直线(1 维)!    │
   │   垂直方向 (1,-1) 也被保留   │        │   垂直分量被"压掉"          │
   └─────────────────────────────┘        └─────────────────────────────┘
        网格仍是"方的"                        网格被压成一条线(退化了)

   ┌─────────────────────────────┐        ┌─────────────────────────────┐
   │  绕原点旋转 90°              │        │  沿 x 方向拉伸 2 倍          │
   │                             │        │                             │
   │      y                      │        │      y                      │
   │      │   ● Rv=(-1,3)        │        │      │  ● Tv=(6,1)         │
   │      │  ╱                  │        │      │ ╱                   │
   │      │ ╱                   │        │      │╱                    │
   │      │╱  ● v=(3,1)         │        │      ├────────────────► x     │
   │  ────┼──────────► x         │        │      │                     │
   │      │                     │        │   网格仍是"方的"但 x 方向拉长 │
   │   网格整体转动 90°(保长、保角)│      │   det = 2(面积放大 2 倍)    │
   └─────────────────────────────┘        └─────────────────────────────┘

   判据速记:
   ┌────────────┬──────────┬──────────┬──────────┬──────────────┐
   │ 变换        │ 原点动?  │ 网格形状  │ 行列式    │ 可逆?        │
   ├────────────┼──────────┼──────────┼──────────┼──────────────┤
   │ 投影        │ 不动     │ 压成线    │ 0        │ 不可逆        │
   │ 旋转        │ 不动     │ 方形(转)│ +1       │ 可逆          │
   │ 反射        │ 不动     │ 方形(翻)│ −1       │ 可逆          │
   │ 拉伸(2,3倍) │ 不动     │ 长方形    │ +6       │ 可逆          │
   │ 平移        │ 动了!   │ 方形(移)│ —        │ (非线性的)  │
   └────────────┴──────────┴──────────┴──────────┴──────────────┘
   ← 最后一行的"原点动了"就是平移唯一的破绽

附录 B:常见线性变换矩阵速查表($\mathbb{R}^2$,标准基)

变换定义式矩阵行列式特征值
恒等$\mathbf{x}\mapsto\mathbf{x}$$\begin{bmatrix}1&0\\0&1\end{bmatrix}$21$1,1$$\{\mathbf{0}\}$
零变换$\mathbf{x}\mapsto\mathbf{0}$$\begin{bmatrix}0&0\\0&0\end{bmatrix}$00$0,0$$\mathbb{R}^2$
投影到 $x$ 轴$(x,y)\mapsto(x,0)$$\begin{bmatrix}1&0\\0&0\end{bmatrix}$10$1,0$$y$ 轴
投影到 $y=x$$(x,y)\mapsto\frac{x+y}{2}(1,1)$$\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$10$1,0$$\operatorname{span}(1,-1)$
投影到 $y=-x$$(x,y)\mapsto\frac{x-y}{2}(1,-1)$$\frac12\begin{bmatrix}1&-1\\-1&1\end{bmatrix}$10$1,0$$\operatorname{span}(1,1)$
旋转 $\theta$逆时针转 $\theta$$\begin{bmatrix}\cos\theta&-\sin\theta\\ \sin\theta&\cos\theta\end{bmatrix}$$2\cos\theta$1$e^{\pm i\theta}$$\{\mathbf{0}\}$
旋转 $90^\circ$$\begin{bmatrix}0&-1\\1&0\end{bmatrix}$01$\pm i$$\{\mathbf{0}\}$
反射($y$ 轴)$(x,y)\mapsto(-x,y)$$\begin{bmatrix}-1&0\\0&1\end{bmatrix}$0$-1$$1,-1$$\{\mathbf{0}\}$
反射($y=x$)$(x,y)\mapsto(y,x)$$\begin{bmatrix}0&1\\1&0\end{bmatrix}$0$-1$$1,-1$$\{\mathbf{0}\}$
拉伸$(x,y)\mapsto(2x,3y)$$\begin{bmatrix}2&0\\0&3\end{bmatrix}$56$2,3$$\{\mathbf{0}\}$
剪切$(x,y)\mapsto(x+y,y)$$\begin{bmatrix}1&1\\0&1\end{bmatrix}$21$1,1$(不可对角化)$\{\mathbf{0}\}$

三条自检规则

  1. 行列式 $=0$ ⇔ 有非零核 ⇔ 不可逆 ⇔ 降维。
  2. 迹 $=$ 特征值之和;对称矩阵/三角矩阵的迹与行列式最容易手算($\det=ad-bc$)。
  3. 若 $\det$ 为负,变换翻转手性(左右手互换);若 $\vert \det\vert =1$,面积保持不变。

验算样例(脚本通过):投影 $y=x$ 的 $\operatorname{tr}=1$、$\det=0$、特征值 $1,0$;反射 $y=x$ 的 $S^2=I$、$\det=-1$、特征值 $1,-1$;拉伸 $(2,3)$ 的 $\operatorname{tr}=5$、$\det=6$、特征值 $2,3$。

附录 C:离散求导——从多项式求导到差分矩阵

示例 3 的求导算子 $D$ 有一个极其有用的离散版本。把区间 $[0,1]$ 上的函数 $f$ 在节点 $h=\frac1n$ 处采样得 $\mathbf{f}=(f_1,\dots,f_n)^{\mathsf T}$,用前向差分近似导数: \((D\mathbf{f})_i=\frac{f_{i+1}-f_i}{h}.\) 这给出一个 $(n-1)\times n$ 矩阵。取 $n=4$、$h=1$: \(D_4=\begin{bmatrix}-1&1&0&0\\0&-1&1&0\\0&0&-1&1\end{bmatrix}.\) 核验(脚本验算):$D_4(1,1,1,1)^{\mathsf T}=(0,0,0)^{\mathsf T}$ ✓ —— 常函数的导数为零,与连续情形完全一致。 $D_4(1,2,3,4)^{\mathsf T}=(1,1,1)^{\mathsf T}$ ✓($D_4$ 是 $3\times4$,结果按定义是 $3$ 维)—— 对 $f_i=c\cdot i$ 得到常数斜率,也一致。 秩与核:$D_4$ 是 $3\times4$,它的三行是 $(-1,1,0,0)$、$(0,-1,1,0)$、$(0,0,-1,1)$——逐行看,第 1 行的首个非零元在第 1 位,第 2 行在第 2 位,第 3 行在第 3 位,首非零元的位置严格递增,故线性无关(行阶梯形判据),$\operatorname{rank}=3$,$\dim N(D_4)=4-3=1$,零空间正是常数向量 $\operatorname{span}\{(1,1,1,1)\}$。

与示例 3 的对照

 连续求导 $D$离散差分 $D_4$
形状$3\times3$$3\times4$
23
$\dim N$1(常函数)1(常数向量)
形态上三角双对角(带状)
幂零性$D^3=O$不成立(非方阵)

这个对照的意义:连续求导是方阵但奇异(因为多项式空间”闭合”),离散差分是长方形且满行秩(因为网格边界少一个点)。同一个数学操作,在不同空间的基下呈现完全不同的矩阵形状——这正是”矩阵依赖基、变换不依赖基”的最佳注解。

附录 D:判定与构造的完整工作流

面对”$T$ 是什么样的线性变换”这类问题,按下面五步走,不会出错:

   步骤 1  检查 T(0) = 0 ?           ← 不等则直接判定"非线性",结束
   ────────────────────────────────────────────────────────────
   步骤 2  检查 T(cv+dw) = cT(v)+dT(w) ? ← 用符号推导,别只试数字
   ────────────────────────────────────────────────────────────
   步骤 3  确定输入空间的基 v1..vn      ← 以及输出空间的基 w1..wm
   ────────────────────────────────────────────────────────────
   步骤 4  逐个求 T(vj),并把它写成输出基的线性组合
           (这部分是"解小方程组",别偷懒跳过)
   ────────────────────────────────────────────────────────────
   步骤 5  按列摆放:A 的第 j 列 = 步骤 4 的系数向量
   ────────────────────────────────────────────────────────────
   检查    用几个随机向量验证 A x 与 T(x) 是否一致
   检查    rank(A) = dim im T,n - rank(A) = dim ker T

为什么第 4 步最容易出错:如果输出基不是标准基,”写成分解式”这一步就真的有算术量。例如示例 3 中 $T(x^2)=2x$,在基 $\{1,x,x^2\}$ 下坐标是 $(0,2,0)$ 而不是 $(0,0,2)$——必须让第 2 个位置(对应 $x$)拿到系数 2

验算流程(可直接照抄)

// 用脚本验证"矩阵 = 变换"的一致性
const A = [[0,1,0],[0,0,2],[0,0,0]];        // 约定:基 1,x,x^2,列向量
const Tpoly = (a,b,c) => [b, 2*c, 0];        // T = d/dx:a+bx+cx^2 -> b+2cx
const coords = [3,5,7];                      // p = 3+5x+7x^2
const viaMatrix = A.map(r => r.reduce((s,v,i) => s+v*coords[i], 0));
console.log(viaMatrix, Tpoly(...coords));    // 两者必须相等 -> [5,14,0]

附录 E:核与像的维数账本(把讲次 6–10 翻译过来)

设 $T:\mathbb{R}^n\to\mathbb{R}^m$,矩阵 $A$($m\times n$),$r=\operatorname{rank}A$。四个基本子空间的变换语言版本:

子空间讲次 6–10 的说法变换语言维数住在哪
$C(A)$列空间$\operatorname{im}T$(像)$r$$\mathbb{R}^m$(输出空间)
$N(A)$零空间$\ker T$(核)$n-r$$\mathbb{R}^n$(输入空间)
$C(A^{\mathsf T})$行空间$\operatorname{im}T^{*}$(转置变换的像)$r$$\mathbb{R}^n$(输入空间)
$N(A^{\mathsf T})$左零空间$\ker T^{*}$$m-r$$\mathbb{R}^m$(输出空间)

正交关系(讲次 10)在变换语言下:$\ker T=(\operatorname{im}T^{})^{\perp}$,$\ker T^{}=(\operatorname{im}T)^{\perp}$。即核是”像的正交补”,反过来也成立

用投影 $P=\frac12\begin{bmatrix}1&1\\1&1\end{bmatrix}$ 核验账本($n=m=2$,$r=1$):

  • $C(P)=\operatorname{span}\{(1,1)\}$,维数 1 ✓
  • $N(P)=\operatorname{span}\{(1,-1)\}$,维数 $2-1=1$ ✓
  • $C(P^{\mathsf T})=C(P)=\operatorname{span}\{(1,1)\}$(对称!),维数 1 ✓
  • $N(P^{\mathsf T})=N(P)=\operatorname{span}\{(1,-1)\}$,维数 $2-1=1$ ✓
  • 正交:$(1,-1)\cdot(1,1)=1-1=0$ ✓
  • 核与像的维数和 $1+1=2=n$ ✓

翻译三条定理

  1. 秩—零化度:$\dim\ker T+\dim\operatorname{im}T=n$ → “被压死的 + 被送出的 = 全部输入”。
  2. 可逆性:$T$ 可逆 ⇔ $\ker T=\{\mathbf{0}\}$ 且 $\operatorname{im}T=W$ → “$T$ 既单又满”。
  3. 一对一:$\ker T=\{\mathbf{0}\}$ ⇔ $T$ 是单射 → “没有两个不同的输入被送到同一个输出”。

附录 F:变换复合的两种读法与测验

测验:下面的等式是否成立? \(\text{(i) }(AB)^{\mathsf T}=B^{\mathsf T}A^{\mathsf T}\qquad\text{(ii) }(AB)^{-1}=B^{-1}A^{-1}\qquad\text{(iii) }(AB)^2=A^2B^2.\)

答案与变换解释

  • (i) 成立。用变换语言:$B$ 先作用、$A$ 后作用;转置(伴随)会把顺序颠倒——先转置的变成后转置的
  • (ii) 成立(当两者都可逆)。”先 $B$ 后 $A$”的逆必须是”先撤销 $A$ 再撤销 $B$”,所以是 $B^{-1}A^{-1}$。穿鞋脱鞋顺序相反
  • (iii) 一般不成立!$(AB)(AB)=ABAB\neq AABB$,除非 $A,B$ 可交换($AB=BA$)。几何上:先拉伸再旋转,与拉伸两次,完全是两回事。

验算例(脚本通过): \(A=\begin{bmatrix}1&1\\0&1\end{bmatrix}\text{(剪切)},\quad B=\begin{bmatrix}2&0\\0&1\end{bmatrix}\text{(拉伸)},\quad AB=\begin{bmatrix}2&1\\0&1\end{bmatrix},\quad BA=\begin{bmatrix}2&2\\0&1\end{bmatrix},\) \(AB\neq BA,\qquad (AB)^2=\begin{bmatrix}4&3\\0&1\end{bmatrix}\neq A^2B^2=\begin{bmatrix}1&2\\0&1\end{bmatrix}\begin{bmatrix}4&0\\0&1\end{bmatrix}=\begin{bmatrix}4&2\\0&1\end{bmatrix}.\) 结论:非交换性是变换复合的内在属性,不是矩阵的缺陷。

附录 G:三条延伸思考(不附答案,供自测)

  1. 设 $T:\mathbb{R}^{2\times2}\to\mathbb{R}^{2\times2}$ 定义为 $T(M)=M+M^{\mathsf T}$。它是线性的吗?它的核与像是什么?(提示:核 = 反对称矩阵,像 = 对称矩阵,两个维数相加 $1+3=4$ ✓。用附录 E 的转置示例数据可验证。)
  2. 设 $T(p)=p(x)p^{\prime}(x)$ 作用在多项式上。它是线性的吗?(提示:考察 $T(p+q)$,会发现交叉项 $p^{\prime}q+pq^{\prime}$ 无法消去。)
  3. 若 $T:\mathbb{R}^3\to\mathbb{R}^3$ 把每个向量投影到平面 $x+y+z=0$ 上,$T$ 的矩阵是什么?它的迹是多少?(提示:先求平面法向 $\mathbf{n}=(1,1,1)^{\mathsf T}$,投影矩阵 $P=I-\frac{\mathbf{n}\mathbf{n}^{\mathsf T}}{\mathbf{n}^{\mathsf T}\mathbf{n}}$,迹 $=3-1=2$ = 平面维数 ✓。)