Skip to content

内积、正交与投影 ​

上一章留下一个用了一半的工具:A 的每一行是线性泛函,"吃进一个列向量,吐出一个数". 那个数是怎么吃的?用的就是点积——高中的数量积.

但高中只在平面上定义过它,而且靠的是夹角:a⋅b=∣a∣∣b∣cos⁡θ\mathbf{a} \cdot \mathbf{b} = |\mathbf{a}||\mathbf{b}|\cos\theta. 这一章把顺序倒过来:先给点积一个不需要画图的定义(内积),再让长度、夹角、垂直、投影从它里面长出来. 这样,任意维空间第一次有了度量——R512\mathbb{R}^{512} 里两个向量的夹角不是看出来的,是算出来的.

高中那点工具,够用到哪里 ​

这一章的定义你在高中几乎原样见过:

  • 必修二 6.2.4 数量积:几何定义 a⋅b=∣a∣∣b∣cos⁡θ\mathbf{a}\cdot\mathbf{b} = |\mathbf{a}||\mathbf{b}|\cos\theta,垂直等价于点积为零;同一节里还有一个"投影向量"——a\mathbf{a} 在 b\mathbf{b} 方向上的投影向量是 a⋅b∣b∣2b\dfrac{\mathbf{a}\cdot\mathbf{b}}{|\mathbf{b}|^2}\mathbf{b},这就是本章投影公式的二维原版.
  • 必修二 6.3.5 数量积的坐标表示:a1b1+a2b2a_1b_1 + a_2b_2;选必一 1.1.2 把它搬进空间. 到了 nn 维没有看得见的夹角,于是坐标公式从推论升级成定义.
  • 选必一 1.4.2 用空间向量研究距离、夹角:高中用向量算距离与夹角的标准动作——建系、求坐标、点积——本章给它统一的语言.

一个高中题,投影读法. 求点 P(3,4)P(3,4) 到直线 y=xy = x 的距离. 高中的标准做法是套点到直线距离公式;用投影做是这样:直线上取 Q(0,0)Q(0,0),方向向量 d=(1,1)\mathbf{d} = (1,1),把 QP→=(3,4)\overrightarrow{QP} = (3,4) 在 d\mathbf{d} 上投影:

proj⁡dQP→=72(1,1)=(3.5, 3.5),残差=(3,4)−(3.5,3.5)=(−0.5, 0.5).\operatorname{proj}_{\mathbf{d}}\overrightarrow{QP} = \frac{7}{2}(1,1) = (3.5,\ 3.5), \qquad \text{残差} = (3,4) - (3.5,3.5) = (-0.5,\ 0.5).

残差与直线垂直,长度 0.5≈0.707\sqrt{0.5} \approx 0.707,就是点到直线的距离(与公式 ∣3−4∣/2|3-4|/\sqrt{2} 一致). 距离 = 去掉投影后剩下的垂直分量——本章的投影与最佳逼近,都是这个动作的高维版本.

定义:内积 ​

定义(内积) R\mathbb{R} 上向量空间 VV 的内积是一台"吃两个向量、吐一个实数"的机器 ⟨⋅,⋅⟩\langle \cdot, \cdot \rangle,满足三条: (i) 对称:⟨u,v⟩=⟨v,u⟩\langle \mathbf{u}, \mathbf{v} \rangle = \langle \mathbf{v}, \mathbf{u} \rangle; (ii) 对第一变量线性:⟨au+bv,w⟩=a⟨u,w⟩+b⟨v,w⟩\langle a\mathbf{u} + b\mathbf{v}, \mathbf{w} \rangle = a\langle \mathbf{u}, \mathbf{w} \rangle + b\langle \mathbf{v}, \mathbf{w} \rangle; (iii) 正定:⟨v,v⟩≥0\langle \mathbf{v}, \mathbf{v} \rangle \ge 0,且 ⟨v,v⟩=0\langle \mathbf{v}, \mathbf{v} \rangle = 0 当且仅当 v=0\mathbf{v} = \mathbf{0}.

人话版:可以交换;对加法与伸缩不闹脾气;自己和自己的内积永不为负,只有零向量才为零.

装上内积的实向量空间叫内积空间(inner product space). Rn\mathbb{R}^n 配标准内积、平面向量配数量积,都是内积空间;这个词只是给"能做内积的向量空间"起个名字——本章后半段说"有限维内积空间上的 Riesz 表示"时,指的就是这种空间.

定义(标准内积) Rn\mathbb{R}^n 上的标准内积是

⟨x,y⟩=x1y1+x2y2+⋯+xnyn.\langle \mathbf{x}, \mathbf{y} \rangle = x_1y_1 + x_2y_2 + \cdots + x_ny_n.

高中数量积就是 R2\mathbb{R}^2 与 R3\mathbb{R}^3 的标准内积:几何定义在二维里能画出来,坐标公式才是能带进任意维的形式.

几何直觉. 内积可以读成"长度乘投影":

⟨u,v⟩=∣u∣ ∣v∣cos⁡θ=∣u∣×(v 在 u 方向上的投影长度).\langle \mathbf{u}, \mathbf{v} \rangle = |\mathbf{u}|\,|\mathbf{v}|\cos\theta = |\mathbf{u}| \times (\mathbf{v} \text{ 在 } \mathbf{u} \text{ 方向上的投影长度}).

符号告诉你三件事:为正表示大致同向,为零表示垂直,为负表示大致反向. 高维里没有"看得见的夹角",但这条读法原样成立——夹角是算出来的,不是画出来的.

不是随便什么二元函数都叫内积. 比如 ⟨x,y⟩=x1y2\langle \mathbf{x}, \mathbf{y} \rangle = x_1y_2 不对称;⟨x,y⟩=x1y1−x2y2\langle \mathbf{x}, \mathbf{y} \rangle = x_1y_1 - x_2y_2 不正定(取 x=(0,1)\mathbf{x} = (0,1) 得 −1-1),都不合格.

长度、距离与夹角 ​

定义(长度与距离) ∣v∣=⟨v,v⟩|\mathbf{v}| = \sqrt{\langle \mathbf{v}, \mathbf{v} \rangle};两个向量的距离是 d(u,v)=∣u−v∣d(\mathbf{u}, \mathbf{v}) = |\mathbf{u} - \mathbf{v}|. 长度为 1 的向量叫单位向量;任何非零向量除以自己的长度就变成单位向量,这个过程叫归一化.

要把夹角从内积里定义出来,得先保证余弦值不会超过 1.

命题(柯西–施瓦茨) ∣⟨u,v⟩∣≤∣u∣ ∣v∣|\langle \mathbf{u}, \mathbf{v} \rangle| \le |\mathbf{u}|\,|\mathbf{v}|;等号成立当且仅当 u\mathbf{u}、v\mathbf{v} 线性相关.

证明

若 v=0\mathbf{v} = \mathbf{0},两边都是 00,结论显然. 设 v≠0\mathbf{v} \ne \mathbf{0}. 对任意实数 tt,

0≤∣u−tv∣2=⟨u−tv,u−tv⟩=∣u∣2−2t⟨u,v⟩+t2∣v∣2.0 \le |\mathbf{u} - t\mathbf{v}|^2 = \langle \mathbf{u} - t\mathbf{v}, \mathbf{u} - t\mathbf{v} \rangle = |\mathbf{u}|^2 - 2t\langle \mathbf{u}, \mathbf{v} \rangle + t^2|\mathbf{v}|^2.

右边是关于 tt 的二次式,开口向上且恒非负,所以判别式不大于零:

4⟨u,v⟩2−4∣u∣2∣v∣2≤0,4\langle \mathbf{u}, \mathbf{v} \rangle^2 - 4|\mathbf{u}|^2|\mathbf{v}|^2 \le 0,

即 ⟨u,v⟩2≤∣u∣2∣v∣2\langle \mathbf{u}, \mathbf{v} \rangle^2 \le |\mathbf{u}|^2|\mathbf{v}|^2. 两边开方即可. 等号成立时上述二次式有实根 tt,此时 u=tv\mathbf{u} = t\mathbf{v} 或 v=0\mathbf{v} = \mathbf{0},都是线性相关. ■\blacksquare

有了它,夹角就可以定义了:

cos⁡θ=⟨u,v⟩∣u∣ ∣v∣.\cos\theta = \frac{\langle \mathbf{u}, \mathbf{v} \rangle}{|\mathbf{u}|\,|\mathbf{v}|}.

右边总落在 [−1,1][-1, 1] 里,不会出现"余弦等于 2"的尴尬. 长度与距离的三条常识性质(非负、对伸缩齐次、三角形不等式)都能从内积公理推出来,最后一条要用柯西–施瓦茨.

几何直觉(先算两个数).

  • (1,0,1,0)(1,0,1,0) 与 (0,1,0,1)(0,1,0,1) 的内积是 00:两个 R4\mathbb{R}^4 里的向量互相垂直,和平面上的直角是一回事;
  • (3,4)(3,4) 与 (1,0)(1,0) 的夹角:内积是 33,模分别是 55 和 11,所以 cos⁡θ=3/5\cos\theta = 3/5——正是 3-4-5 直角三角形里的邻边比.

维数越高,"垂直的方向"越多:给定一个非零向量,与它正交的向量会凑成一个 n−1n-1 维的子空间(第 6 章会正式用上这件事).

正交、正交基与正交化 ​

定义(正交) 若 ⟨u,v⟩=0\langle \mathbf{u}, \mathbf{v} \rangle = 0,称 u\mathbf{u} 与 v\mathbf{v} 正交,记作 u⊥v\mathbf{u} \perp \mathbf{v}.

勾股定理在抽象内积里照旧成立:若 u⊥v\mathbf{u} \perp \mathbf{v},则

∣u+v∣2=∣u∣2+∣v∣2|\mathbf{u} + \mathbf{v}|^2 = |\mathbf{u}|^2 + |\mathbf{v}|^2

(把左边按内积展开,交叉项 ⟨u,v⟩+⟨v,u⟩\langle \mathbf{u}, \mathbf{v} \rangle + \langle \mathbf{v}, \mathbf{u} \rangle 为零).

定义(正交组、正交基、标准正交基) 两两正交的非零向量组叫正交组;若它还是 VV 的基,叫正交基;若每个向量长度都是 1,叫标准正交基.

正交组自动线性无关,这是"基"的条件里最值钱的部分.

证明

设 u1,…,uk\mathbf{u}_1, \dots, \mathbf{u}_k 两两正交且都非零. 若 c1u1+⋯+ckuk=0c_1\mathbf{u}_1 + \cdots + c_k\mathbf{u}_k = \mathbf{0},两边与 uj\mathbf{u}_j 作内积:左边只剩 cj⟨uj,uj⟩c_j\langle \mathbf{u}_j, \mathbf{u}_j \rangle(其余项两两正交为零),右边是 00. 于是 cj∣uj∣2=0c_j|\mathbf{u}_j|^2 = 0,而 uj≠0\mathbf{u}_j \ne \mathbf{0} 故 ∣uj∣2≠0|\mathbf{u}_j|^2 \ne 0,得 cj=0c_j = 0. 每个系数都是零,线性无关. ■\blacksquare

正交基的第一个好处:坐标不用解方程组. 一般基下求坐标要解 nn 个方程(上一章的列视角);正交基下

v=⟨v,u1⟩⟨u1,u1⟩u1+⋯+⟨v,un⟩⟨un,un⟩un,\mathbf{v} = \frac{\langle \mathbf{v}, \mathbf{u}_1 \rangle}{\langle \mathbf{u}_1, \mathbf{u}_1 \rangle}\mathbf{u}_1 + \cdots + \frac{\langle \mathbf{v}, \mathbf{u}_n \rangle}{\langle \mathbf{u}_n, \mathbf{u}_n \rangle}\mathbf{u}_n,

标准正交基下分母全是 1,坐标就是内积 ⟨v,ei⟩\langle \mathbf{v}, \mathbf{e}_i \rangle. 拿第二章的例子:v=(4,0)\mathbf{v} = (4, 0) 在 u1=(1,1)\mathbf{u}_1 = (1,1)、u2=(1,−1)\mathbf{u}_2 = (1,-1) 下的坐标,直接算 ⟨v,u1⟩/2=2\langle \mathbf{v}, \mathbf{u}_1 \rangle / 2 = 2、⟨v,u2⟩/2=2\langle \mathbf{v}, \mathbf{u}_2 \rangle / 2 = 2,坐标 (2,2)(2, 2),不必解方程.

基不正交时,内积没有简写公式,但代价可以当场算清:把两个向量按基展开,用多重线性直接乘开,

⟨u,v⟩=∑i,juivj⟨bi,bj⟩,\langle \mathbf{u}, \mathbf{v} \rangle = \sum_{i,j} u^i v^j \langle \mathbf{b}_i, \mathbf{b}_j \rangle,

把 n2n^2 个数 ⟨bi,bj⟩\langle \mathbf{b}_i, \mathbf{b}_j \rangle 算一遍即可. 正交基把这个和省成 nn 项——只剩 i=ji = j 的那些,这就是"正交"真正的红利.

任意一组线性无关的向量都能加工成正交基,方法是逐一"减掉已有方向上的分量".

算法(Gram–Schmidt 正交化) 给定线性无关的 a1,…,ak\mathbf{a}_1, \dots, \mathbf{a}_k:

  1. e1=a1/∣a1∣\mathbf{e}_1 = \mathbf{a}_1 / |\mathbf{a}_1|;
  2. 对每个 j>1j > 1:先减掉它在已有方向上的全部分量,bj=aj−∑i<j⟨aj,ei⟩ei\mathbf{b}_j = \mathbf{a}_j - \sum_{i<j} \langle \mathbf{a}_j, \mathbf{e}_i \rangle \mathbf{e}_i;再归一化 ej=bj/∣bj∣\mathbf{e}_j = \mathbf{b}_j / |\mathbf{b}_j|. 输出 e1,…,ek\mathbf{e}_1, \dots, \mathbf{e}_k 两两正交、长度为 1,且张成与原来相同的空间.

二维手算一个:a=(1,1)\mathbf{a} = (1,1),b=(2,0)\mathbf{b} = (2,0). 先归一化 e1=(1,1)/2\mathbf{e}_1 = (1,1)/\sqrt{2};再算 ⟨b,e1⟩=2/2=2\langle \mathbf{b}, \mathbf{e}_1 \rangle = 2/\sqrt{2} = \sqrt{2},于是

b⊥=b−2 e1=(2,0)−(1,1)=(1,−1),e2=(1,−1)2.\mathbf{b}_\perp = \mathbf{b} - \sqrt{2}\,\mathbf{e}_1 = (2,0) - (1,1) = (1,-1), \qquad \mathbf{e}_2 = \frac{(1,-1)}{\sqrt{2}}.

实验里可以拖动 a\mathbf{a}、b\mathbf{b} 验证这件事.

三维走一遍,看循环长什么样. 取 R3\mathbb{R}^3 里的三支向量

a1=(1,1,0),a2=(1,0,1),a3=(0,1,1).\mathbf{a}_1 = (1,1,0), \quad \mathbf{a}_2 = (1,0,1), \quad \mathbf{a}_3 = (0,1,1).

  • e1=12(1,1,0)\mathbf{e}_1 = \frac{1}{\sqrt{2}}(1,1,0);
  • a2\mathbf{a}_2 减掉在 e1\mathbf{e}_1 上的影子(⟨a2,e1⟩=12\langle \mathbf{a}_2, \mathbf{e}_1 \rangle = \frac{1}{\sqrt{2}}):

b2=(1,0,1)−12(1,1,0)=(12,−12,1),∣b2∣=62,e2=16(1,−1,2);\mathbf{b}_2 = (1,0,1) - \frac{1}{2}(1,1,0) = \left(\frac{1}{2}, -\frac{1}{2}, 1\right), \qquad |\mathbf{b}_2| = \frac{\sqrt{6}}{2}, \qquad \mathbf{e}_2 = \frac{1}{\sqrt{6}}(1,-1,2);

  • a3\mathbf{a}_3 要减两个影子(⟨a3,e1⟩=12\langle \mathbf{a}_3, \mathbf{e}_1 \rangle = \frac{1}{\sqrt{2}},⟨a3,e2⟩=16\langle \mathbf{a}_3, \mathbf{e}_2 \rangle = \frac{1}{\sqrt{6}}):

b3=(0,1,1)−12(1,1,0)−16(1,−1,2)=(−23,23,23),e3=13(−1,1,1).\mathbf{b}_3 = (0,1,1) - \frac{1}{2}(1,1,0) - \frac{1}{6}(1,-1,2) = \left(-\frac{2}{3}, \frac{2}{3}, \frac{2}{3}\right), \qquad \mathbf{e}_3 = \frac{1}{\sqrt{3}}(-1,1,1).

逐个验证 ⟨ei,ej⟩=0\langle \mathbf{e}_i, \mathbf{e}_j \rangle = 0、∣ei∣=1|\mathbf{e}_i| = 1,都成立.

维数只改变求和的项数,循环本身不变:第 jj 步永远是"减掉前 j−1j-1 个方向上的全部影子,再归一化". 在 Rn\mathbb{R}^n 里这个循环最多产出 nn 支标准正交向量;如果某一步 bj=0\mathbf{b}_j = \mathbf{0},说明 aj\mathbf{a}_j 已经能被前面的向量拼出来——算法顺手完成了线性相关的检测,跳过它继续即可. (矩阵分析单元的 QR 分解,就是这个循环的矩阵写法.)

几何直觉. 正交化的每一步就是"减掉影子":把 aj\mathbf{a}_j 在新方向上投出的影子全部减掉,剩下的部分自然与已有方向垂直. 把 b\mathbf{b} 拖近 a\mathbf{a} 所在的直线,影子几乎等于 b\mathbf{b} 本身,b⊥\mathbf{b}_\perp 就缩成零——共线的两个向量撑不出第二个正交方向.

投影与最佳逼近 ​

定义(沿 u\mathbf{u} 的投影) 设 u≠0\mathbf{u} \ne \mathbf{0},v\mathbf{v} 在 u\mathbf{u} 上的投影是

proj⁡uv=⟨v,u⟩⟨u,u⟩ u.\operatorname{proj}_{\mathbf{u}} \mathbf{v} = \frac{\langle \mathbf{v}, \mathbf{u} \rangle}{\langle \mathbf{u}, \mathbf{u} \rangle}\,\mathbf{u}.

命题(正交分解) v=proj⁡uv+(v−proj⁡uv)\mathbf{v} = \operatorname{proj}_{\mathbf{u}}\mathbf{v} + (\mathbf{v} - \operatorname{proj}_{\mathbf{u}}\mathbf{v}),且余项与 u\mathbf{u} 正交.

证明. 记 t=⟨v,u⟩/⟨u,u⟩t = \langle \mathbf{v}, \mathbf{u} \rangle / \langle \mathbf{u}, \mathbf{u} \rangle,余项 r=v−tu\mathbf{r} = \mathbf{v} - t\mathbf{u},则

⟨r,u⟩=⟨v,u⟩−t⟨u,u⟩=⟨v,u⟩−⟨v,u⟩=0.■\langle \mathbf{r}, \mathbf{u} \rangle = \langle \mathbf{v}, \mathbf{u} \rangle - t\langle \mathbf{u}, \mathbf{u} \rangle = \langle \mathbf{v}, \mathbf{u} \rangle - \langle \mathbf{v}, \mathbf{u} \rangle = 0. \qquad \blacksquare

人话版:投影是 v\mathbf{v} 里沿着 u\mathbf{u} 的那一份,余项是垂直于 u\mathbf{u} 的那一份;两块拼回 v\mathbf{v},互不干扰.

投影还有一个更实用的身份:离 v\mathbf{v} 最近的点. 在 u\mathbf{u} 张成的直线上取任意点 sus\mathbf{u},用正交分解和勾股定理:

∣v−su∣2=∣(v−proj⁡uv)+(t−s)u∣2=∣v−proj⁡uv∣2+∣t−s∣2∣u∣2≥∣v−proj⁡uv∣2,|\mathbf{v} - s\mathbf{u}|^2 = |(\mathbf{v} - \operatorname{proj}_{\mathbf{u}}\mathbf{v}) + (t - s)\mathbf{u}|^2 = |\mathbf{v} - \operatorname{proj}_{\mathbf{u}}\mathbf{v}|^2 + |t - s|^2|\mathbf{u}|^2 \ge |\mathbf{v} - \operatorname{proj}_{\mathbf{u}}\mathbf{v}|^2,

取 s=ts = t 时取到等号. "投影 = 最佳逼近"这个视角是后面最小二乘与 SVD 的种子.

几何直觉(直角三角形). 把 v\mathbf{v} 想成斜边:投影是它在 u\mathbf{u} 这条直角边上的"腿",余项是另一条腿,正交分解画出来就是一个直角三角形. 勾股定理于是写成

∣v∣2=∣proj⁡uv∣2+∣v−proj⁡uv∣2.|\mathbf{v}|^2 = |\operatorname{proj}_{\mathbf{u}}\mathbf{v}|^2 + |\mathbf{v} - \operatorname{proj}_{\mathbf{u}}\mathbf{v}|^2.

拿 v=(3,4)\mathbf{v} = (3,4)、u=(1,0)\mathbf{u} = (1,0) 验证:投影是 (3,0)(3,0)、余项是 (0,4)(0,4),32+42=523^2 + 4^2 = 5^2.

例题(教材风格). 求点 P(2,3)P(2, 3) 到直线 3x+4y−1=03x + 4y - 1 = 0 的距离.

解(高中). 套公式:d=∣3×2+4×3−1∣32+42=175=3.4d = \dfrac{|3 \times 2 + 4 \times 3 - 1|}{\sqrt{3^2 + 4^2}} = \dfrac{17}{5} = 3.4.

线代读法. 直线的一个法向量是 n=(3,4)\mathbf{n} = (3,4)(系数行),线上取一点 Q(0,14)Q(0, \frac14)(代入 x=0x = 0 解得 y=14y = \frac14). 把 QP→=(2,114)\overrightarrow{QP} = (2, \frac{11}{4}) 投影到 n\mathbf{n}:

proj⁡nQP→=QP→⋅n∣n∣2n=1725(3,4),\operatorname{proj}_{\mathbf{n}}\overrightarrow{QP} = \frac{\overrightarrow{QP}\cdot\mathbf{n}}{|\mathbf{n}|^2}\mathbf{n} = \frac{17}{25}(3,4),

长度 =1725×5=175=3.4= \frac{17}{25} \times 5 = \frac{17}{5} = 3.4——与公式一致. 高中的"点到直线距离公式"就是"QP→\overrightarrow{QP} 在法向量上的投影长度":分子 QP→⋅n\overrightarrow{QP}\cdot\mathbf{n} 是点积,分母 ∣n∣|\mathbf{n}| 把投影系数拉回长度. 选必一 2.3.3 背下来的公式,这里是它的一句话证明.

线性泛函与内积:有限维 Riesz 表示 ​

上一章说 AA 的每一行是线性泛函;这一节说明:在有限维里,线性泛函就是内积的化身——每个泛函都是"和某个固定向量做内积".

定义(线性泛函) 从 VV 到 R\mathbb{R} 的线性映射 φ:V→R\varphi: V \to \mathbb{R} 叫线性泛函.

线性泛函自己也能加起来、乘倍数:两个泛函逐点相加,还是一个泛函. 于是它们构成一个向量空间——这个概念贯穿下一段.

定义(对偶空间) VV 上全体线性泛函组成的集合,按逐点定义的加法与数乘

(φ+ψ)(v)=φ(v)+ψ(v),(aφ)(v)=a φ(v)(\varphi + \psi)(\mathbf{v}) = \varphi(\mathbf{v}) + \psi(\mathbf{v}), \qquad (a\varphi)(\mathbf{v}) = a\,\varphi(\mathbf{v})

构成一个向量空间,记作 V∗V^{*},叫 VV 的对偶空间.

对偶空间有多大?dim⁡V∗=n\dim V^{*} = n:取 VV 的一组基,一个线性泛函由它在基上的 nn 个取值唯一决定(第 3 章:线性映射由基的像决定),而这 nn 个数可以任意指定(同章:任意指定像都能延拓成唯一的线性映射)——V∗V^{*} 与 Rn\mathbb{R}^n 一一对应.

命题(有限维 Riesz 表示) 设 VV 是有限维内积空间(例如 Rn\mathbb{R}^n 配标准内积). 对任意线性泛函 φ:V→R\varphi: V \to \mathbb{R},存在唯一的向量 w∈V\mathbf{w} \in V,使

φ(v)=⟨v,w⟩(∀v∈V).\varphi(\mathbf{v}) = \langle \mathbf{v}, \mathbf{w} \rangle \quad (\forall \mathbf{v} \in V).

证明(正交化路线)

第一步:把任意基正交单位化. 取 VV 的任意一组基 b1,…,bn\mathbf{b}_1, \dots, \mathbf{b}_n,用 Gram–Schmidt 得到标准正交基 e1,…,en\mathbf{e}_1, \dots, \mathbf{e}_n. 正交化不改变张成——每一步只是减掉已有方向上的影子——所以对每个 kk,

span⁡{e1,…,ek}=span⁡{b1,…,bk}.\operatorname{span}\{\mathbf{e}_1, \dots, \mathbf{e}_k\} = \operatorname{span}\{\mathbf{b}_1, \dots, \mathbf{b}_k\}.

特别地 e1,…,en\mathbf{e}_1, \dots, \mathbf{e}_n 仍是 VV 的一组基:任何 v\mathbf{v} 都能用它展开,任何 φ\varphi 也由它在 ei\mathbf{e}_i 上的取值唯一决定. 换基只是换计算用的坐标尺,被表示的那批线性泛函没有变.

第二步:在正交基上直接拼出 w\mathbf{w}. 令

w=φ(e1)e1+⋯+φ(en)en.\mathbf{w} = \varphi(\mathbf{e}_1)\mathbf{e}_1 + \cdots + \varphi(\mathbf{e}_n)\mathbf{e}_n.

对任意 v=x1e1+⋯+xnen\mathbf{v} = x_1\mathbf{e}_1 + \cdots + x_n\mathbf{e}_n,正交基的坐标公式给出 xi=⟨v,ei⟩x_i = \langle \mathbf{v}, \mathbf{e}_i \rangle,于是

φ(v)=∑ixiφ(ei)=∑i⟨v,ei⟩φ(ei)=⟨v, ∑iφ(ei)ei⟩=⟨v,w⟩\varphi(\mathbf{v}) = \sum_i x_i \varphi(\mathbf{e}_i) = \sum_i \langle \mathbf{v}, \mathbf{e}_i \rangle \varphi(\mathbf{e}_i) = \Bigl\langle \mathbf{v},\ \sum_i \varphi(\mathbf{e}_i)\mathbf{e}_i \Bigr\rangle = \langle \mathbf{v}, \mathbf{w} \rangle

(最后一步用内积对第二变量的线性).

第三步:非正交基自动覆盖. 上面的论证没有用到 b1,…,bn\mathbf{b}_1, \dots, \mathbf{b}_n 的任何特殊性质——它们可以是任意一组基. 正交化只是把"非正交情形"归约成"正交情形"的桥:先在正交基上把 w\mathbf{w} 拼出来;因为两组基张成同一个空间,这个 w\mathbf{w} 对整个 VV 都有效.

唯一性. 若 w\mathbf{w}、w′\mathbf{w}' 都满足,相减得 ⟨v,w−w′⟩=0\langle \mathbf{v}, \mathbf{w} - \mathbf{w}' \rangle = 0 对一切 v\mathbf{v} 成立. 取 v=w−w′\mathbf{v} = \mathbf{w} - \mathbf{w}',得 ∣w−w′∣2=0|\mathbf{w} - \mathbf{w}'|^2 = 0,故 w=w′\mathbf{w} = \mathbf{w}'. ■\blacksquare

结构视角(对偶空间). 把"取内积"本身看成一个映射:

Φ:V→V∗,Φ(w)=⟨ ⋅ ,w⟩\Phi: V \to V^{*}, \qquad \Phi(\mathbf{w}) = \langle \,\cdot\,, \mathbf{w} \rangle

(把 w\mathbf{w} 送到"和 w\mathbf{w} 做内积"这台测量仪). 它把向量空间的元素一一变成对偶空间里的泛函. 内积对第二变量线性,所以 Φ\Phi 是线性的;若 Φ(w)=0\Phi(\mathbf{w}) = \mathbf{0},取 v=w\mathbf{v} = \mathbf{w} 得 ∣w∣2=0|\mathbf{w}|^2 = 0,故 w=0\mathbf{w} = \mathbf{0}——核为零,Φ\Phi 是单射. 又 dim⁡V=dim⁡V∗\dim V = \dim V^{*},有限维里单射即满射:

V≅V∗.V \cong V^{*}.

结论因此可以说得更强:能写成"和某个向量做内积"的泛函不是一部分,而是全部,并且一一对应. 正交化的证明是这个同构的可计算版本——它顺手告诉你 w\mathbf{w} 怎么算出来.

推论:上一章"行读法"里的每一行,其实就是这么一个 w\mathbf{w}——(AB)ij=⟨Ai⋅,B⋅j⟩(AB)_{ij} = \langle A_{i\cdot}, B_{\cdot j} \rangle 说的正是"第 ii 行这个泛函作用在第 jj 列上". 泛函与向量的对偶,在有限维里由内积实现.

几何直觉. 线性泛函是一台"测量仪":喂一个向量,读出一个数. Riesz 表示说,有限维里每一台这样的仪器都等价于"往某个固定方向投影"——那个方向就是 w\mathbf{w}. 第 3 章的"行读法"于是有了画面:AA 的每一行是一个测量方向,AxA\mathbf{x} 的第 ii 个分量就是 x\mathbf{x} 在第 ii 个方向上的读数.

转置:由 Riesz 表示定义 ​

第三章的"行读法"说 AA 的每一行是一个线性泛函,但没说这个泛函和内积的关系. Riesz 表示立刻给出一台工具:把矩阵"搬到内积的另一边". 这台工具就是转置.

设 AA 是 m×nm \times n 矩阵. 固定 y∈Rm\mathbf{y} \in \mathbb{R}^m,则 x↦⟨Ax,y⟩\mathbf{x} \mapsto \langle A\mathbf{x}, \mathbf{y} \rangle 是 Rn\mathbb{R}^n 上的线性泛函. 按 Riesz 表示,存在唯一的 w\mathbf{w} 使

⟨Ax,y⟩=⟨x,w⟩(∀x∈Rn).\langle A\mathbf{x}, \mathbf{y} \rangle = \langle \mathbf{x}, \mathbf{w} \rangle \quad (\forall \mathbf{x} \in \mathbb{R}^n).

定义(转置) 对每个 y\mathbf{y},把上面唯一的 w\mathbf{w} 记作 ATyA^{\mathsf{T}}\mathbf{y}. 这样得到的映射 AT:Rm→RnA^{\mathsf{T}}: \mathbb{R}^m \to \mathbb{R}^n 叫 AA 的转置(也叫伴随),它由

⟨Ax,y⟩=⟨x,ATy⟩(∀x,y)\langle A\mathbf{x}, \mathbf{y} \rangle = \langle \mathbf{x}, A^{\mathsf{T}}\mathbf{y} \rangle \quad (\forall \mathbf{x}, \mathbf{y})

唯一确定.

它是线性的. 对 y1,y2\mathbf{y}_1, \mathbf{y}_2 与标量 a,ba, b,取 w=aATy1+bATy2\mathbf{w} = aA^{\mathsf{T}}\mathbf{y}_1 + bA^{\mathsf{T}}\mathbf{y}_2,则

⟨x,w⟩=a⟨Ax,y1⟩+b⟨Ax,y2⟩=⟨Ax, ay1+by2⟩,\langle \mathbf{x}, \mathbf{w} \rangle = a\langle A\mathbf{x}, \mathbf{y}_1 \rangle + b\langle A\mathbf{x}, \mathbf{y}_2 \rangle = \langle A\mathbf{x},\ a\mathbf{y}_1 + b\mathbf{y}_2 \rangle,

由 Riesz 表示的唯一性,w=AT(ay1+by2)\mathbf{w} = A^{\mathsf{T}}(a\mathbf{y}_1 + b\mathbf{y}_2).

元素公式:行列互换. 想知道 ATA^{\mathsf{T}} 的第 ii 行第 jj 列是什么,用一对基向量当探针,把定义等式读三遍:

(AT)ij=⟨ei, ATej⟩=⟨Aei, ej⟩=aji.(A^{\mathsf{T}})_{ij} = \langle \mathbf{e}_i,\ A^{\mathsf{T}}\mathbf{e}_j \rangle = \langle A\mathbf{e}_i,\ \mathbf{e}_j \rangle = a_{ji}.

三个等号分别在说:

  • 第一个:ATejA^{\mathsf{T}}\mathbf{e}_j 是 ATA^{\mathsf{T}} 的第 jj 列,取它的第 ii 个分量,就是和 ei\mathbf{e}_i 做内积(坐标 = 与基向量的内积);
  • 第二个:这就是定义等式本身,取 x=ei\mathbf{x} = \mathbf{e}_i、y=ej\mathbf{y} = \mathbf{e}_j,作用是把 ATA^{\mathsf{T}} 从内积的右边搬到左边;
  • 第三个:现在轮到 AA 上场——AeiA\mathbf{e}_i 是 AA 的第 ii 列,它的第 jj 个分量正是第 jj 行第 ii 列的 ajia_{ji}.

拿一个具体的矩阵验证,A=[1234]A = \begin{bmatrix} 1 & 2 \\ 3 & 4 \end{bmatrix},取 i=1i = 1、j=2j = 2,也就是预期中 AT=[1324]A^{\mathsf{T}} = \begin{bmatrix} 1 & 3 \\ 2 & 4 \end{bmatrix} 的第一行第二列:

(AT)12=⟨e1,ATe2⟩=⟨Ae1,e2⟩=⟨(1,3), (0,1)⟩=3=a21.(A^{\mathsf{T}})_{12} = \langle \mathbf{e}_1, A^{\mathsf{T}}\mathbf{e}_2 \rangle = \langle A\mathbf{e}_1, \mathbf{e}_2 \rangle = \langle (1, 3),\ (0, 1) \rangle = 3 = a_{21}.

两步都没有玄机:⟨e1,ATe2⟩\langle \mathbf{e}_1, A^{\mathsf{T}}\mathbf{e}_2 \rangle 取的是 ATe2A^{\mathsf{T}}\mathbf{e}_2 的第一个坐标,⟨Ae1,e2⟩\langle A\mathbf{e}_1, \mathbf{e}_2 \rangle 读的是 Ae1A\mathbf{e}_1 的第二个坐标——"行列互换"就是在这两步之间自然发生的. 更一般地说,取基向量当探针之后,转置的定义被迫给出"第 ii 行第 jj 列是 ajia_{ji}"这条机械规则;它不是约定,是标准的必然结果.

特例:向量的转置乘另一个向量就是内积. 列向量 x\mathbf{x} 是 n×1n \times 1 矩阵,它的转置 xT\mathbf{x}^{\mathsf{T}} 是 1×n1 \times n 行矩阵. 按矩阵乘法,

xTy=[x1⋯xn][y1⋮yn]=[ x1y1+⋯+xnyn ]=[ ⟨x,y⟩ ].\mathbf{x}^{\mathsf{T}}\mathbf{y} = \begin{bmatrix} x_1 & \cdots & x_n \end{bmatrix} \begin{bmatrix} y_1 \\ \vdots \\ y_n \end{bmatrix} = \bigl[\, x_1y_1 + \cdots + x_ny_n \,\bigr] = \bigl[\, \langle \mathbf{x}, \mathbf{y} \rangle \,\bigr].

右边是 1×11 \times 1 矩阵,它的唯一元素就是内积. 此后把内积写成 xTy\mathbf{x}^{\mathsf{T}}\mathbf{y} 是常规操作——伴随的推导与高维内积的计算都用这个写法. 顺带分清两个形状完全不同的东西:xTy\mathbf{x}^{\mathsf{T}}\mathbf{y} 是 1×11 \times 1(内积),xyT\mathbf{x}\mathbf{y}^{\mathsf{T}} 是 n×nn \times n(外积),别混.

性质,每一条都只用定义等式加 Riesz 唯一性:

  • (AT)T=A(A^{\mathsf{T}})^{\mathsf{T}} = A:把定义等式对调 x,y\mathbf{x}, \mathbf{y} 读一遍,⟨ATy,x⟩=⟨y,Ax⟩\langle A^{\mathsf{T}}\mathbf{y}, \mathbf{x} \rangle = \langle \mathbf{y}, A\mathbf{x} \rangle,唯一性即得;
  • (A+B)T=AT+BT(A + B)^{\mathsf{T}} = A^{\mathsf{T}} + B^{\mathsf{T}}、(aA)T=aAT(aA)^{\mathsf{T}} = aA^{\mathsf{T}}:两边都是同一个泛函的 Riesz 向量,唯一性保证相等;
  • (AB)T=BTAT(AB)^{\mathsf{T}} = B^{\mathsf{T}}A^{\mathsf{T}}:连续搬两次,

    ⟨ABx,y⟩=⟨Bx,ATy⟩=⟨x,BTATy⟩,\langle AB\mathbf{x}, \mathbf{y} \rangle = \langle B\mathbf{x}, A^{\mathsf{T}}\mathbf{y} \rangle = \langle \mathbf{x}, B^{\mathsf{T}}A^{\mathsf{T}}\mathbf{y} \rangle,

    顺序反过来是搬运顺序的自然结果;
  • (M−1)T=(MT)−1(M^{-1})^{\mathsf{T}} = (M^{\mathsf{T}})^{-1}:MM−1=IMM^{-1} = I 两边转置,用乘积规则得 (M−1)TMT=I(M^{-1})^{\mathsf{T}}M^{\mathsf{T}} = I,故 (M−1)T(M^{-1})^{\mathsf{T}} 是 MTM^{\mathsf{T}} 的逆.

回到行读法. AA 的第 ii 行(作为线性泛函)对应的 Riesz 向量是 ATeiA^{\mathsf{T}}\mathbf{e}_i,也就是 ATA^{\mathsf{T}} 的第 ii 列、即 AA 第 ii 行的转置. 第三章的 (AB)ij=⟨Ai⋅,B⋅j⟩(AB)_{ij} = \langle A_{i\cdot}, B_{\cdot j} \rangle 到此完全说通:行的泛函作用在列向量上,就是这两个向量的内积.

实验:投影与正交化 ​

第一个实验有两个模式,右侧读数实时更新.

  1. 投影模式:绿色粗线是 v\mathbf{v} 在 u\mathbf{u} 上的投影,白色虚线是残差,直角标记表示两者垂直. 拖动 u\mathbf{u}、v\mathbf{v},观察内积为负时投影跑到 u\mathbf{u} 的反方向.
  2. 点「斜」预设把 u\mathbf{u} 转到 (1.5,1)(1.5, 1),看系数 tt 与投影长度怎么变.
  3. 切到正交化模式:把 b\mathbf{b} 拖过 a\mathbf{a} 所在的直线,b⊥\mathbf{b}_\perp 会缩成零——共线的向量正交化不出第二个方向.
实验 06

投影与正交化

⟨u, v⟩1.00
|u|2.00
系数 t0.25
|残差|2.00
投影残差uv

v = 投影 + 残差:投影落在 u 的直线上,残差与 u 正交(夹角 75.96375653207353°).

绿色粗线是 v 在 u 上的投影,白色虚线是残差 v − 投影;直角标记表示两者垂直. 拖动 u、v 的端点看投影怎么变.

第二个实验:三维 Gram–Schmidt. 把正文的三维例子转起来:

  1. 拖空白处旋转视角(双击复位);拖三个向量的端点可以改输入,也可以换预设.
  2. 点「下一步」逐步走:e₁ 归一化 → a₂ 减影子出 b₂、e₂ → 淡蓝平面是 e₁、e₂ 张成的平面 → a₃ 减掉平面上的全部影子得 b₃、e₃.
  3. 「共面」「共线」预设看退化:b₃ = 0 或 b₂ = 0——算法当场报告线性相关.
实验 06b

三维 Gram–Schmidt

r₁₁·
r₂₂·
r₃₃·
状态进行中
预设步骤 0/4

三支输入向量 a₁、a₂、a₃. 点「下一步」开始从左往右正交化.

拖空白处旋转视角(双击复位),拖三个向量的端点可以改输入. 黄色虚线是每一步减掉的影子,黄色实线是残差 b; 淡蓝平面是 e₁、e₂ 张成的平面,a₃ 要减掉它在这个平面上的全部影子——剩下的 b₃ 与整个平面垂直,单位化就是 e₃. 「共面」「共线」预设看退化:算法会在 b₂ 或 b₃ 变成零的地方当场报告线性相关.

习题 ​

  1. 计算 R4\mathbb{R}^4 中 ⟨(1,2,0,1), (3,0,−1,2)⟩\langle (1,2,0,1),\, (3,0,-1,2) \rangle;这两个向量正交吗?
  2. 求 v=(3,4)\mathbf{v} = (3,4) 在 u=(1,0)\mathbf{u} = (1,0) 与 u=(1,1)\mathbf{u} = (1,1) 上的投影.
  3. 用 Gram–Schmidt 把 a=(1,1)\mathbf{a} = (1,1)、b=(2,0)\mathbf{b} = (2,0) 正交化,与正文的手算对照.
  4. 设 φ(x,y)=3x−y\varphi(x, y) = 3x - y. 求 w\mathbf{w} 使 φ(v)=⟨v,w⟩\varphi(\mathbf{v}) = \langle \mathbf{v}, \mathbf{w} \rangle,并验证.
  5. 证明:两两正交的非零向量组线性无关(先自己写,再对正文的折叠证明).
  6. 求 v=(4,0)\mathbf{v} = (4,0) 在正交基 u1=(1,1)\mathbf{u}_1 = (1,1)、u2=(1,−1)\mathbf{u}_2 = (1,-1) 下的坐标.
  7. 设 VV 是有限维内积空间,u1,…,un\mathbf{u}_1, \dots, \mathbf{u}_n 是一组标准正交基,φ\varphi 是线性泛函. 证明 w=φ(u1)u1+⋯+φ(un)un\mathbf{w} = \varphi(\mathbf{u}_1)\mathbf{u}_1 + \cdots + \varphi(\mathbf{u}_n)\mathbf{u}_n 满足 φ(v)=⟨v,w⟩\varphi(\mathbf{v}) = \langle \mathbf{v}, \mathbf{w} \rangle,并说明这就是 Riesz 定理在抽象空间里的证明.
  8. 用 A=[1234]A = \begin{bmatrix} 1 & 2 \\ 3 & 4 \end{bmatrix}、x=(1,1)\mathbf{x} = (1, 1)、y=(2,−1)\mathbf{y} = (2, -1) 验证 ⟨Ax,y⟩=⟨x,ATy⟩\langle A\mathbf{x}, \mathbf{y} \rangle = \langle \mathbf{x}, A^{\mathsf{T}}\mathbf{y} \rangle.
  9. 对 a1=(1,1,1)\mathbf{a}_1 = (1,1,1)、a2=(1,1,0)\mathbf{a}_2 = (1,1,0)、a3=(1,0,0)\mathbf{a}_3 = (1,0,0) 做 Gram–Schmidt,验证输出两两正交.
参考答案

1. ⟨(1,2,0,1),(3,0,−1,2)⟩=3+0+0+2=5≠0\langle (1,2,0,1), (3,0,-1,2) \rangle = 3 + 0 + 0 + 2 = 5 \ne 0,不正交.

2. 在 (1,0)(1,0) 上:t=3/1=3t = 3/1 = 3,投影 (3,0)(3,0). 在 (1,1)(1,1) 上:t=(3+4)/2=3.5t = (3+4)/2 = 3.5,投影 (3.5,3.5)(3.5, 3.5),残差 (−0.5,0.5)(-0.5, 0.5),确实与 (1,1)(1,1) 正交(内积为 00).

3. e1=(1,1)/2\mathbf{e}_1 = (1,1)/\sqrt{2};⟨b,e1⟩=2\langle \mathbf{b}, \mathbf{e}_1 \rangle = \sqrt{2};b⊥=(2,0)−(1,1)=(1,−1)\mathbf{b}_\perp = (2,0) - (1,1) = (1,-1);e2=(1,−1)/2\mathbf{e}_2 = (1,-1)/\sqrt{2}. 与正文一致.

4. 由 Riesz 表示的存在性构造,w=(φ(1,0),φ(0,1))=(3,−1)\mathbf{w} = (\varphi(1,0), \varphi(0,1)) = (3, -1). 验证:⟨(x,y),(3,−1)⟩=3x−y=φ(x,y)\langle (x,y), (3,-1) \rangle = 3x - y = \varphi(x,y).

5. 见正文折叠证明:与 uj\mathbf{u}_j 作内积,把交叉项全部消掉,只剩 cj∣uj∣2=0c_j|\mathbf{u}_j|^2 = 0.

6. 坐标是 ⟨v,u1⟩⟨u1,u1⟩=42=2\dfrac{\langle \mathbf{v}, \mathbf{u}_1 \rangle}{\langle \mathbf{u}_1, \mathbf{u}_1 \rangle} = \dfrac{4}{2} = 2 与 ⟨v,u2⟩⟨u2,u2⟩=42=2\dfrac{\langle \mathbf{v}, \mathbf{u}_2 \rangle}{\langle \mathbf{u}_2, \mathbf{u}_2 \rangle} = \dfrac{4}{2} = 2,即 (2,2)(2, 2). 验证:2(1,1)+2(1,−1)=(4,0)2(1,1) + 2(1,-1) = (4,0).

7. 把 v\mathbf{v} 在标准正交基下展开:v=x1u1+⋯+xnun\mathbf{v} = x_1\mathbf{u}_1 + \cdots + x_n\mathbf{u}_n,其中 xi=⟨v,ui⟩x_i = \langle \mathbf{v}, \mathbf{u}_i \rangle(正交基坐标公式). 于是

φ(v)=∑ixiφ(ui)=∑i⟨v,ui⟩φ(ui)=⟨v, ∑iφ(ui)ui⟩=⟨v,w⟩,\varphi(\mathbf{v}) = \sum_i x_i\varphi(\mathbf{u}_i) = \sum_i \langle \mathbf{v}, \mathbf{u}_i \rangle \varphi(\mathbf{u}_i) = \Bigl\langle \mathbf{v},\ \sum_i \varphi(\mathbf{u}_i)\mathbf{u}_i \Bigr\rangle = \langle \mathbf{v}, \mathbf{w} \rangle,

倒数第二步用了内积对第二变量的线性与 ⟨v,ui⟩\langle \mathbf{v}, \mathbf{u}_i \rangle 是标量. 这就是抽象空间里 Riesz 定理的存在性证明;唯一性同正文(取 v=w−w′\mathbf{v} = \mathbf{w} - \mathbf{w}').

8. Ax=(3,7)A\mathbf{x} = (3, 7),⟨Ax,y⟩=3⋅2+7⋅(−1)=−1\langle A\mathbf{x}, \mathbf{y} \rangle = 3 \cdot 2 + 7 \cdot (-1) = -1. ATy=(1⋅2+3⋅(−1), 2⋅2+4⋅(−1))=(−1,0)A^{\mathsf{T}}\mathbf{y} = (1 \cdot 2 + 3 \cdot (-1),\ 2 \cdot 2 + 4 \cdot (-1)) = (-1, 0),⟨x,ATy⟩=1⋅(−1)+1⋅0=−1\langle \mathbf{x}, A^{\mathsf{T}}\mathbf{y} \rangle = 1 \cdot (-1) + 1 \cdot 0 = -1. 两边相等.

9. e1=13(1,1,1)\mathbf{e}_1 = \frac{1}{\sqrt{3}}(1,1,1);⟨a2,e1⟩=23\langle \mathbf{a}_2, \mathbf{e}_1 \rangle = \frac{2}{\sqrt{3}},b2=(1,1,0)−23(1,1,1)=(13,13,−23)\mathbf{b}_2 = (1,1,0) - \frac{2}{3}(1,1,1) = (\frac{1}{3}, \frac{1}{3}, -\frac{2}{3}),e2=16(1,1,−2)\mathbf{e}_2 = \frac{1}{\sqrt{6}}(1,1,-2);⟨a3,e1⟩=13\langle \mathbf{a}_3, \mathbf{e}_1 \rangle = \frac{1}{\sqrt{3}}、⟨a3,e2⟩=16\langle \mathbf{a}_3, \mathbf{e}_2 \rangle = \frac{1}{\sqrt{6}},b3=(1,0,0)−13(1,1,1)−16(1,1,−2)=(12,−12,0)\mathbf{b}_3 = (1,0,0) - \frac{1}{3}(1,1,1) - \frac{1}{6}(1,1,-2) = (\frac{1}{2}, -\frac{1}{2}, 0),e3=12(1,−1,0)\mathbf{e}_3 = \frac{1}{\sqrt{2}}(1,-1,0). 验证:e1⋅e2=1+1−218=0\mathbf{e}_1 \cdot \mathbf{e}_2 = \frac{1+1-2}{\sqrt{18}} = 0,e1⋅e3=1−1+06=0\mathbf{e}_1 \cdot \mathbf{e}_3 = \frac{1-1+0}{\sqrt{6}} = 0,e2⋅e3=1−1+012=0\mathbf{e}_2 \cdot \mathbf{e}_3 = \frac{1-1+0}{\sqrt{12}} = 0 ✓.

交叉 ​

  • 机器学习:方向导数等于梯度与方向向量的内积;注意力权重是查询与键的内积再过 softmax;投影是最小二乘与 PCA 的几何核心.
  • 矩阵分析:QR 分解就是 Gram–Schmidt 的矩阵形式;正交矩阵是保内积的变换;SVD 在每个正交方向上找拉伸倍数.
  • 概率与信息论:协方差可以看成一个内积(随机变量之间的"夹角"),相关系数就是余弦.

延伸 ​

下一章《行列式:体积与可逆性》会把第一章的面积缩放率扩展成 nn 维的体积比,届时"可逆   ⟺  det⁡≠0\iff \det \ne 0"可以完整证明. 内积空间的一般理论是泛函分析的起点:有限维的 Riesz 表示已经证完,无限维情形(希尔伯特空间的 Riesz 表示定理)需要完备性,是泛函分析的中心定理之一.