Skip to content

向量与矩阵范数 ​

《线性代数》里"长度"是内积给的. 但工程上"大小"不止一种量法:误差向量 (0.1,0.1,0.1)(0.1, 0.1, 0.1) 和 (0.3,0,0)(0.3, 0, 0),谁的误差"更大"?看总误差、平方误差还是最大分量,答案不一样. 范数就是把"长度应该满足什么"公理化,然后你会发现合格的"尺子"有一整个家族——它们对应着不同的单位球形状.

高中那点工具,够用到哪里 ​

高中:向量的模 ∣v∣=x2+y2|\mathbf{v}| = \sqrt{x^2 + y^2},数轴上的绝对值 ∣x∣|x|,两点间距离. 这些都是 2-范数的特例. 这一章要问:把"长度"的规则写下来,还有哪些函数合格?

定义:长度的三条公理 ​

定义(范数) 函数 ∥⋅∥:Rn→R\|\cdot\| : \mathbb{R}^n \to \mathbb{R} 若满足 (i) 正定:∥x∥≥0\|\mathbf{x}\| \ge 0,且 ∥x∥=0\|\mathbf{x}\| = 0 当且仅当 x=0\mathbf{x} = \mathbf{0}; (ii) 齐次:对任何实数 cc,∥cx∥=∣c∣ ∥x∥\|c\mathbf{x}\| = |c| \, \|\mathbf{x}\|; (iii) 三角不等式:∥x+y∥≤∥x∥+∥y∥\|\mathbf{x} + \mathbf{y}\| \le \|\mathbf{x}\| + \|\mathbf{y}\|, 就称为 Rn\mathbb{R}^n 上的一个范数.

人话版:(i) 只有零向量的长度是零;(ii) 拉伸 cc 倍,长度变 ∣c∣|c| 倍——注意绝对值,反向也要变正;(iii) 直着走不会比绕路远.

范数家族:1、2、∞ 与 p ​

  • 2-范数:∥x∥2=x12+⋯+xn2\|\mathbf{x}\|_2 = \sqrt{x_1^2 + \cdots + x_n^2}——高中那个,来自内积.
  • 1-范数:∥x∥1=∣x1∣+⋯+∣xn∣\|\mathbf{x}\|_1 = |x_1| + \cdots + |x_n|——"出租车距离"(沿坐标轴走).
  • ∞-范数:∥x∥∞=max⁡(∣x1∣,…,∣xn∣)\|\mathbf{x}\|_\infty = \max(|x_1|, \dots, |x_n|)——只看最大的分量.
  • p-范数:∥x∥p=(∣x1∣p+⋯+∣xn∣p)1/p\|\mathbf{x}\|_p = (|x_1|^p + \cdots + |x_n|^p)^{1/p},p≥1p \ge 1.

验证三公理:齐次与正定一眼可见;三角不等式对 2-范数要证(下一节),对一般 pp 是 Minkowski 不等式——名字记住即可,证明属于分析课.

为什么 p≥1p \ge 1:p<1p < 1 时三角不等式会坏掉. 取 p=1/2p = 1/2、x=(1,0)\mathbf{x} = (1,0)、y=(0,1)\mathbf{y} = (0,1):∥x∥=∥y∥=1\|\mathbf{x}\| = \|\mathbf{y}\| = 1,但 ∥x+y∥=(1+1)2=4>2\|\mathbf{x} + \mathbf{y}\| = (1 + 1)^2 = 4 > 2.

p→∞p \to \infty 为什么变成 max:记 m=max⁡∣xi∣m = \max|x_i|,则

∥x∥p=m(∑i(∣xi∣m)p)1/p,\|\mathbf{x}\|_p = m \left( \sum_i \left(\frac{|x_i|}{m}\right)^p \right)^{1/p},

括号里介于 11 与 nn 之间(非零项至多 nn 个),开 pp 次方后当 p→∞p \to \infty 趋于 11.

单位球:范数的形状 ​

定义(单位球) B={x:∥x∥≤1}B = \{\mathbf{x} : \|\mathbf{x}\| \le 1\}.

几何直觉. 2-范数的单位球是圆(高维里是球);1-范数是菱形;∞-范数是正方形. pp 从 11 涨到 ∞\infty,球从菱形出发,经过圆,越来越接近正方形——像一只被慢慢"吹方"的气球. 给向量选范数,就是给空间选单位球的形状;反过来,任何一个凸的、中心对称的、不含直线的紧集,都唯一决定一个范数.

Cauchy–Schwarz 与三角不等式 ​

定理(Cauchy–Schwarz 不等式) 对任意 u,v\mathbf{u}, \mathbf{v}:

∣⟨u,v⟩∣≤∥u∥2 ∥v∥2,|\langle \mathbf{u}, \mathbf{v} \rangle| \le \|\mathbf{u}\|_2 \, \|\mathbf{v}\|_2,

等号成立当且仅当 u\mathbf{u}、v\mathbf{v} 线性相关.

证明(配方/判别式法)

若 v=0\mathbf{v} = \mathbf{0} 显然. 否则对任何实数 tt:

0≤∥u−tv∥22=∥u∥22−2t⟨u,v⟩+t2∥v∥22.0 \le \|\mathbf{u} - t\mathbf{v}\|_2^2 = \|\mathbf{u}\|_2^2 - 2t\langle \mathbf{u}, \mathbf{v} \rangle + t^2\|\mathbf{v}\|_2^2.

右边是关于 tt 的二次函数,取最小值点 t=⟨u,v⟩/∥v∥22t = \langle \mathbf{u}, \mathbf{v} \rangle / \|\mathbf{v}\|_2^2,得

0≤∥u∥22−⟨u,v⟩2∥v∥22,即⟨u,v⟩2≤∥u∥22 ∥v∥22.0 \le \|\mathbf{u}\|_2^2 - \frac{\langle \mathbf{u}, \mathbf{v} \rangle^2}{\|\mathbf{v}\|_2^2}, \quad\text{即}\quad \langle \mathbf{u}, \mathbf{v} \rangle^2 \le \|\mathbf{u}\|_2^2 \, \|\mathbf{v}\|_2^2.

等号成立意味着 u−tv=0\mathbf{u} - t\mathbf{v} = \mathbf{0},即线性相关. ■\blacksquare

高中那个"cos⁡θ=u⋅v/(∣u∣∣v∣)\cos\theta = \mathbf{u}\cdot\mathbf{v}/(|\mathbf{u}||\mathbf{v}|)"现在才真正合法:CS 保证这个比值落在 [−1,1][-1, 1] 里.

2-范数的三角不等式(用 CS 直接推):

∥u+v∥22=∥u∥22+2⟨u,v⟩+∥v∥22≤∥u∥22+2∥u∥2∥v∥2+∥v∥22=(∥u∥2+∥v∥2)2.\|\mathbf{u} + \mathbf{v}\|_2^2 = \|\mathbf{u}\|_2^2 + 2\langle \mathbf{u}, \mathbf{v} \rangle + \|\mathbf{v}\|_2^2 \le \|\mathbf{u}\|_2^2 + 2\|\mathbf{u}\|_2\|\mathbf{v}\|_2 + \|\mathbf{v}\|_2^2 = (\|\mathbf{u}\|_2 + \|\mathbf{v}\|_2)^2.

范数之间的换算 ​

对任意 x∈Rn\mathbf{x} \in \mathbb{R}^n 有

∥x∥∞≤∥x∥2≤∥x∥1.\|\mathbf{x}\|_\infty \le \|\mathbf{x}\|_2 \le \|\mathbf{x}\|_1.

第一条:最大分量的平方不超过全部分量平方之和;第二条:两边平方,右边多出的交叉项 2∑i<j∣xi∣∣xj∣2\sum_{i<j}|x_i||x_j| 非负. 反方向也有界:

∥x∥1≤n ∥x∥2,∥x∥2≤n ∥x∥∞\|\mathbf{x}\|_1 \le \sqrt{n}\,\|\mathbf{x}\|_2, \qquad \|\mathbf{x}\|_2 \le \sqrt{n}\,\|\mathbf{x}\|_\infty

(第一条把每个 ∣xi∣|x_i| 看成 ∣xi∣⋅1|x_i| \cdot 1 用 Cauchy–Schwarz).

意义:有限维里所有范数彼此等价——一个向量在任何范数下都"有界",只是换算常数随维数 nn 增长. 工程含义:稳定性、收敛性的结论不依赖范数选择,但常数会进误差估计——高维里 n\sqrt{n} 不是小数.

矩阵范数:拉直与放大率 ​

向量有了长度,矩阵的"大小"有两种自然定义:

定义(Frobenius 范数) ∥A∥F=∑i,jaij2\|A\|_F = \sqrt{\sum_{i,j} a_{ij}^2}——把矩阵拉直成向量,用 2-范数.

定义(算子范数) ∥A∥=max⁡x≠0∥x∥−1∥Ax∥=max⁡∥x∥=1∥Ax∥\|A\| = \max_{\mathbf{x} \ne \mathbf{0}} \|\mathbf{x}\|^{-1}\|A\mathbf{x}\| = \max_{\|\mathbf{x}\| = 1} \|A\mathbf{x}\|——单位向量被拉长最多的倍数(齐次性把比例消掉,所以只看单位球上的像).

几何直觉. 单位球被 AA 映成椭球(或者更扁的形状),算子范数就是最长的半轴. 对 2-范数:

∥A∥2=λmax⁡(ATA),\|A\|_2 = \sqrt{\lambda_{\max}(A^{\mathsf{T}}A)},

因为 max⁡∥x∥=1∥Ax∥22=max⁡xTATAx\max_{\|\mathbf{x}\|=1}\|A\mathbf{x}\|_2^2 = \max \mathbf{x}^{\mathsf{T}}A^{\mathsf{T}}A\mathbf{x},而 ATAA^{\mathsf{T}}A 半正定(第 8 章),半正定二次型在单位球上的最大值就是最大特征值(第 8 章习题 6). 第 3 章会看到,λmax⁡(ATA)\sqrt{\lambda_{\max}(A^{\mathsf{T}}A)} 正是最大奇异值 σmax⁡\sigma_{\max}. 若 AA 对称,则 ∥A∥2=max⁡i∣λi∣\|A\|_2 = \max_i |\lambda_i|——不用再乘 ATAA^{\mathsf{T}}A.

常用性质(算子范数):

  • ∥Ax∥≤∥A∥ ∥x∥\|A\mathbf{x}\| \le \|A\|\,\|\mathbf{x}\|(定义直接推);
  • 次可乘性:∥AB∥≤∥A∥ ∥B∥\|AB\| \le \|A\|\,\|B\|.
次可乘性的证明

对任何 x\mathbf{x}:∥ABx∥≤∥A∥ ∥Bx∥≤∥A∥ ∥B∥ ∥x∥\|AB\mathbf{x}\| \le \|A\|\,\|B\mathbf{x}\| \le \|A\|\,\|B\|\,\|\mathbf{x}\|. 两边除以 ∥x∥\|\mathbf{x}\|(x≠0\mathbf{x} \ne \mathbf{0})再对 x\mathbf{x} 取最大,即得 ∥AB∥≤∥A∥ ∥B∥\|AB\| \le \|A\|\,\|B\|. ■\blacksquare

Frobenius 范数也满足次可乘性(把矩阵看成向量后用 CS 逐项配对).

1-范数与 ∞-范数诱导的矩阵范数有现成公式:∥A∥1\|A\|_1 = 最大的列绝对值和,∥A∥∞\|A\|_\infty = 最大的行绝对值和. 例如 A=[1234]A = \begin{bmatrix} 1 & 2 \\ 3 & 4 \end{bmatrix}:行和 max⁡(3,7)=7\max(3, 7) = 7,列和 max⁡(4,6)=6\max(4, 6) = 6.

(Frobenius 不是任何向量范数诱导的算子范数,但同样好用;总有 ∥A∥2≤∥A∥F≤n ∥A∥2\|A\|_2 \le \|A\|_F \le \sqrt{n}\,\|A\|_2.)

为什么工程在乎 ​

  • 1-范数促稀疏:它的单位球有"尖角"(顶点在坐标轴上),优化最优点容易落在尖角处——那一堆分量就自动变成零. Lasso、稀疏编码偏爱 1-范数的几何根源就在这里.
  • ∞-范数管最坏情况:误差的每个分量都不超过某个值——嵌入式、控制里的最坏情况保证用它.
  • 2-范数 = 能量:平方误差、最小二乘天然长在它上面.
  • 算子范数 = 放大率:AA 把误差放大的倍数;条件数 κ(A)=∥A∥ ∥A−1∥\kappa(A) = \|A\|\,\|A^{-1}\| 是"解方程组对误差多敏感"的度量(第 4 章).
  • 深度学习里的"梯度裁剪""权重衰减",全部是范数语言.

实验:单位球与单位圆的像 ​

  1. 三张虚线单位球:菱形(1-范数)、圆(2-范数)、正方形(∞-范数),它们在 (1,0)(1,0)、(0,1)(0,1) 这些轴上点重合.
  2. 拖滑块 pp:实线球从菱形出发,经过圆(p=2p = 2),越来越接近正方形;推到 p=8p = 8 已经非常方.
  3. 拖圆点:右上角实时显示它的 1、2、∞、p 范数——注意排序 ∥x∥∞≤∥x∥2≤∥x∥1\|\mathbf{x}\|_\infty \le \|\mathbf{x}\|_2 \le \|\mathbf{x}\|_1 永远不变.
  4. 把点拖到对角线上,1-范数与 2-范数差最大(2\sqrt{2} 倍);拖回坐标轴附近,两者几乎一样——稀疏的几何就在这里.
  5. 下半场是矩阵:点格子改 AA 或换预设,虚线单位圆被映成实线椭圆;亮线(最长半轴)的长度就是谱范数 ∥A∥2\|A\|_2.
  6. 拖圆上的白点绕一圈:∥Ax∥\|A\mathbf{x}\| 实时变化,在最长轴方向取到最大——剪切预设的最大拉伸是黄金比 1.621.62.
  7. 黄色对角线:两条半轴互相垂直,矩形对角线长 σ12+σ22\sqrt{\sigma_1^2 + \sigma_2^2},正好是 Frobenius 范数 ∥A∥F\|A\|_F——它不"诱导"自向量范数,但符合勾股定理.
实验 01

单位球与单位圆的像

‖x‖₁2.40
‖x‖₂1.72
‖x‖∞1.40
‖x‖ₚ1.72
p = 2.0
‖·‖₁‖·‖₂‖·‖∞(1.4, 1.0)

任何向量都满足 ‖x‖∞ ≤ ‖x‖₂ ≤ ‖x‖₁:1.40 ≤ 1.72 ≤ 2.40;而且 ‖x‖₁ ≤ √2·‖x‖₂ = 2.43 ✓. 拖动滑块看单位球从菱形(p = 1)经圆(p = 2)变向正方形(p → ∞).

三张虚线球是 1、2、∞ 范数的单位球:菱形、圆、正方形,都在 (1,0)、(0,1) 这些轴上点重合——轴上向量三种范数一样大. 实线是当前 p 的单位球;拖动圆点,右上角实时给出它的四种范数. 把点拖到对角线上,1-范数与 2-范数的差距最大(√2 倍)——这就是稀疏优化偏爱 1-范数的几何来源.

矩阵范数:单位圆被映成椭圆

‖A‖₂3.00
σmin1.00
‖A‖_F3.16
‖A‖₁3.00
预设
A(点格子改)
‖x‖ = 1σmin = 1.00‖A‖₂ = 3.00‖A‖_F = 3.16‖Ax‖ = 2.98

单位圆被 A 映成椭圆,最长半轴就是谱范数 ‖A‖₂ = 3.00(第 3 章会看到它就是最大奇异值 σmax). ‖A‖_F = √(σ₁² + σ₂²) = 3.16,正是两半轴的勾股对角线. 拖圆上的白点:当前 ‖Ax‖ = 2.98 ≤ 3.00,沿最长轴方向取到等号.

点格子改 A(循环 0 → 1 → 2 → 3 → −1 → −2),或换预设. 虚线圆是 ‖x‖ = 1,实线是它的像 {Ax}; 灰虚线是最短半轴 σmin,亮线(最长半轴)的长度就是谱范数;黄色线是两半轴张成的矩形对角线—— 两条半轴互相垂直,所以它的长是 √(σ₁² + σ₂²),正好是 Frobenius 范数. 拖圆上的白点绕一圈,看 ‖Ax‖ 如何随方向变化——沿最长轴方向取到最大值,这就是"算子范数 = 单位球上最大拉伸倍数". 剪切预设的最大拉伸是黄金比 1.62.

习题 ​

  1. 手算 x=(3,−4)\mathbf{x} = (3, -4) 的 1、2、∞ 范数,验证链式不等式.
  2. 证明:∥x∥∞≤∥x∥2≤∥x∥1\|\mathbf{x}\|_\infty \le \|\mathbf{x}\|_2 \le \|\mathbf{x}\|_1(各写一行).
  3. 用 Cauchy–Schwarz 证明 ∥x∥1≤n ∥x∥2\|\mathbf{x}\|_1 \le \sqrt{n}\,\|\mathbf{x}\|_2.
  4. 验证 p=1/2p = 1/2 不满足三角不等式(举 (1,0)(1,0) 与 (0,1)(0,1)).
  5. 对 A=[1234]A = \begin{bmatrix} 1 & 2 \\ 3 & 4 \end{bmatrix} 计算 ∥A∥F\|A\|_F、∥A∥1\|A\|_1、∥A∥∞\|A\|_\infty.
  6. 证明算子范数的次可乘性 ∥AB∥≤∥A∥ ∥B∥\|AB\| \le \|A\|\,\|B\|.
  7. 设 AA 对称,用第 7 章谱定理证明 ∥A∥2=max⁡i∣λi∣\|A\|_2 = \max_i |\lambda_i|.
参考答案

1. ∥x∥1=3+4=7\|\mathbf{x}\|_1 = 3 + 4 = 7,∥x∥2=9+16=5\|\mathbf{x}\|_2 = \sqrt{9 + 16} = 5,∥x∥∞=max⁡(3,4)=4\|\mathbf{x}\|_\infty = \max(3,4) = 4;4≤5≤74 \le 5 \le 7 ✓.

2. ∥x∥∞≤∥x∥2\|\mathbf{x}\|_\infty \le \|\mathbf{x}\|_2:最大分量的平方不超过全部分量平方之和. ∥x∥2≤∥x∥1\|\mathbf{x}\|_2 \le \|\mathbf{x}\|_1:两边平方,∑xi2≤∑xi2+2∑i<j∣xi∣∣xj∣\sum x_i^2 \le \sum x_i^2 + 2\sum_{i<j}|x_i||x_j|,右边多出的交叉项非负.

3. 把 ∣xi∣|x_i| 看成 ∣xi∣⋅1|x_i| \cdot 1,用 CS:∑∣xi∣≤∑xi2⋅12+⋯+12=n ∥x∥2\sum |x_i| \le \sqrt{\sum x_i^2} \cdot \sqrt{1^2 + \cdots + 1^2} = \sqrt{n}\,\|\mathbf{x}\|_2.

4. ∥(1,0)∥=∥(0,1)∥=1\|(1,0)\| = \|(0,1)\| = 1(单项的 p-范数不变),但 ∥(1,1)∥=(1+1)2=4>1+1=2\|(1,1)\| = (1 + 1)^2 = 4 > 1 + 1 = 2,三角不等式不成立.

5. ∥A∥F=1+4+9+16=30≈5.48\|A\|_F = \sqrt{1 + 4 + 9 + 16} = \sqrt{30} \approx 5.48;行绝对值和 3,73, 7 → ∥A∥∞=7\|A\|_\infty = 7;列绝对值和 4,64, 6 → ∥A∥1=6\|A\|_1 = 6.

6. 对任意 x≠0\mathbf{x} \ne \mathbf{0}:∥ABx∥≤∥A∥ ∥Bx∥≤∥A∥ ∥B∥ ∥x∥\|AB\mathbf{x}\| \le \|A\|\,\|B\mathbf{x}\| \le \|A\|\,\|B\|\,\|\mathbf{x}\|;除以 ∥x∥\|\mathbf{x}\|,再对所有 x\mathbf{x} 取最大值.

7. 由谱定理 A=QΛQTA = Q\Lambda Q^{\mathsf{T}},令 y=QTx\mathbf{y} = Q^{\mathsf{T}}\mathbf{x}(保持长度):∥Ax∥22=∥Λy∥22=∑λi2yi2≤(max⁡i∣λi∣)2∑yi2=(max⁡i∣λi∣)2∥x∥22\|A\mathbf{x}\|_2^2 = \|\Lambda\mathbf{y}\|_2^2 = \sum \lambda_i^2 y_i^2 \le (\max_i |\lambda_i|)^2 \sum y_i^2 = (\max_i |\lambda_i|)^2 \|\mathbf{x}\|_2^2. 取 x\mathbf{x} 为最大特征值对应的特征向量,等号成立.

交叉 ​

  • 机器学习:L1/L2 正则化(稀疏 vs 平滑)、梯度裁剪、距离度量.
  • 数值线性代数:误差分析、条件数、迭代法的收敛判据——全都建立在范数上.
  • 优化:范数是"距离"与"惩罚项"的通用语言.

延伸 ​

下一章《LU、QR 与 Cholesky 分解》:有了范数这把尺子,才能谈分解算法"稳不稳"——消元怎么选主元、正交化为什么数值上更优、正定矩阵的专属通道是什么.