这一节,我们将正交投影推广到 R n ~\mathbb{R^n}~ R n 中来讨论。在 R n ~\mathbb{R^n}~ R n 中,给定向量 y ~\mathbf{y}~ y 和子空间 W ~W~ W ,可以找到唯一的 向量 y ^ ∈ W ~\hat{\mathbf{y}}\in W~ y ^ ∈ W ,使得 y − y ^ ~\mathbf{y} - \hat{\mathbf{y}}~ y − y ^ 正交于 W ~W~ W ,同时 y ^ ~\hat{\mathbf{y}}~ y ^ 也是 W ~W~ W 中最接近 y ~\mathbf{y}~ y 的向量。因此,我们可以将 y ~\mathbf{y}~ y 唯一地分解为:
y = z 1 + z 2 (1) \mathbf{y} = \mathbf{z}_1 + \mathbf{z}_2 \tag{1} y = z 1 + z 2 ( 1 )
其中 z 1 ~\mathbf{z}_1~ z 1 在 W ~W~ W 内, z 2 ~\mathbf{z}_2~ z 2 在 W ⊥ ~W^\perp~ W ⊥ (正交补空间)内。例如在一个五维空间的正交基 U = { u 1 , u 2 , u 3 , u 4 , u 5 , } ~\mathcal{U} = \{\mathbf{u}_1,\mathbf{u}_2,\mathbf{u}_3,\mathbf{u}_4,\mathbf{u}_5,\}~ U = { u 1 , u 2 , u 3 , u 4 , u 5 , } 下,对 R 5 ~\mathbb{R^5}~ R 5 中任意给定向量 y ~\mathbf{y}~ y 用同样的方式进行分解:
y = c 1 u 1 + c 2 u 2 + c 3 u 3 + c 4 u 4 + c 5 u 5 \mathbf{y} = c_1 \mathbf{u}_1 + c_2 \mathbf{u}_2 + c_3 \mathbf{u}_3 + c_4 \mathbf{u}_4 + c_5 \mathbf{u}_5 y = c 1 u 1 + c 2 u 2 + c 3 u 3 + c 4 u 4 + c 5 u 5
我们可以对 y ~\mathbf{y}~ y 按照 ( 1 ) ~(1)~ ( 1 ) 式进行拆分:
y = ( c 1 u 1 + c 2 u 2 ) ⏞ z 1 + ( c 3 u 3 + c 4 u 4 + c 5 u 5 ) ⏞ z 2 \mathbf{y} = \overset{\textcolor{#2196f3}{\mathbf{z}_1}}{\textcolor{#2196f3}{\overbrace{\textcolor{#000000}{(c_1 \mathbf{u}_1 + c_2 \mathbf{u}_2)}}}} + \overset{\textcolor{#2196f3}{\mathbf{z}_2}}{\textcolor{#2196f3}{\overbrace{\textcolor{#000000}{(c_3 \mathbf{u}_3 + c_4 \mathbf{u}_4 + c_5 \mathbf{u}_5)}}}} y = ( c 1 u 1 + c 2 u 2 ) z 1 + ( c 3 u 3 + c 4 u 4 + c 5 u 5 ) z 2
如果 z 1 ~\mathbf{z}_1~ z 1 在子空间 W = Span { u 1 , u 2 } ~W = \text{Span} \{\mathbf{u}_1,\mathbf{u}_2\}~ W = Span { u 1 , u 2 } 内,那么 z 2 ~\mathbf{z}_2~ z 2 一定在 W ⊥ ~W^\perp~ W ⊥ 内 。我们可以进一步推广到更一般的情况,即不需要整个空间的正交基,只需要 W ~W~ W 自己的正交基即可计算正交投影,有如下定理:
给定 R 3 ~\mathbb{R^3}~ R 3 中向量 y ~\mathbf{y}~ y 以及由正交基生成是空间 W ~W~ W :
y = [ 1 2 3 ] , u 1 = [ 2 5 − 1 ] , u 2 = [ − 2 1 1 ] \mathbf{y} = \begin{bmatrix} 1 \\ 2 \\ 3 \end{bmatrix},\quad \mathbf{u}_1 = \begin{bmatrix} 2 \\ 5 \\ -1 \end{bmatrix}, \quad \mathbf{u}_2 = \begin{bmatrix} -2 \\ 1 \\ 1 \end{bmatrix} y = 1 2 3 , u 1 = 2 5 − 1 , u 2 = − 2 1 1
下面利用正交分解定理对的向量 y ~\mathbf{y}~ y 进行分解: y = y ^ + z ~\mathbf{y} = \hat{\mathbf{y}} + \mathbf{z}~ y = y ^ + z ,其中 y ^ ∈ W , z = y − y ^ ∈ W ⊥ ~\hat{\mathbf{y}} \in W,\,~\mathbf{z} = \mathbf{y} - \hat{\mathbf{y}} \in W^\perp~ y ^ ∈ W , z = y − y ^ ∈ W ⊥ 。
最终分解结果:
y = y ^ + z = [ − 2 / 5 2 1 / 5 ] + [ 7 / 5 0 14 / 5 ] \mathbf{y} = \hat{\mathbf{y}} + \mathbf{z} = \begin{bmatrix} -2/5 \\ 2 \\ 1/5 \end{bmatrix} + \begin{bmatrix} 7/5 \\ 0 \\ 14/5 \end{bmatrix} y = y ^ + z = − 2/5 2 1/5 + 7/5 0 14/5
3. 正交投影的几何解释
当 W ~W~ W 是一维子空间时,正交投影公式 ( 2 ) ~(2)~ ( 2 ) 仅包含一项,表示 y ~\mathbf{y}~ y 在该基向量上的正交投影。对于更高维的子空间 W > 1 ~W \gt 1~ W > 1 ,向量 y ~\mathbf{y}~ y 在 W ~W~ W 上的正交投影可以分解为投影到每个基向量的正交投影之和。在 R 3 ~\mathbb{R^3}~ R 3 空间中,假设 W ~W~ W 是由两个正交向量 u 1 ~\mathbf{u}_1~ u 1 和 u 2 ~\mathbf{u}_2~ u 2 张成的子空间,向量 y ~\mathbf{y}~ y 的正交投影可以分解为 y ~\mathbf{y}~ y 在 u 1 ~\mathbf{u}_1~ u 1 和 u 2 ~\mathbf{u}_2~ u 2 上的投影之和。
y ^ = y ⋅ u 1 u 1 ⋅ u 1 u 1 + y ⋅ u 2 u 2 ⋅ u 2 u 2 = y ^ 1 + y ^ 2 \hat{\mathbf{y}} = \frac{\mathbf{y} \cdot \mathbf{u}_1}{\mathbf{u}_1 \cdot \mathbf{u}_1} \mathbf{u}_1 + \frac{\mathbf{y} \cdot \mathbf{u}_2}{\mathbf{u}_2 \cdot \mathbf{u}_2} \mathbf{u}_2 = \hat{\mathbf{y}}_1 + \hat{\mathbf{y}}_2 y ^ = u 1 ⋅ u 1 y ⋅ u 1 u 1 + u 2 ⋅ u 2 y ⋅ u 2 u 2 = y ^ 1 + y ^ 2
下面动画演示了这个分解过程:
正交投影的核心作用之一是最小化误差 ,常用于高维空间向量的低维近似。在数据分析、机器学习和信号处理等领域,我们常需用低维表示替代高维数据,以简化计算并减少信息损失。在这样的背景下,正交投影提供了一种最优的方法来确定低维近似向量,使得误差最小。它不仅保证了投影后的向量在目标子空间内,同时确保了该向量与原向量之间的距离最小。下面的定理表达了这种"最近似"的概念:
我们可以把正交投影看作把高纬度向量降到低维度空间上的过程,例如我们现在有一个高维数据点 y ~\mathbf{y}~ y 和一个二维子空间 W ~W~ W ,这个子空间由两个基向量 u 1 ~\mathbf{u}_1~ u 1 和 u 2 ~\mathbf{u}_2~ u 2 张成。具体数据如下:
y = [ − 1 − 5 10 ] , u 1 = [ 5 − 2 1 ] , u 2 = [ 1 2 − 1 ] \mathbf{y} = \begin{bmatrix} -1 \\ -5 \\ 10 \end{bmatrix},\quad\mathbf{u}_1 = \begin{bmatrix} 5 \\ -2 \\ 1 \end{bmatrix}, \quad \mathbf{u}_2 = \begin{bmatrix} 1 \\ 2 \\ -1 \end{bmatrix} y = − 1 − 5 10 , u 1 = 5 − 2 1 , u 2 = 1 2 − 1
我们希望通过将 y ~\mathbf{y}~ y 投影到 W ~W~ W 上来找到最接近的低维表示,和前面 正交分解示例 的计算过程是一样的。根据正交投影公式,可将 y ~\mathbf{y}~ y 分解如下:
y = y ^ + z \mathbf{y} = \hat{\mathbf{y}} + \mathbf{z} y = y ^ + z
其中 y ^ = [ − 1 − 7 1 ] T \hat{\mathbf{y}} = \begin{bmatrix}-1 & -7 & 1\end{bmatrix}^T y ^ = [ − 1 − 7 1 ] T 为投影的二维空间 W ~W~ W 上的近似向量; z = [ 0 2 9 ] T ~\mathbf{z} = \begin{bmatrix}0 & 2 & 9\end{bmatrix}^T~ z = [ 0 2 9 ] T 是误差向量,误差值(模长): ∥ z ∥ ≈ 9.22 ~\|\mathbf{z}\| \approx 9.22~ ∥ z ∥ ≈ 9.22 。
5. 正交投影的矩阵表示
定理 8 ~8~ 8 通过逐项计算每个基向量上的投影来实现正交投影,而在实际应用中,矩阵运算 U U T y ~\mathbf{U}\mathbf{U}^T\mathbf{y}~ U U T y 提供了一种更高效、更通用的方法来完成投影计算,特别适用于大规模数据处理和高维空间的投影问题。在定理 8 ~8~ 8 的基础上,我们进一步推导并在标准正交基的条件下,可得下面的定理:
6. 正交投影的应用
在 2.1 节 我们讨论过一种用矩阵运算来识别特定图像模型的方法。当时只是给出了模式识别矩阵 M ~\mathbf{M}~ M ,下面我们利用正交补空间和矩阵投影来介绍如何构造 出矩阵 M ~\mathbf{M}~ M 。我们定义一个模式向量 w ~\mathbf{w}~ w ,用来识别的目标图案。例如下面这个图形 " ⊥ ~\perp~ ⊥ " :
我们的目标是构造一个矩阵 M ~\mathbf{M}~ M ,使得:如果输入向量 u ~\mathbf{u}~ u 符合模式 w ~\mathbf{w}~ w ,则 u T M u = 0 ~\mathbf{u}^T\mathbf{M} \mathbf{u} = 0~ u T Mu = 0 ;否则 u T M u ≠ 0 ~\mathbf{u}^T\mathbf{M}\mathbf{u} \neq 0~ u T Mu = 0 。构造 M ~\mathbf{M}~ M 的思路是通过求解方程 x T w = 0 ~\mathbf{x}^T\mathbf{w} = 0~ x T w = 0 找到所有与模式向量 w ~\mathbf{w}~ w 正交的向量组成的正交补空间 W ⊥ ~W^\perp~ W ⊥ ,构造其基矩阵 B ~\mathbf{B}~ B ,然后计算 M = B T B ~\mathbf{M} = \mathbf{B}^T\mathbf{B}~ M = B T B 以得到模式检测矩阵。下面是具体过程: