一般的统计模型形式:y=f(x)+ϵy=f(x)+\epsilon,其中:

  • xx为数据/自变量,yy为预测/因变量,ϵ\epsilon为误差/噪声。

线性模型就是对这一模型的理想化近似:f(x)=β0+x1β1+⋯+xpβpf(x)=\beta_0+x_1\beta_1+\cdots+x_p\beta_p,其中pp为数据的维度。同时假设误差服从(多元)正态分布N(0,Σ)N(0,\Sigma)。

前置知识(矩阵代数与随机向量)

这里主要是对高等代数(矩阵论)以及概率论(期望、方差、矩母函数等)的回顾。一些概念可能会与概率论 Cheat Sheet以及CS127系列笔记有部分重复,但笔者还是决定再记一遍毕竟有些概念确实容易忘记

矩阵论

  1. 矩阵的迹与特征值

    tr(A+B)=tr(A)+tr(B)tr(AB)=tr(BA)\begin{aligned} \text{tr}(A+B)&=\text{tr}(A)+\text{tr}(B)\\ \text{tr}(AB)&=\text{tr}(BA) \end{aligned}
    • 设A∈Rm×n,B∈Rn×mA\in\R^{m\times n},B\in\R^{n\times m},则ABAB的非零特征值与BABA相同(考虑代数重数)。【证明提示:ABx=λx⟹BA(Bx)=λ(Bx)ABx=\lambda x\Longrightarrow BA(Bx)=\lambda(Bx)】
      • 特别地,当AA与BB均为方阵时,ABAB与BABA的特征值完全相同。【若ABAB有零特征值,则∣AB∣=0=∣BA∣|AB|=0=|BA|】
    • 若AA为nn阶方阵,且有nn个特征值λ1,⋯ ,λn\lambda_1,\cdots,\lambda_n,那么有 tr(A)=∑i=1nλi,∣A∣=∏i=1nλi.\text{tr}(A)=\sum_{i=1}^n\lambda_i,\quad |A|=\prod_{i=1}^n\lambda_i.
  2. 对称矩阵(用于考察协方差矩阵)
    设AA为nn阶实对称矩阵,那么其有以下性质:

    1. AA的所有特征值均为实数,对应的特征向量也由实数构成;
    2. 矩阵任意两个不同特征值对应的特征向量相互正交;
    3. AA一定有nn个特征值(记作λ1,⋯ ,λn\lambda_1,\cdots,\lambda_n),且对应的nn个特征向量可以标准正交对角化;
    4. AA可以进行下述分解(也称为谱分解): A=P(λ1⋱λn)P⊤≜PΛP⊤A=P\begin{pmatrix}\lambda_1&&\\&\ddots&\\&&\lambda_n\end{pmatrix}P^\top\triangleq P\Lambda P^\top 其中PP为标准正交矩阵。
    5. 对任意正整数ss,有 A=P(λ1s⋱λns)P⊤≜PΛsP⊤⟹tr(As)=∑i=1nλisA=P\begin{pmatrix}\lambda_1^s&&\\&\ddots&\\&&\lambda_n^s\end{pmatrix}P^\top\triangleq P\Lambda^s P^\top\Longrightarrow \text{tr}(A^s)=\sum_{i=1}^n\lambda_i^s
    6. 若AA满秩,则A−1A^{-1}的特征值为λ1−1,⋯ ,λn−1\lambda_1^{-1},\cdots,\lambda_n^{-1};
    7. In+cAI_n+cA的特征值为1+cλ1,⋯ ,1+cλn1+c\lambda_1,\cdots,1+c\lambda_n;
    8. 若AA为半正定矩阵(p.s.d.),则其所有特征值均非负,因此tr(A)≥0\text{tr}(A)\geq 0。
    9. Rayleigh商性质: max⁡x⊤x≠0x⊤Axx⊤x=λmax⁡(A),min⁡x⊤x≠0x⊤Axx⊤x=λmin⁡(A)\max_{\mathbf{x}^\top\mathbf{x}\neq 0}\frac{\mathbf{x}^\top A\mathbf{x}}{\mathbf{x}^\top\mathbf{x}}=\lambda_{\max}(A),\quad \min_{\mathbf{x}^\top\mathbf{x}\neq 0}\frac{\mathbf{x}^\top A\mathbf{x}}{\mathbf{x}^\top\mathbf{x}}=\lambda_{\min}(A)
  3. 半正定矩阵
    定义矩阵的Löwner序:A⪰B⟺A−BA\succeq B\Longleftrightarrow A-B为半正定矩阵⟺x⊤Ax≥x⊤Bx,∀x∈Rn\Longleftrightarrow \mathbf{x}^\top A\mathbf{x}\geq\mathbf{x}^\top B\mathbf{x},\forall\mathbf{x}\in\R^n

    • 特别地,若A,BA,B均为正定矩阵,则有A⪰B⟺A−1⪯B−1A\succeq B\Longleftrightarrow A^{-1}\preceq B^{-1}。【当然也可以推广到BB为半正定矩阵的情形,此时AB−A⪯AAB^-A\preceq A】
  4. 矩阵列空间
    设矩阵XX的列空间为M(X)\mathcal{M}(X),则有M(X⊤)=M(X⊤X)\mathcal{M}(X^\top)=\mathcal{M}(X^\top X)(相应地,有M(X)=M(XX⊤)\mathcal{M}(X)=\mathcal{M}(XX^\top))

  5. 奇异值分解(SVD)
    奇异值定义:设X∈Rn×pX\in\R^{n\times p}的秩为rr,X⊤XX^\top X的正特征值为λ1≥⋯≥λr>0\lambda_1\geq\cdots\geq\lambda_r>0,则XX的奇异值为λ1,⋯ ,λr\sqrt{\lambda_1},\cdots,\sqrt{\lambda_r}

    • 对上述矩阵XX,一定存在标准正交矩阵P∈Rp×pP\in\R^{p\times p}和Q∈Rn×nQ\in\R^{n\times n}使得 X=Q(Λ12000)P⊤≜Q1Λr12P1⊤X=Q\begin{pmatrix}\Lambda^{\frac12}&\mathbf{0}\\\mathbf{0}&\mathbf{0}\end{pmatrix}P^\top\triangleq Q_1\Lambda_r^{\frac12}P_1^\top 其中Q1Q_1和P1P_1分别是由XX⊤XX^\top和X⊤XX^\top X的非零特征值对应的特征向量构成的矩阵。
  6. 幂等矩阵与投影矩阵

    • 幂等矩阵定义:A2=AA^2=A,其主要性质为:特征值只有00和11。
    • (正交)投影定义:设Ω\Omega为Rn\R^n的一个线性子空间,y∈Rn\mathbf{y}\in\R^n,则如果对于u∈Ω\mathbf{u}\in\Omega有y−u⊥Ω\mathbf{y}-\mathbf{u}\perp\Omega,则称u\mathbf{u}为y\mathbf{y}在Ω\Omega上的正交投影,记作u=projΩ(y)\mathbf{u}=\text{proj}_\Omega(\mathbf{y})。
    • 正交投影(矩阵)具有如下性质:
      1. 正交投影具有唯一性(设Ω=M(X)\Omega=\mathcal{M}(X),则可用矩阵X(X⊤X)−1X⊤X(X^\top X)^{-1}X^\top表示这一变换)
      2. proj(y)=arg min⁡α∈Ω∥y−α∥2=arg min⁡Xβ∈Ω=M(X)∥y−Xβ∥2.\text{proj}(\mathbf{y}) = \argmin_{\alpha \in \Omega} \|\mathbf{y} - \alpha\|^2 = \argmin_{X\mathbf{\beta} \in \Omega = \mathcal{M}(X)} \|\mathbf{y} - X\mathbf{\beta}\|^2.
      3. ϕ:Rn→Ω⊆Rn\phi:\R^n\to\Omega\subseteq\R^n为正交投影⟺\Longleftrightarrow存在幂等矩阵P∈Rn×nP\in\R^{n\times n},Ω=M(P)\Omega=\mathcal{M}(P)使得ϕ(y)=Py,∀y∈Rn\phi(\mathbf{y})=P\mathbf{y},\forall \mathbf{y}\in\R^n【投影矩阵⇔\Leftrightarrow实对称幂等矩阵】
      4. 当PP为Rn\R^n到Ω\Omega的投影矩阵时,In−PI_n-P为Rn\R^n到Ω⊥\Omega^\perp的投影矩阵。
      5. 对于投影矩阵P1,P2P_1,P_2,下列表述等价:
        • P1⪰P2P_1\succeq P_2;
        • P1P2=P2P1=P2P_1P_2=P_2P_1=P_2;
        • P1−P2P_1-P_2为投影矩阵;
        • M(P2)⊆M(P1)\mathcal{M}(P_2)\subseteq\mathcal{M}(P_1)。
  7. 向量微分与广义逆
    定义β=(β1,β2,⋯ ,βn)⊤\beta=\begin{pmatrix}\beta_1,\beta_2,\cdots,\beta_n\end{pmatrix}^\top,则∂∂β=(∂∂β1,∂∂β2,⋯ ,∂∂βn)⊤\dfrac{\partial}{\partial\beta}=\begin{pmatrix}\dfrac{\partial}{\partial\beta_1},\dfrac{\partial}{\partial\beta_2},\cdots,\dfrac{\partial}{\partial\beta_n}\end{pmatrix}^\top,由此可定义如下微分:

    • 当y=f(x):Rn→Ry=f(\mathbf{x}):\R^n\to\R,则∂f∂x=(∂f∂x1,∂f∂x2,⋯ ,∂f∂xn)⊤\dfrac{\partial f}{\partial x}=\begin{pmatrix}\dfrac{\partial f}{\partial x_1},\dfrac{\partial f}{\partial x_2},\cdots,\dfrac{\partial f}{\partial x_n}\end{pmatrix}^\top;
    • 当y=f(x):Rn→Rm\mathbf{y}=f(\mathbf{x}):\R^n\to\R^m,则∂f⊤∂x=(∂f1∂x,∂f2∂x,⋯ ,∂fm∂x)\dfrac{\partial f^\top}{\partial \mathbf{x}}=\begin{pmatrix}\dfrac{\partial f_1}{\partial\mathbf{x}},\dfrac{\partial f_2}{\partial\mathbf{x}},\cdots,\dfrac{\partial f_m}{\partial \mathbf{x}}\end{pmatrix}【结果为n×mn\times m矩阵】,∂f∂x⊤=(∂f⊤∂x)⊤\dfrac{\partial f}{\partial \mathbf{x}^\top}=\left(\dfrac{\partial f^\top}{\partial \mathbf{x}}\right)^\top。

    实例:

    • 对任意向量a∈Rn\mathbf{a}\in\R^n,∂β⊤a∂β=a\dfrac{\partial\beta^\top\mathbf{a}}{\partial\beta}=\mathbf{a},而对任意列数为nn的矩阵AA,∂β⊤A∂β=A\dfrac{\partial\beta^\top A}{\partial\beta}=A。
    • 对于任意方阵AA,∂(β⊤Aβ)∂β=(A+A⊤)β\dfrac{\partial(\beta^\top A \beta)}{\partial\beta} = (A+A^\top)\beta。特别地,当AA为对称矩阵时,∂(β⊤Aβ)∂β=2Aβ\dfrac{\partial(\beta^\top A \beta)}{\partial\beta} = 2A\beta。

    矩阵的广义逆定义:A−A^-满足AA−A=AAA^-A=A。

    • 例:当A=(A11000)A=\begin{pmatrix}A_{11}&\mathbf{0}\\\mathbf{0}&\mathbf{0}\end{pmatrix}时,A−=(A11BCD)A^-=\begin{pmatrix}A_{11}&B\\C&D\end{pmatrix},其中B,C,DB,C,D为任意矩阵。

随机向量