ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

PCA LDA

PCA  LDA PCA LDA的区别与联系PCA与LDA都是以线性变换与特征值分解为数学基础区别在于是否利用类别标记PCA是无监督的最大方差投影LDA是有监督的最大类别可分性投影前者力求用尽量少的维度表示数据后者力求用尽量少的维度分开类别。线性投影PCA与LDA都是经典的线性降维方法两者都在寻找线性投影yW⊤x\boldsymbol{y}\boldsymbol{W}^\top\boldsymbol{x}yW⊤x把原始高维数据映射到低维子空间。二者本质的区别在于是否使用类别标记。PCA是无监督方法只看数据本身的分布寻找数据变化最大的方向即数据拟合椭圆的主轴使投影后方差最大它不关心样本所属类别LDA是监督方法利用类别标记寻找最能把类别分开的方向使类间散度尽可能大、同时类内散度尽可能小。这决定了PCA更适合压缩与重构、去噪、可视化而LDA更适合以分类为目标的特征提取。特征值问题PCA的目标是投影后方差等价于总散度最大LDA的目标是投影后类间散度与类内散度的比值最大最终都归结为散度矩阵的特征值问题投影方向即特征向量的方向两者所用的散度矩阵不同。PCA求解的是样本协方差矩阵S\boldsymbol{S}S等价于St\boldsymbol{S}_{\mathrm t}St​的特征值问题Svλv\boldsymbol{S}\boldsymbol{v}\lambda\boldsymbol{v}Svλv特征向量即主成分方向。LDA则把St\boldsymbol{S}_{\mathrm t}St​拆为SbSw\boldsymbol{S}_{\mathrm b}\boldsymbol{S}_{\mathrm w}Sb​Sw​LDA求解的是广义特征值问题SbwλSww\boldsymbol{S}_{\mathrm b}\boldsymbol{w}\lambda \boldsymbol{S}_{\mathrm w}\boldsymbol{w}Sb​wλSw​w若Sw\boldsymbol{S}_{\mathrm w}Sw​可逆则Sw−1Sbwλw\boldsymbol{S}_{\mathrm w}^{-1}\boldsymbol{S}_{\mathrm b}\boldsymbol{w}\lambda\boldsymbol{w}Sw−1​Sb​wλw其中Sb\boldsymbol{S}_{\mathrm b}Sb​是类间散度矩阵、Sw\boldsymbol{S}_{\mathrm w}Sw​是类内散度矩阵。PCA的主成分个数上限是min⁡(d, N−1)\min\left(d,\,N-1\right)min(d,N−1)ddd为原始维数而LDA的维数上限是K−1K-1K−1KKK为类别数因为类间散度矩阵Sb\boldsymbol{S}_{\mathrm b}Sb​的秩至多为K−1K-1K−1Sb\boldsymbol{S}_{\mathrm b}Sb​的秩不超过K−1K-1K−1故LDA最多提取K−1K-1K−1个判别方向。PCA的特征向量因St\boldsymbol{S}_{\mathrm t}St​对称而必然正交LDA的方向是Sw−1Sb\boldsymbol{S}_{\mathrm w}^{-1}\boldsymbol{S}_{\mathrm b}Sw−1​Sb​的特征向量该矩阵一般不对称因此判别方向之间通常不正交除了Sw\boldsymbol{S}_{\mathrm w}Sw​正比于单位阵。记StSbSw \boldsymbol{S}_{\mathrm t}\boldsymbol{S}_{\mathrm b}\boldsymbol{S}_{\mathrm w}St​Sb​Sw​其中St\boldsymbol{S}_{\mathrm t}St​为总散度、Sb\boldsymbol{S}_{\mathrm b}Sb​为类间散度、Sw\boldsymbol{S}_{\mathrm w}Sw​为类内散度。在忽略类别标记、把所有样本视为一类的特定条件下Sb0\boldsymbol{S}_{\mathrm b}0Sb​0LDA的准则无从定义此时LDA退化为PCA的形式。在实际应用中可结合使用PCA和LDA。当样本数远小于特征维数时Sw\boldsymbol{S}_{\mathrm w}Sw​奇异LDA判别方向无意义先用PCA降维将维数降到Sw\boldsymbol{S}_{\mathrm w}Sw​可逆的范围并去除噪声再在低维空间中用LDA提取判别特征。两者的假设与稳健性也不同。PCA几乎不依赖分布假设只做线性变换行为稳定LDA尤其是线性判别则假设各类近似服从高斯分布、且共享同一个类内协方差矩阵这些条件不满足时效果会下降。更关键的是LDA需要Sw\boldsymbol{S}_{\mathrm w}Sw​可逆在小样本高维情形下Sw\boldsymbol{S}_{\mathrm w}Sw​往往奇异引入正则化例如MATLABfitcdiscr的Gamma参数才能求解PCA 则不存在这个可逆性问题因为它对协方差矩阵做的是特征分解而非求逆。如果把 PCA 中的协方差替换为类间协方差就得到一种有监督的 PCA思路与 LDA 相通。若类内散度Sw\boldsymbol{S}_{\mathrm w}Sw​正比于单位阵即各类均为球形分布则Sw−1Sb∝Sb\boldsymbol{S}_{\mathrm w}^{-1}\boldsymbol{S}_{\mathrm b}\propto \boldsymbol{S}_{\mathrm b}Sw−1​Sb​∝Sb​LDA 的目标退化为单纯最大化类间散度。维度PCALDAFisher 判别监督性无监督不使用类别标记监督依赖类别标记优化目标投影后总方差最大类间散度与类内散度之比最大依据矩阵总散度矩阵St\boldsymbol{S}_{\mathrm t}St​即协方差矩阵Sw−1Sb\boldsymbol{S}_{\mathrm w}^{-1}\boldsymbol{S}_{\mathrm b}Sw−1​Sb​求解形式标准特征值问题Stvλv\boldsymbol{S}_{\mathrm t}\boldsymbol{v}\lambda\boldsymbol{v}St​vλv广义特征值问题SbwλSww\boldsymbol{S}_{\mathrm b}\boldsymbol{w}\lambda \boldsymbol{S}_{\mathrm w}\boldsymbol{w}Sb​wλSw​w成分个数上限min⁡(N−1, d)\min\left(N-1,\,d\right)min(N−1,d)K−1K-1K−1KKK为类别数方向正交性特征向量必然两两正交判别方向一般不正交分布假设无需分布假设常假定各类协方差相同、均值不同高斯最优性含义给定维数下重构误差最小给定维数下分类可分性最好典型用途压缩、去噪、可视化、去相关分类前的特征提取、模式识别小结LDA 与 PCA、马氏距离同属一个数学家族——都以散度矩阵的谱分解为基础。PCA 在总散度St\boldsymbol{S}_{\mathrm t}St​上取大方差方向并截断马氏距离对St\boldsymbol{S}_{\mathrm t}St​求逆、按1/λ1/\lambda1/λ全量加权得到一个仿射不变的度量LDA 则把St\boldsymbol{S}_{\mathrm t}St​拆为SwSb\boldsymbol{S}_{\mathrm w}\boldsymbol{S}_{\mathrm b}Sw​Sb​。
返回列表