主成分分析原理

上传人:枫** 文档编号:568265013 上传时间:2024-07-23 格式:PDF 页数:8 大小:267.12KB
返回 下载 相关 举报
主成分分析原理_第1页
第1页 / 共8页
主成分分析原理_第2页
第2页 / 共8页
主成分分析原理_第3页
第3页 / 共8页
主成分分析原理_第4页
第4页 / 共8页
主成分分析原理_第5页
第5页 / 共8页
点击查看更多>>
资源描述

《主成分分析原理》由会员分享,可在线阅读,更多相关《主成分分析原理(8页珍藏版)》请在金锄头文库上搜索。

1、第七章主成分分析(一)教学目的(一)教学目的通过本章的学习,对主成分分析从总体上有一个清晰地认识,理解主成分分析的基本思想和数学模型, 掌握用主成分分析方法解决实际问题的能力。(二)基本要求(二)基本要求了解主成分分析的基本思想,几何解释,理解主成分分析的数学模型,掌握主成分分析方法的主要步骤。(三)教学要点(三)教学要点1、主成分分析基本思想,数学模型,几何解释2、主成分分析的计算步骤及应用(四)教学时数(四)教学时数3 课时(五)教学内容(五)教学内容1、主成分分析的原理及模型2、主成分的导出及主成分分析步骤在实际问题中,我们经常会遇到研究多个变量的问题,而且在多数情况下,多个变量之间常常

2、存在一定的相关性。由于变量个数较多再加上变量之间的相关性, 势必增加了分析问题的复杂性。如何从多个变量中综合为少数几个代表性变量,既能够代表原始变量的绝大多数信息,又互不相关,并且在新的综合变量基础上,可以进一步的统计分析,这时就需要进行主成分分析。第一节第一节主成分分析的原理及模型主成分分析的原理及模型一、主成分分析的基本思想及数学模型一、主成分分析的基本思想及数学模型(一)主成分分析的基本思想主成分分析是采取一种数学降维的方法, 找出几个综合变量来代替原来众多的变量, 使这些综合变量能尽可能地代表原来变量的信息量,而且彼此之间互不相关。这种将把多个变量化为少数几个互相无关的综合变量的统计分

3、析方法就叫做主成分分析或主分量分析。主成分分析所要做的就是设法将原来众多具有一定相关性的变量, 重新组合为一组新的相互无关的综合变量来代替原来变量。通常,数学上的处理方法就是将原来的变量做线性组合,作为新的综合变量, 但是这种组合如果不加以限制, 则可以有很多,应该如何选择呢?如果将选取的第一个线性组合即第一个综合变量记为F1,自然希望它尽可能多地反映原来变量的信息,这里“信息”用方差来测量,即希望Var(F1)越大,表示F1包含的信息越多。因此在所有的线性组合中所选取的F1应该是方差最大的,故称F1为第一主成分。如果第一主成分不足以代表原来p个变量的信息,再考虑选取F2即第二个线性组合,为了

4、有效地反映原来信息,F1已有的信息就不需要再出现在F2中,用数学语言表达就是要求Cov(F1,F2)0, 称F2为第二主成分, 依此类推可以构造出第三、四第p个主成分。(二)主成分分析的数学模型第 - 213 - 页对于一个样本资料,观测p个变量x1,x2,xp,n个样品的数据资料阵为: x1jx2 j其中:xj,xnjj 1,2,p主成分分析就是将p个观测变量综合成为p个新的变量 (综合变量) ,即简写为:要求模型满足以下条件:Fi,Fj互不相关(i j,i, j 1,2, p)F1的方差大于F2的方差大于F3的方差,依次类推于是,称F1为第一主成分,F2为第二主成分,依此类推,有第p个主成

5、分。 主成分又叫主分量。 这里aij我们称为主成分系数。上述模型可用矩阵表示为:F AX,其中A称为主成分系数矩阵。二、主成分分析的几何解释二、主成分分析的几何解释假设有n个样品,每个样品有二个变量,即在二维空间中讨论主成分的几何意义。设n个样品在二维空间中的分布大致为一个椭园,如下图所示:图 7.1主成分几何解释图将坐标系进行正交旋转一个角度,使其椭圆长轴方向取坐标y1,在椭圆短轴方向取坐标y2,旋转公式为写成矩阵形式为:Y y11y21y12y1ny22y2n其中U为坐标旋转变换矩阵,它是正交矩阵,即有U U1,UU I,即满足sin2 cos21。经过旋转变换后,得到下图的新坐标:图 7

6、.2主成分几何解释图新坐标y1 y2有如下性质:(1)n个点的坐标y1和y2的相关几乎为零。(2)二维平面上的n个点的方差大部分都归结为y1轴上, 而y2轴上的方差较小。y1和y2称为原始变量x1和x2的综合变量。由于n个点在y1轴上的方差最大,因而将二维空间的点用在y1轴上的一维综合变量来代替,所损失的信息量最小,由此称y1轴为第一主成分,y2轴及y1轴正交,有较小的方差,称它为第二主成分。三、主成分分析的应用三、主成分分析的应用主成分概念首先是由 Karl parson 在 1901 年引进,但当时只对非随机变量来讨论的。1933 年 Hotelling 将这个概念推广到随机变量。特别是近

7、年来,随着计算机软件的应用,使得主成分分析的应用也越来越广泛。其中,主成分分析可以用于系统评估。系统评估是指对系统营运状态做出评估, 而评估一个系统的营运状态往往需要综合考察许多营运变量,例如对某一类企业的经济效益作评估,影响经济效益的变量很多,很难直接比较其优劣,所以解决评估问题的第 - 215 - 页焦点是希望客观、 科学地将一个多变量问题综合成一个单变量形式,也就是说只有在一维空间中才能使排序评估成为可能,这正符合主成分分析的基本思想。在经济统计研究中,除了经济效益的综合评价研究外,对不同地区经济发展水平的评价研究,不同地区经济发展竞争力的评价研究,人民生活水平、生活质量的评价研究,等等

8、都可以用主成分分析方法进行研究。另外,主成分分析除了用于系统评估研究领域外,还可以及回归分析结合,进行主成分回归分析,以及利用主成分分析进行挑选变量,选择变量子集合的研究。第二节第二节主成分的导出及主成分分析的步骤主成分的导出及主成分分析的步骤一、主成分的导出一、主成分的导出根据主成分分析的数学模型的定义,要进行主成分分析,就需要根据原始数据,以及模型的三个条件的要求,如何求出主成分系数,以便得到主成分模型。这就是导出主成分所要解决的问题。1、 根据主成分数学模型的条件要求主成分之间互不相关,为此主成分之间的协差阵应该是一个对角阵。即,对于主成分,其协差阵应为,2、设原始数据的协方差阵为V,如

9、果原始数据进行了标准化处理后则协方差阵等于相关矩阵,即有,3、再由主成分数学模型条件和正交矩阵的性质,若能够满足条件最好要求A为正交矩阵,即满足于是,将原始数据的协方差代入主成分的协差阵公式得展开上式得展开等式两边,根据矩阵相等的性质,这里只根据第一列得出的方程为:为了得到该齐次方程的解,要求其系数矩阵行列式为 0,即显然,1是相关系数矩阵的特征值,a1a11,a12,a1p是相应的特征向量。根据第二列、第三列等可以得到类似的方程,于是i是方程的p个根,i为特征方程的特征根,aj是其特征向量的分量。4、下面再证明主成分的方差是依次递减设相关系数矩阵R的p个特征根为12 p,相应的特征向量为aj

10、相对于F1的方差为同样有:Var(Fi) i,即主成分的方差依次递减。 并且协方差为:综上所述,根据证明有,主成分分析中的主成分协方差应该是对角矩阵, 其对角线上的元素恰好是原始数据相关矩阵的特征值,而主成分系数矩阵A的元素则是原始数据相关矩阵特征值相应的特征向量。矩阵A是一个正交矩阵。于是,变量x1, x2,xp经过变换后得到新的综合变量新的随机变量彼此不相关,且方差依次递减。二、主成分分析的计算步骤二、主成分分析的计算步骤第 - 217 - 页样本观测数据矩阵为:第一步:对原始数据进行标准化处理。第一步:对原始数据进行标准化处理。1n其中xjxijni1第二步:计算样本相关系数矩阵。第二步

11、:计算样本相关系数矩阵。为方便,假定原始数据标准化后仍用X表示,则经标准化处理后的数据的相关系数为:第三步:第三步: 用雅克比方法求相关系数矩阵用雅克比方法求相关系数矩阵R的特征值的特征值 (1,2p)和相应的特征向量和相应的特征向量aiai1,ai2,aip,i 1,2 p。第四步:选择重要的主成分,并写出主成分表达式。第四步:选择重要的主成分,并写出主成分表达式。主成分分析可以得到p个主成分, 但是, 由于各个主成分的方差是递减的,包含的信息量也是递减的,所以实际分析时,一般不是选取p个主成分,而是根据各个主成分累计贡献率的大小选取前k个主成分,这里贡献率就是指某个主成分的方差占全部方差的

12、比重,实际也就是某个特征值占全部特征值合计的比重。即贡献率=ipii1贡献率越大,说明该主成分所包含的原始变量的信息越强。主成分个数k的选取,主要根据主成分的累积贡献率来决定,即一般要求累计贡献率达到 85%以上,这样才能保证综合变量能包括原始变量的绝大多数信息。另外,在实际应用中,选择了重要的主成分后,还要注意主成分实际含义解释。 主成分分析中一个很关键的问题是如何给主成分赋予新的意义,给出合理的解释。一般而言,这个解释是根据主成分表达式的系数结合定性分析来进行的。 主成分是原来变量的线性组合,在这个线性组合中个变量的系数有大有小,有正有负,有的大小相当,因而不能简单地认为这个主成分是某个原

13、变量的属性的作用, 线性组合中各变量系数的绝对值大者表明该主成分主要综合了绝对值大的变量,有几个变量系数大小相当时,应认为这一主成分是这几个变量的总和,这几个变量综合在一起应赋予怎样的实际意义,这要结合具体实际问题和专业,给出恰当的解释,进而才能达到深刻分析的目的。第五步:计算主成分得分。第五步:计算主成分得分。根据标准化的原始数据,按照各个样品,分别代入主成分表达式,就可以得到各主成分下的各个样品的新数据,即为主成分得分。具体形式可如下。第六步:第六步:依据主成分得分的数据,依据主成分得分的数据,则可以进行进一步的统计则可以进行进一步的统计分析。分析。其中,常见的应用有主成份回归,变量子集合的选择,综合评价等。第 - 219 - 页

展开阅读全文
相关资源
正为您匹配相似的精品文档
相关搜索

最新文档


当前位置:首页 > 建筑/环境 > 施工组织

电脑版 |金锄头文库版权所有
经营许可证:蜀ICP备13022795号 | 川公网安备 51140202000112号