10.2相关分析方法 课件(共22张PPT)-《统计学基础》同步教学(同济大学出版社)

资源下载
  1. 二一教育资源

10.2相关分析方法 课件(共22张PPT)-《统计学基础》同步教学(同济大学出版社)

资源简介

(共22张PPT)
项目十
相关分析与回归分析
目录
CONTENTS
1
相关关系的概念和类型
2
相关分析方法
3
一元线性回归分析
4
Excel 在相关分析与回归分析中的应用
学习目标
· 掌握相关关系的判断;
· 了解相关关系的概念及种类;
· 掌握回归系数的含义及计算;
· 掌握一元线性回归分析方法;
· 熟悉利用 Excel 进行相关分析和回归分析的方法。
01
02
03
04
05
项目导航
相关分析与回归分析
相关关系的概念和类型
相关分析方法
一元线性回归分析
相关关系的类型
相关分析和回归分析的主要内容
编制相关表
绘制相关图
计算相关系数
回归分析概念
估计标准误差
绘制散点图
Excel在相关分析中的应用
Excel在回归分析中的应用
Excel在回归预测中的应用
一元线性回归方程
Excel在相关分析与回归分析中的应用
相关关系的概念
估计标准误差和相关系数关系
案例导入
2013 年 8 月,谷歌公司(以下简称“谷歌”)把大数据技术成功地应用到电影票房的预测上,并撰文公布了研究成果 QuantifyingMovieMagicwithGoogleSearch 。该报告称,谷歌仅以单词搜索量为依据,构建了一个票房预测模型,可以提前一个月预测电影的首周票房,准确度高达 94% 。令人惊讶的是,这是一个简单的线性回归模型,谷歌是如何做到的呢
据谷歌统计,2011 — 2012 年,与电影相关的单词的搜索量飞速增长,这使得谷歌萌发了票房预测的想法。谷歌的工程师收集了 2012 年与电影相关的单词搜索总量与票房总收入的数据,并画出曲线图。随着时间的变化,两条曲线的起伏变化趋势十分相似,这预示着两条曲线存在很强的相关性,也就是搜索量和票房这两个变量之间存在强相关关系。起初,谷歌选取了 2012 年上映的 99 部电影,做出搜索量与票房的线性模型,预测准确率只有 70% ,而且只能提前一周预测一部电影的票房,这对电影的营销几乎没有帮助。经过反复试验,谷歌选用了电影预告片的搜索量、同系列电影前几部的票房和档期的淡季、旺季特征等作为参考指标,最终在 2013 年 8 月构建出准确率高达 94% 的预测模型,而这个
模型就是统计中最简单的线性回归模型。
谷歌票房的预测模型在 2013 年获得了成功,虽然这不能意味着该模型始终有效,但这让我们看到,随着大数据概念的兴起,数据预测这门新兴的技术在经济、体育、娱乐等领域越来越受青睐。在概率统计中的数据预测技术就是数据的相关分析和回归分析。
谷歌惊人的票房预测
02
模块二
相关分析方法
一、编制相关表
相关表是一种反映变量之间相关关系的统计表。将其中一个变量按照取值从小到大的顺序排列,再将与其相关的另一个变量对应的数值列出来,便可以形成简单相关表。通过相关表,可以初步看出相关关系的形式、密切程度和相关方向。
二、绘制相关图
相关图又称散点图,是把相关表中的原始数据在平面直角坐标系中以坐标点描绘出来,以横轴为自变量 x ,纵轴为因变量 y ,通过标出的每对变量值的坐标点或散布点(x , y ),观察其分布情况。
三、计算相关系数
1. 相关系数的意义
相关系数是在线性相关的条件下,用来说明两个变量间相关关系密切程度和方向的统计分析指标,通常用 r 表示。其表现形式为相对数,不受变量值计量单位的影响。
相关系数的取值有一个范围: -1≤ r ≤1 ;有两个方向:r >0 表示变量间正相关, r <0 表示负相关。 |r | 的大小可以反映变量间线性关系的强弱,也就是相关程度的评价标准,具体如下:
(1 ) 0<| r |≤0.3 为弱相关。
(2) 0.3<| r |≤0.5 为低度相关。
(3) 0.5<| r |≤0.8 为显著相关。
(4) 0.8<| r |≤1 为高度相关。
三、计算相关系数
2. 相关系数的计算
1890 年,英国统计学家卡尔·皮尔逊( KarlPearson )提出了相关关系的计算公式,即通过自变量和因变量的各自离差的乘积来计算,也称为差积法。相关关系的基本公式如下:
三、计算相关系数
2. 相关系数的计算
在实际工作中利用相关系数的基本公式来计算相关系数非常烦琐。利用平均数的数学性质可以将其化简为
小案例
足长与阅读能力
通过记录和观察某小学所有低年级和高年级学生的足长以及语文阅读能力情况,发现足长的学生,其语文阅读能力往往比较强。足长与语文阅读能力正相关。这是否说明词汇量越多、阅读水平越高,学生的脚就越长呢 或者说,要想提高学生的阅读能力,可以想办法把他的脚变长吗
事实上,足长与语文阅读能力是没有关系的,之所以从数据上看是正相关,是因为足长和阅读能力都与年龄有关。年龄大了,学的知识更多,阅读能力自然更好,而随着年龄的增加和身体的发育,足长自然也增加了。如果对同一年级的学生做统计,就会发现足长与阅读能力没有什么关系。年龄这个变量是混杂在足长与语文阅读能力这两个变量之间的,可称为混杂变量。正是它的存在,使计算相关系数以及画散点图都表明某两个变量相关,但是它们有可能并不是真正的相关。
知识拓展
高尔顿钉板与身高遗传
高尔顿的学生卡尔·皮尔逊也是著名的统计学家,他在研究家庭成员间的相似性时,测量了 1078 对父亲与其成年儿子的身高,并作了散点图,发现高个子父亲的成年儿子往往也比较高,矮个子父亲的成年儿子往往也比较矮。这说明父亲身高这个遗传因素对儿子成年后的身高有显著的影响。那为什么成年儿子的身高呈正态分布呢 他的老师高尔顿用改造后的高尔顿钉板形象地解释了原因。在钉板下部的矩形区域增加一个挡板把小圆球截住,挡板下面的区域又有很多彼此距离相等的钉子(和入口处的相似)。小球从漏斗状开口处向下滚落,将在这个挡板处汇聚成正态曲线[见图 10-9 ( a )]。假设挡板各个槽都有阀门,当打开某个槽的阀门时,从该槽处向下滚落的小球会在最底部汇聚成一个小的正态曲线。设想将所有阀门都打开,则从各槽内向下滚落的小球就会在最底部汇聚成许多个大小与位置不同的小正态曲线[见图 10-9 ( b )]。而没有挡板时,底部汇聚的正态曲线正是由这些小正态曲线混合而成的。
中间挡板处汇聚的正态曲线相当于父亲身高的分布,各个槽内的小球可被认为是身高相同的父亲,槽的阀门打开后底部汇成的小正态曲线相当于身高相同的父亲的成年儿子的身高分布。这些分布的混合曲线就是成年儿子身高的正态曲线。这就解释了为什么虽然遗传因素对成年儿子的身高有显著的影响,但最终仍然服从正态分布。
03
模块三
一元线性回归分析
一、回归分析的概念
“回归”一词最早被 19 世纪英国的生物学家高尔顿及其学生皮尔逊提出
回归分析是指研究一个或几个变量的变动对另一个变量的变动影响程度的方法。建立一个数学方程来反映变量之间具体的相互依存关系,并最终通过给定的自变量数值来估计或预测因变量的可能数值,该数学方程称为回归模型。
回归分析的关键就在于,如何建立恰当的回归模型来刻画变量间的具体关系。
一、回归分析的概念
根据变量之间关系的类型,回归分析可分为线性回归分析和非线性回归分析等。根据自变量的个数不同,回归分析可分为一元回归分析和多元回归分析。其中,一元线性回归分析是最为基础的一种情况,也是本模块要介绍的内容。
二、一元线性回归方程
2. 相关系数的计算
在回归分析中,被预测或被解释的变量称为因变量,用 y 表示。用来预测或用来解释因变量的一个或多个变量称为自变量,用 x 表示。只涉及一个自变量的回归,称为一元回归,若因变量 y 与自变量 x 之间为线性关系,则称为一元线性回归(直线回归),该直线方程称为一元线性回归方程。方程的基本形式为
^y = a + bx
式中,^y 表示 y 的估计值; b 表示的几何意义为直线斜率,而在回归分析中称为回归系数。
二、一元线性回归方程
估计值 ^y 与实际值 y 之间是存在误差的,其误差首先表现为二者的离差 y -^y ,其离差有正有负,为了避免正负离差的相互抵消,可以借助离差的平方和 ∑ 。能够使离差平方和最小的直线,也就是与各离散点的距离最近的直线,就是最优的、最理想的回归直线。
设 Q = ∑ = ∑ ,可以看出 Q 是关于待定的参数 a 和 b 的二元函数。要使 Q 达到最小值,需要分别对 a 和 b 求一阶偏导数并令其等于零,即
三、估计标准误差
估计标准误差是指因变量实际观测值与理论估计值离差的平均值,其反映了实际观测值在回归直线周围的分散程度,其计算原理与标准差基本相同,计算公式为
式中,S e 为估计标准误差;^y 为根据回归方程推算出的因变量的估计值; y 为因变量,是实际观测值;n 为数据的项数。
将 ^y = a + bx 代入上述公式中,也可以化简为
知识拓展
判 定 系 数
判断回归方程拟合度好坏的另外一个常用的指标是判定系数。一般情况下,误差的大小可以通过每一个 y 的观测值与平均值y 的离差( y - y )来表示,先将其分解为估计离差与回归离差的和,即 y - y = ( y -^y ) + (^y - y )。将等式两边平方,再对所有观测点求和、化简,n 次观测值的总离差平方和 ∑ 可以分解为两个部分:
的取值范围是 0≤ ≤1 ,主要作用在于它反映了已判明因素在总离差中所占的比例,即自变量对因变量的影响程度。 越接近 1 ,表明回归离差平方和占总离差平方和的比例越大,自变量对因变量的影响程度大,回归直线与各观测点越接近,回归直线的拟合程度越好;相反, 越接近 0 ,表明回归直线的拟合程度越差; =0 时,回归方程不能用来预测。相关系数 r 也是反映两个变量之间线性关系密切程度的重要指标,可以证明,在一元线性回归中,判定系数就是相关系数 r 的平方。
四、估计标准误差和相关系数的关系
估计标准误差 Se 与前文提到的相关系数 r (反映两个变量之间线性关系密切程度的重要指标)在数量上存在密切的联系,二者之间的关系可以表示为
也就是先算 r ,再算 Se
知识拓展
相关分析与回归分析
相关分析与回归分析都是研究两个变量相关关系的分析方法,二者有着密切的联系。首先,相关分析是回归分析的基础和前提,只有当两个变量具有密切的相关关系时,进行的回归分析才有意义,回归预测的代表性才有保障。其次,回归分析是相关分析的深入和继续。相关分析计算出的相关系数只能说明两个变量间的相关方向和密切程度,而要确定变量间相关关系的具体形式,从一个变量的变化来推测另一个变量的变化情况,就要借助回归分析。相关分析和回归分析是统计学中对现象间相互关系分析的两个不可分割的分析阶段。
相关分析和回归分析也有着各自不同的特点,具体如下:
(1)相关分析中两个变量可以都是随机变量,而在回归分析中因变量是随机的,
自变量是给定的数值。
(2)相关分析中两个变量是对等的关系,也就是不必确定哪个是自变量、哪个是因变量,互换它们的位置不影响相关系数的数值。而回归分析中的两个变量是不对等的关系,如果互换它们的位置,计算和分析的结果就会出现严重的偏差。
(3)相关分析中计算的相关系数是一个在一定范围内的抽象系数,系数的大小反映出变量间的相关关系的密切程度。而回归分析中建立的回归方程反映的是变量间具体的变动关系。根据回归方程,只要给出自变量的定值,就可以估计或预测一个因变量的数值。

展开更多......

收起↑

资源预览