《学霸笔记 同步精讲》复习课 第3课时 成对数据的统计分析(课件)高中数学人教A版选择性必修3

资源下载
  1. 二一教育资源

《学霸笔记 同步精讲》复习课 第3课时 成对数据的统计分析(课件)高中数学人教A版选择性必修3

资源简介

(共49张PPT)
第3课时 成对数据的统计分析
复习课
2026
内容索引
01
02
知识梳理 构建体系
专题归纳 核心突破
知识梳理 构建体系
【知识网络】
【要点梳理】
一、成对数据的统计相关性
1.相关关系、散点图
(1)两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为 相关关系 .
(2)每一个序号下的成对样本数据都可用直角坐标系中的点表示出来,由这些点组成了统计图.我们把这样的统计图叫做 散点图 .
(3)如果从整体上看,当一个变量的值增加时,另一个变量的相应值也呈现增加的趋势,我们就称这两个变量正相关;
如果当一个变量的值增加时,另一个变量的相应值呈现减少的趋势,则称这两个变量 负相关.
(4)一般地,如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,我们就称这两个变量线性相关.
一般地,如果两个变量具有相关性,但不是线性相关,那么我们就称这两个变量非线性相关或曲线相关.
2.样本相关系数
(2)当r>0时,变量x与y正相关;当r<0时,变量x与y负相关.
(3)样本相关系数r的取值范围为[-1,1].样本相关系数r的绝对值的大小可以反映成对数据之间线性相关的程度:
当|r|越接近1时,成对样本数据的线性相关程度越强;
当|r|越接近0时,成对样本数据的线性相关程度越弱.
二、一元线性回归模型及其应用
1.一元线性回归模型及经验回归方程
(1)用x表示父亲身高,Y表示儿子身高,e表示随机误差.假定随机误差e的均值为0,方差为与父亲身高无关的定值σ2,则它们之间的关系可以表示为
我们称此式为Y关于x的一元线性回归模型,其中,
Y称为因变量或响应变量,x称为自变量或解释变量;a和b为模型的未知参数,a称为截距参数,b称为斜率参数;e是Y与bx+a之间的随机误差.
2.线性回归分析
三、列联表与独立性检验
1.列联表
(1)我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量.
(2)按研究问题的需要,将数据分类统计,并做成表格加以保存.这种形式的数据统计表称为2×2列联表,关于分类变量X和Y的抽样数据的2×2列联表如下:
X Y 合计
Y=0 Y=1 X=0 a b a+b
X=1 c d c+d
合计 a+c b+d n=a+b+c+d
2.独立性检验
(2)基于小概率值α的检验规则是:当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
当χ2(3)χ2独立性检验中常用的小概率值和相应的临界值
α 0.1 0.05 0.01 0.005 0.001
xα 2.706 3.841 6.635 7.879 10.828
(4)应用独立性检验解决实际问题大致应包括以下几个主要环节:
①提出零假设H0:X和Y相互独立,并给出在问题中的解释.
②根据抽样数据整理出2×2列联表,计算χ2的值,并与临界值xα比较.
③根据检验规则得出推断结论.
④在X和Y不独立的情况下,根据需要,通过比较相应的频率,分析X和Y间的影响规律.
【思考辨析】
判断下列说法是否正确,正确的在后面的括号内画“√”,错误的画“×”.
(1)残差平方和越小,经验回归方程的拟合效果越好.( √ )
(2)决定系数R2越接近于1,经验回归方程的拟合效果越好.( √ )
(3)经验回归直线不一定过点 .( × )
(4)独立性检验得到的结论一定是正确的.( × )
(5)经验回归直线可以不过(xi,yi)中的每一个点.( √ )
(6)χ2的值大就说明两个分类变量有关.( × )
专题归纳 核心突破
专题整合
专题一 回归分析的基本思想及其应用
【例1】 对于x与y有如下观测数据:
(1)作出散点图;
(2)对x与y作回归分析;
(3)求出y对x的经验回归方程;
(4)根据经验回归方程,预测当y=20时x的值.
x 18 25 30 39 41 42 49 52
y 3 5 6 7 8 8 9 10
解:(1)作出的散点图如图所示.
解决经验回归分析问题的一般步骤
(1)画散点图.根据已知数据画出散点图.
(2)判断变量的相关性并求出回归方程.通过观察散点图,直观感知两个变量是否具有相关关系,在此基础上,利用最小二乘法求回归系数,然后写出经验回归方程.
(3)实际应用.依据求得的经验回归方程解决问题.
【变式训练1】 一台机器虽使用时间较长,但还可以使用,它按不同的转速生产出来的某机械零件有一些会有缺点,每小时生产有缺点的零件的多少随机器运转的速度而变化,下表为抽样试验的结果:
转速x/(转/秒) 16 14 12 8
每小时生产有缺点的零件数y/件 11 9 8 5
(1)对变量y与x进行相关性检验;
(2)如果y与x有线性相关关系,求经验回归方程;
(3)若实际生产中,允许每小时生产的产品中有缺点的零件最多为10个,则机器的运转速度应控制在什么范围内
专题二 独立性检验
【例2】 为考察某种药物A对预防疾病B的效果,进行了动物(单位:只)试验,得到如下列联表:
药物 疾病 合计
未患病 患病 未服用 100 80 s
服用 150 70 220
合计 250 t 400
(1)求s,t;
(2)记未服用药物A的动物患疾病B的概率为p,给出p的估计值;
(3)根据小概率值α=0.01的独立性检验,能否认为药物A对预防疾病B有效
附:χ2=.
α 0.050 0.010 0.001
xα 3.841 6.635 10.828
解:(1)由表格信息可知,s=100+80=180,t=80+70=150.
(2)由表格信息可知,未服用药物A的动物共计180只,其中患疾病B的有80只,所以p=.
(3)补全2×2列联表如下:
药物 疾病 合计
未患病 患病 未服用 100 80 180
服用 150 70 220
合计 250 150 400
零假设H0:药物A对预防疾病B无效,
则χ2=≈6.734>6.635.
根据小概率值α=0.01的独立性检验,我们推断H0不成立,
即认为药物A对预防疾病B有效,此推断犯错的概率不超过0.01.
独立性检验问题的求解方法
(1)等高堆积条形图法:依据题目信息画出等高堆积条形图,依据频率差异来粗略地判断两个变量的相关性.
(2)χ2统计量法:通过公式 ,先计算χ2值,再与临界值表进行比较,最后得出结论.
【变式训练2】 某电视台为了解某地区电视观众对某类体育节目的收视情况,随机抽取了100名观众进行调查,下面是根据调查结果绘制的观众日均收看该体育节目时间的频率分布直方图,将日均收看该体育节目时间不低于40分钟的观众称为“体育迷”.
(1)根据已知条件完成下面的2×2列联表,试根据小概率值α=0.1的独立性检验,分析“体育迷”是否与性别有关.
(2)将上述调查所得到的频率视为概率,现在从该地区大量电视观众中,采用随机抽样方法每次抽取1名观众,抽取3次,记被抽取的3名观众中的“体育迷”人数为X,若每次抽取的结果是相互独立的,求X的分布列、均值E(X)和方差D(X).
性别 是否为体育迷 合计
非体育迷 体育迷 男
女 10 55
合计
解:(1)由题中频率分布直方图可知,在抽取的100人中“体育迷”有(0.020+0.005)×10×100=25(人).由独立性检验的知识得2×2列联表如下:
性别 是否为体育迷 合计
非体育迷 体育迷 男 30 15 45
女 45 10 55
合计 75 25 100
零假设为H0:“体育迷”与性别无关.
将2×2列联表中的数据代入公式计算,
根据小概率值α=0.1的独立性检验,有充分证据推断H0不成立,即“体育迷”与性别有关,此推断犯错误的概率不超过0.1.
(2)由频率分布直方图知抽到“体育迷”的频率为(0.020+0.005)×10=0.25,
将频率视为概率,即从观众中抽取1名,此人为“体育迷”的概率为 .
X的分布列为
高考体验
考点一 线性回归分析
1.(2024·天津高考)下列图中,相关系数最大的是(  )
解析:观察4个选项可知,选项A中的散点分布比较集中,且基本接近某一条直线,线性回归模型拟合效果比较好,呈现明显的正相关.故选A.
答案:A
2.(2020·全国Ⅱ高考)某沙漠地区经过治理,生态系统得到很大改善,野生动物数量有所增加,为调查该地区某种野生动物的数量,将其分成面积相近的200个地块,从这些地块中用简单随机抽样的方法抽取20个作为样区,调查得到样本数据(xi,yi)(i=1,2,…,20),其中xi和yi分别表示第i个样区的植物覆盖面积(单位:公顷)和这种野生动物的数量,并计算得
(1)求该地区这种野生动物数量的估计值(这种野生动物数量的估计值等于样区这种野生动物数量的平均数乘以地块数);
(2)求样本(xi,yi)(i=1,2,…,20)的相关系数(精确到0.01);
(3)根据现有统计资料,各地块间植物覆盖面积差异很大.为提高样本的代表性以获得该地区这种野生动物数量更准确的估计,请给出一种你认为更合理的抽样方法.并说明理由.
(3)分层随机抽样:根据植物覆盖面积的大小对地块分层,再对200个地块进行分层抽样.
理由如下:由(2)知各样区的这种野生动物数量与植物覆盖面积有很强的正相关.由于各地块间植物覆盖面积差异很大,从而各地块间这种野生动物数量差异也很大,采用分层随机抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得该地区这种野生动物数量更准确的估计.
考点二 独立性检验
3.(2022·全国新高考Ⅰ)一医疗团队为研究某地的一种地方性疾病与当地居民的卫生习惯(卫生习惯分为良好和不够良好两类)的关系,在已患该疾病的病例中随机调查了100例(称为病例组),同时在未患该疾病的人群中随机调查了100人(称为对照组),得到如下数据:
小组 卫生习惯 不够良好 良好
病例组 40 60
对照组 10 90
(1)依据小概率值α=0.01的独立性检验,能否认为患该疾病群体与未患该疾病群体的卫生习惯有差异
(2)从该地的人群中任选一人,A表示事件“选到的人卫生习惯不够良好”,B表示事件“选到的人患有该疾病”, 的比值是卫生习惯不够良好对患该疾病风险程度的一项度量指标,记该指标为R.
②利用该调查数据,给出P(A|B),P(A| )的估计值,并利用①的结果给出R的估计值.
α 0.050 0.010 0.001
xα 3.841 6.635 10.828
解:(1)零假设为H0:患该疾病群体与未患该疾病群体的卫生习惯无差异.
由题意可知n=200,
根据小概率值α=0.01的独立性检验,有充分证据推断H0不成立,即认为患该疾病群体与未患该疾病群体的卫生习惯有差异.
4.(2021·全国Ⅱ高考)甲、乙两台机床生产同种产品,产品按质量分为一级品和二级品,为了比较两台机床产品的质量,分别用两台机床各生产了200件产品,产品的质量情况统计如下表:
机床 产品质量 合计
一级品 二级品 甲机床 150 50 200
乙机床 120 80 200
合计 270 130 400
(1)甲机床、乙机床生产的产品中一级品的频率分别是多少
(2)依据小概率值α=0.01的χ2独立性检验,能否认为甲机床的产品质量与乙机床的产品质量有差异
α 0.050 0.010 0.001
xα 3.841 6.635 10.828
5.(2024·上海高考)为了解某地初中学生日均体育锻炼时长与学业成绩的关系,从该地区29 000名学生中抽取580人,得到日均体育锻炼时长与学业成绩的数据如下表所示:
时长 [0,0.5) [0.5,1) [1,1.5) [1.5,2) [2,2.5)
优秀 5 44 42 3 1
不优秀 134 147 137 40 27
(1)该地区29 000名初中学生中日均体育锻炼时长不少于1小时的人数约为多少
(2)估计该地区初中学生的日均体育锻炼时长(精确到0.1).
(3)是否有95%的把握认为该地区初中学生学业成绩优秀与日均体育锻炼时长不少于1小时但少于2小时有关
附:χ2=,P(χ2≥3.841)≈0.05.
解:(1)580人中日均体育锻炼时长不少于1小时人数占比为.
该地区29 000名初中学生中日均体育锻炼时长不少于1小时的人数约为29 000×=12 500.
(2)该地区初中学生的日均体育锻炼时长约为×(5+134)+×(44+147)+×(42+137)+×(3+40)+×(1+27)]=≈0.9(小时).
(3)
时长 [1,2) 其他 总数
优秀 45 50 95
不优秀 177 308 485
①提出原假设:该地区初中学生学业成绩优秀与日均体育锻炼时长不少于1小时但少于2小时无关.
②确定显著性水平α=0.05,P(χ2≥3.841)≈0.05.
③χ2=≈3.976>3.841.
④否定原假设,即该地区初中学生学业成绩优秀与日均体育锻炼时长不少于1小时但少于2小时有关.

展开更多......

收起↑

资源预览