2022版新教材高考数学一轮复习第9章统计与统计案例学案含解析(4份打包)新人教B版

资源下载
  1. 二一教育资源

2022版新教材高考数学一轮复习第9章统计与统计案例学案含解析(4份打包)新人教B版

资源简介

第9章
统计与统计案例
课程标准
命题解读
1.理解随机抽样的必要性和重要性.2.会用简单随机抽样方法从总体中抽取样本;了解分层抽样的方法.3.了解分布的意义和作用,会列频率分布表,会画频率分布直方图、频率折线图、茎叶图,理解它们各自的特点.4.理解样本数据标准差的意义和作用,会计算数据标准差,并给出合理解释.5.会用样本的频率分布估计总体分布,会用样本的基本数字特征估计总体的基本数字特征,理解用样本估计总体的思想.6.会用随机抽样的基本方法和样本估计总体的思想解决一些简单的实际问题.7.会作两个有关联变量的数据的散点图,会利用散点图认识变量间的相关关系.8.了解最小二乘法的思想,能根据给出的线性回归方程系数公式建立线性回归方程.9.通过典型案例了解独立性检验(只要求2×2列联表)的思想、方法,并能初步应用独立性检验的思想、方法解决一些简单的实际问题.
考查形式:一般为一个选择题或填空题和一个解答题,或与概率交汇命题.考查内容:随机抽样及应用,众数、中位数、百分位数、平均数(期望)、方差与标准差的计算,用样本估计总体,统计图表,独立性检验、回归分析等.备考策略:(1)从核心素养的高度把握核心知识,掌握样本频率分布图表的识图和用图,会计算样本的数字特征,掌握独立性检验与回归分析的一般步骤.同时也要从对应的数学学科素养角度进行整体把握.(2)用思维导图理清知识之间的关系,将零散的知识合成一个系统,理解知识点之间的相互关系.(3)注重与概率知识的交互应用,不要把二者人为地割裂开来,总体把握二者的应用和联系.(4)解决相关问题注重通法通性,注重数学本质,强调基础性、综合性,淡化解题技巧,融入数学文化,实际生产生活的应用.核心素养:数据分析、数学运算.
第1节 随机抽样
一、教材概念·结论·性质重现
1.简单随机抽样
(1)定义:一般地,简单随机抽样(也称为纯随机抽样)就是从总体中不加任何分组、划类、排队等,完全随机地抽取个体.简单随机抽样是其他各种抽样方法的基础.
(2)适用条件:当总体中的个体之间差异程度较小和总体中个体数目较少时,通常采用这种方法.
(3)简单随机抽样的分类
2.分层抽样
一般地,如果相对于要考察的问题来说,总体可以分成有明显差别的、互不重叠的几部分时,每一部分可称为层,在各层中按层在总体中所占比例进行随机抽样的方法称为分层随机抽样(简称为分层抽样).
两种抽样方法的特点、联系及适用范围
类别
简单随机抽样
分层抽样
共同点
抽样过程中每个个体被抽到的可能性相等
各自特点
从总体中逐个抽取
将总体分成几层,分层进行抽取
联系
各层抽样时,采用简单随机抽样
适用范围
总体个数较少
总体由差异明显的几部分组成
二、基本技能·思想·活动体验
1.判断下列说法的正误,对的打“√”,错的打“×”.
(1)简单随机抽样的每个个体被抽到的机会不一样,与先后有关.(
×
)
(2)抽签法中,先抽的人抽中的可能性大.(
×
)
(3)分层随机抽样中,每个个体被抽到的可能性与层数及分层有关.(
×
)
2.我国古代数学专著《九章算术》中有一衰分问题:今有北乡八千一百人,西乡七千四百八十八人,南乡六千九百一十二人,凡三乡,发役三百人,则北乡遣(  )
A.104人
B.108人
C.112人
D.120人
B 解析:由题意可知,这是一个分层抽样的问题,其中北乡可抽取的人数为300×=300×=108.
3.在“世界读书日”前夕,为了了解某地5
000名居民某天的阅读时间,从中抽取了200名居民的阅读时间进行统计分析.在这个问题中,5
000名居民的阅读时间的全体是(  )
A.总体
B.个体
C.样本容量
D.从总体中抽取的一个样本
A 解析:由题目条件知,5
000名居民的阅读时间的全体是总体;其中每1名居民的阅读时间是个体;从5
000名居民某天的阅读时间中抽取的200名居民的阅读时间是从总体中抽取的一个样本,样本容量是200.
4.某公司有大量客户,且不同年龄段客户对其服务的评价有较大差异.为了了解客户的评价,该公司准备进行抽样调查,可供选择的抽样方法有简单随机抽样和分层抽样,则最合适的抽样方法是________.
分层抽样 解析:因为不同年龄段的客户对公司的服务评价有较大差异,所以需按年龄进行分层随机抽样,才能了解到不同年龄段的客户对公司服务的客观评价.
5.一个公司共有N名员工,下设一些部门,要采用等比例分层抽样的方法,从全体员工中抽取样本容量为n的样本.已知某部门有m名员工,那么从该部门抽取的员工人数是________.
 解析:每个个体被抽到的概率是,设这个部门抽取了x个员工,则=,故x=.
考点1 统计中的基本概念、数据获取——基础性
1.为了了解某省高考数学考试的情况,抽取2
000名考生的数学试卷进行分析,2
000叫做( C )
A.个体
B.样本
C.样本容量
D.总体
2.为了考查某班学生的身高情况,从中抽取20名学生进行身高测算,下列说法正确的是( D )
A.这个班级的学生是总体
B.抽测的20名学生是样本
C.抽测的20名学生的身高的全体就是总体
D.样本容量是20
要考查的对象的全体叫做总体,每一个考查对象叫做个体,抽取的考查对象的集体叫做样本.所有的个体构成了总体,样本取决于总体,样本是总体的一部分,没有个体就没有总体,样本的特征反映了总体的相应特征.
考点2 简单随机抽样及其应用——综合性
(1)下列抽取样本的方式属于简单随机抽样的个数为(  )
①从无限多个个体中抽取100个个体作为样本;
②从20件玩具中一次性抽取3件进行质量检验;
③某班有56名同学,指定个子最高的5名同学参加学校组织的篮球赛.
A.0
B.1
C.2
D.3
A 解析:①不是简单随机抽样,因为被抽取样本的总体的个数是无限的,而不是有限的;②不是简单随机抽样,因为这是“一次性”抽取,而不是“逐个”抽取;③不是简单随机抽样,因为不是等可能抽样.故选A.
(2)总体由编号为01,02,…,19,20的20个个体组成,利用下面的随机数表选取5个个体,选取方法是从随机数表第1行的第5列和第6列数字开始,由左到右依次选取两个数字,则选出来的第5个个体的编号为(  )
A.08
B.07
C.02
D.01
D 解析:从第1行第5列和第6列组成的数65开始,由左到右依次选出的数为08,02,14,07,01,所以第5个个体编号为01.
(1)简单随机抽样需满足:被抽取的样本总体的个体数有限;逐个抽取;等可能抽取.
(2)简单随机抽样一般有抽签法(适用于总体中个体数较少的情况)、随机数法(适用于个体数较多的情况).
假设要考查某公司生产的500克袋装牛奶的三聚氰胺是否超标,现从800袋牛奶中抽取60袋进行检验,利用随机数表抽取样本时,将800袋牛奶按000,001,…,799进行编号.若从随机数表第7行第8列的数开始向右读,则得到的第4个样本个体的编号是________(下面摘取了随机数表第7行至第9行).
068 解析:由随机数表知,前4个样本的个体编号分别是331,572,455,068.
考点3 分层抽样——综合性
考向1 求总体或样本容量
(1)某中学有高中生960人,初中生480人,为了了解学生的身体状况,采用分层抽样的方法,从该校学生中抽取容量为n的样本,其中高中生有24人,那么n等于(  )
A.12
B.18
C.24
D.36
D 解析:根据分层抽样方法知=,解得n=36.
(2)甲、乙两套设备生产的同类型产品共4
800件,采用分层抽样的方法从中抽取一个容量为80的样本进行质量检测.若样本中有50件产品由甲设备生产,则乙设备生产的产品总数为________件.
1
800 解析:由题设,抽样比为=.设甲设备生产的产品为x件,则=50,所以x=3
000.故乙设备生产的产品总数为4
800-3
000=1
800.
考向2 分层抽样的均值
某市的3个区共有高中学生20
000人,且3个区的高中学生人数之比为2∶3∶5.现要从所有学生中抽取一个容量为200的样本,调查该市高中学生的视力情况.
(1)试写出抽样过程;(2)若样本中3个区的高中学生的平均视力分别为4.8,4.8,4.6,试估计该市高中学生的平均视力.
解:(1)①由于该市高中学生的视力有差异,按3个区分成三层,用分层抽样法抽取样本.②确定每层抽取的个体数,在3个区分别抽取的学生人数之比也是2∶3∶5,所以抽取的学生人数分别是200×=40,200×=60,200×=100.③在各层分别按简单随机抽样法抽取样本.④综合每层抽样,组成容量为200的样本.
(2)样本中高中学生的平均视力为×4.8+×4.8+×4.6=4.7.
所以估计该市高中学生的平均视力约为4.7.
分层抽样均值的计算
如果总体分为两层,两层包含的个体数分别为M,N,两层抽取的样本量分别为m,n,两层的样本平均数分别为,,两层的总体平均数分别为,,总体平均数为,样本平均数为,那么=+,=+.
某校高二年级“化生史”组合只有2个班,且每班50人.在一次数学测试中,从两个班抽取了20名学生的数学成绩进行分析,统计得在该次测试中,两班中各抽取的20名学生的平均成绩分别为110分和106分,则该组合学生的平均成绩约为________分.
108 解析:样本中40名学生的平均分为×110+×106=108(分),所以估计该组合学生的平均分为108分.第2节 用样本估计总体
一、教材概念·结论·性质重现
1.最值、中位数、众数、平均数、百分位数、极差
(1)最值
一组数据的最值指的是其中的最大值与最小值,最值反映的是这组数最极端的情况.一般地,最大值用max表示,最小值用min表示.
(2)平均数
①定义:如果给定的一组数是x1,x2,…,xn,则这组数的平均数为=(x1+x2+…+xn).这一公式在数学中常简记为=i.
②如果x1,x2,…,xn的平均数为,且a,b为常数,则ax1+b,ax2+b,…,axn+b的平均数是a+b.
(3)中位数
①如果一组数有奇数个数,且按照从小到大排列后为x1,x2,…,x2n+1,则称xn+1为这组数的中位数;
②如果一组数有偶数个数,且按照从小到大排列后为x1,x2,…,x2n,则称为这组数的中位数.
(4)百分位数
①定义:一组数的p%(p∈(0,100))分位数指的是满足下列条件的一个数值:至少有p%的数据不大于该值,且至少有(100-p)%的数据不小于该值.
②计算方法:设一组数按照从小到大排列后为x1,x2,…,xn,计算i=np%的值,如果i不是整数,设i0为大于i的最小整数,取xi0为p%分位数;如果i是整数,取为p%分位数.
规定:0分位数是x1(即最小值),100%分位数是xn(即最大值).
(5)众数
一组数据中,某个数据出现的次数称为这个数据的频数,出现次数最多的数据称为这组数据的众数.
(6)极差
一组数的极差指的是这组数的最大值减去最小值所得的差.
2.方差与标准差
(1)如果x1,x2,…,xn的平均数为,则方差s2=(xi-)2,方差的算术平方根称为标准差.
(2)如果x1,x2,…,xn的方差为s2,且a,b为常数,则ax1+b,ax2+b,…,axn+b的方差是a2s2.
(1)若数据x1,x2,…,xn的平均数为,则mx1+a,mx2+a,mx3+a,…,mxn+a的平均数是m+a.
(2)若数据x1,x2,…,xn的方差为s2,则数据ax1+b,ax2+b,…,axn+b的方差为a2s2.
3.频率分布直方图
(1)频率分布表的画法.
第一步:求极差,决定组数和组距,组距=;
第二步:分组,通常对组内数值所在区间取左闭右开区间,最后一组取闭区间;
第三步:登记频数,计算频率,列出频率分布表.
(2)频率分布直方图:反映样本频率分布的直方图(如图).
横轴表示样本数据,纵轴表示,每个小矩形的面积表示样本落在该组内的频率.
4.频率分布折线图
频率分布折线图:用线段连接频率分布直方图中各个矩形上面一边的中点,就得到频率分布折线图.
频率分布直方图中的常见结论
(1)众数的估计值为最高矩形的中点对应的横坐标.
(2)平均数的估计值等于频率分布直方图中每个小矩形的面积乘小矩形底边中点的横坐标之和.
(3)中位数的估计值的左边和右边的小矩形的面积和是相等的.
二、基本技能·思想·活动体验
1.判断下列说法的正误,对的打“√”,错的打“×”.
(1)平均数、众数与中位数从不同的角度描述了一组数据的集中趋势.(

)
(2)一组数据的方差越大,说明这组数据越集中.(
×
)
(3)频率分布直方图中,小矩形的面积越大,表示样本数据落在该区间的频率越大.(

)
2.一个容量为32的样本,已知某组样本的频率为0.25,则该组样本的频数为(  )
A.4
B.8
C.12
D.16
B 解析:设频数为n,则=0.25,所以n=32×=8.
3.数据12,14,15,17,19,23,27,30的70%分位数是(  )
A.14
B.17
C.19
D.23
D 解析:因为8×70%=5.6,所以70%分位数是第六项数据23.
4.若某校高一年级8个班参加合唱比赛的得分分别为87,89,90,91,92,93,94,96,则这组数据的中位数和平均数分别是(  )
A.91.5和91.5
B.91.5和92
C.91和91.5
D.92和92
A 解析:因为这组数据为87,89,90,91,92,93,94,96,
所以中位数是=91.5,平均数==91.5.故选A.
5.已知样本容量为200,在样本的频率分布直方图中,共有n个小矩形.若中间一个小矩形的面积等于其余(n-1)个小矩形面积和的,则该组的频数为________.
50 解析:设除中间一个小矩形外的(n-1)个小矩形面积的和为p,则中间一个小矩形面积为p.由题意,得p+p=1,所以p=,则中间一个小矩形的面积为p=,200×=50,即该组的频数为50.
考点1 频率分布直方图——综合性
某市为了了解人们对“经济内循环”的认知程度,对不同年龄和不同职业的人举办了一次“经济内循环”知识竞赛,满分为100分(90分及以上为认知程度高).现从参赛者中抽取了x人,按年龄分成5组,第一组:[20,25),第二组:[25,30),第三组:[30,35),第四组:[35,40),第五组:[40,45],得到如图所示的频率分布直方图,已知第一组有6人.
(1)求x;
(2)求抽取的x人的年龄的中位数(结果保留整数);
(3)从该市大学生、军人、医务人员、工人、个体户五种人中用分层随机抽样的方法依次抽取6人,42人,36人,24人,12人,分别记为1~5组.从这5个按年龄分的组和5个按职业分的组中每组各选派1人参加知识竞赛,分别代表相应组的成绩,年龄组中1~5组的成绩分别为93,96,97,94,90,职业组中1~5组的成绩分别为93,98,94,95,90.
(ⅰ)分别求5个年龄组和5个职业组成绩的平均数和方差;
(ⅱ)以上述数据为依据,评价5个年龄组和5个职业组对“经济内循环”的认知程度,并谈谈你的感想.
解:(1)根据频率分布直方图,得第一组的频率为0.01×5=0.05,所以=0.05,所以x=120.
(2)设中位数为a,则0.01×5+0.07×5+(a-30)×0.06=0.5,解得a=≈32,则中位数为32.
(3)(ⅰ)5个年龄组成绩的平均数为1=×(93+96+97+94+90)=94,
方差为s=×[(-1)2+22+32+02+(-4)2]=6.
5个职业组成绩的平均数为2=×(93+98+94+95+90)=94,
方差为s=×[(-1)2+42+02+12+(-4)2]=6.8.
(ⅱ)从平均数来看两组的认知程度相同,从方差来看年龄组的认知程度更稳定(感想合理即可).
1.频率分布直方图的性质
(1)小长方形的面积=组距×=频率.
(2)各小长方形的面积之和等于1.
(3)小长方形的高=,所有小长方形的高的和为.
2.理解并记准频率分布直方图与众数、中位数、百分位数及平均数的关系.
1.(多选题)(2020·嘉祥县第一中学高三模拟)在某次高中学科知识竞赛中,对4
000名考生的参赛成绩进行统计,可得到如图所示的频率分布直方图,其中分组的区间为[40,50),[50,60),[60,70),[70,80),[80,90),[90,100),60分以下视为不及格.若同一组中数据用该组区间中间值作代表值,则下列说法中正确的是(  )
A.成绩在[70,80)的考生人数最多
B.不及格的考生人数为1
000
C.考生竞赛成绩的平均分约为70.5分
D.考生竞赛成绩的中位数为75分
ABC 解析:由频率分布直方图可得,成绩在[70,80)的频率最高,因此考生人数最多,故A正确;成绩在[40,60)的频率为0.01×10+0.015×10=0.25,因此,不及格的人数为4
000×0.25=1
000,故B正确;考生竞赛成绩的平均分约为45×0.1+55×0.15+65×0.2+75×0.3+85×0.15+95×0.1=70.5,故C正确;因为成绩在[40,70)的频率为0.45,在[70,80)的频率为0.3,所以中位数为70+10×≈71.67,故D错误.
2.(多选题)我国是世界第一产粮大国,我国粮食产量很高,按照14亿人口计算,中国人均粮食产量约为950斤,比全球人均粮食产量高了约250斤.如图是中国国家统计局网站中2010~2019年,我国粮食产量(千万吨)与年末总人口(千万人)的条形图,由此可知在2010~2019年中(  )
A.我国粮食年产量与年末总人口均逐年递增
B.2011年我国粮食年产量的年增长率最大
C.2015~2019年我国粮食年产量相对稳定
D.2015年我国人均粮食年产量达到了最高峰
BCD 解析:对于A,我国粮食年产量在2010年至2015年逐年递增,在2015年至2019年基本稳定在66千万吨以上,我国年末总人口均逐年递增,故A错误;对于B,由粮食产量条形图得2011年我国粮食产量的年增长率最大,故B正确;对于C,在2015年至2019年基本稳定在66千万吨以上,故C正确;对于D,2015年我国人均粮食年产量达到了最高峰,故D正确.故选BCD.
考点2 统计图表——综合性
(多选题)(2020·临沂一模)某同学在网上查询到近十年全国高考报名人数、录取人数和山东夏季高考报名人数的折线图,其中2019年的录取人数被遮挡了.他又查询到近十年全国高考录取率的散点图,结合图表中的信息判定下列说法正确的是(  )
A.全国高考报名人数逐年增加
B.2018年全国高考录取率最高
C.2019年高考录取人数约为820万
D.2019年山东高考报名人数在全国的占比最小
BCD 解析:2016年的人数少于2015年人数,A错误;2018年的录取率为81.1%,为最高,B正确;2019年高考录取人数为1
031×79.5%≈820,C正确;从2010~2019年山东高考报名人数在全国的占比分别为6.9%,6.3%,5.6%,5.5%,5.9%,7.4%,6.4%,6.2%,6.1%,5.4%,D正确.
统计图表问题的解决方法
(1)首先要准确地识图,即要明确统计图表中纵轴、横轴及折线、区域等所表示的意义,尤其注意数字变化的趋势等.
(2)其次要准确地用图,会根据统计图表中的数字计算样本的数字特征,会用统计图表估计总体.
1.(2020·鹤壁二模)中国铁路总公司相关负责人表示,到2018年底,全国铁路营业里程达到13.1万公里,其中高铁营业里程2.9万公里,超过世界高铁总里程的.下图是2014年到2018年铁路和高铁运营里程(单位:万公里)的折线图,以下结论不正确的是(  )
A.每相邻两年相比较,2014年到2015年铁路运营里程增加最显著
B.从2014年到2018年这5年,高铁运营里程与年份正相关
C.2018年高铁运营里程比2014年高铁运营里程增长80%以上
D.从2014年到2018年这5年,高铁运营里程数依次成等差数列
D 解析:选项A,B显然正确;对于C,>0.8,选项C正确;1.6,1.9,2.2,2.5,2.9不是等差数列,故D错误.故选D.
2.甲、乙、丙三家企业产品的成本分别为10
000,12
000,15
000,其成本构成如图所示,则关于这三家企业,下列说法错误的是(  )
A.成本最大的企业是丙企业
B.费用支出最高的企业是丙企业
C.支付工资最少的企业是乙企业
D.材料成本最高的企业是丙企业
C 解析:甲企业的成本为10
000;乙企业的成本为12
000;丙企业的成本为
15
000.故成本最大的是丙企业,故A正确.甲企业费用支出为10
000×5%=500;乙企业费用支出为12
000×17%=2
040;丙企业费用支出为15
000×15%=2
250.故费用支出最高的企业是丙企业,故B正确.甲企业支付工资为10
000×35%=3
500;乙企业支付工资为
12
000×30%=3
600;丙企业支付工资为
15
000×25%=3
750.故甲企业支付的工资最少,故C错误.甲企业材料成本为10
000×60%=6
000;乙企业材料成本为12
000×53%=6
360;丙企业材料成本为15
000×60%=9
000.故材料成本最高的企业是丙企业,故D正确.故选C.
考点3 样本的数字特征——综合性
(1)(2020·德州一模)某赛季甲、乙两名篮球运动员每场比赛得分用茎叶图表示,茎叶图中甲得分的部分数据丢失(如图),但甲得分的折线图完好,则下列结论正确的是(  )
A.甲得分的极差是11
B.乙得分的中位数是18.5
C.甲运动员得分有一半在区间[20,30]上
D.甲运动员得分的平均值比乙运动员得分的平均值高
D 解析:甲得分的极差是28-9=19,A错误;乙得分的中位数是=16.5,B错误;甲运动员得分在区间[20,30]上有3个,C错误;甲运动员得分的平均值为=17,乙运动员得分的平均值为=16,故D正确.
(2)抽样统计甲、乙两位射击运动员的5次训练成绩(单位:环),结果如下:
运动员
第1次
第2次
第3次
第4次
第5次

87
91
90
89
93

89
90
91
88
92
则成绩较为稳定(方差较小)的那位运动员成绩的方差为________.
2 解析:甲=×(87+91+90+89+93)=90,乙=×(89+90+91+88+92)=90,
s甲=×[(87-90)2+(91-90)2+(90-90)2+(89-90)2+(93-90)2]=4,
s乙=×[(89-90)2+(90-90)2+(91-90)2+(88-90)2+(92-90)2]=2.
因为4>2,
所以乙的成绩较为稳定,其方差为2.
1.平均数反映了数据取值的平均水平,而方差、标准差描述了一组数据围绕平均数波动的大小,标准差、方差越大,数据离散程度越大,越不稳定;标准差、方差越小,数据的离散程度越小,越稳定.
2.用样本估计总体,就是利用样本的数字特征来描述总体的数字特征.
1.已知某7个数的平均数为4,方差为2.现加入一个新数据4,此时这8个数的平均数为,方差为s2,则(  )
A.=4,s2<2
B.=4,s2>2
C.>4,s2<2
D.>4,s2>2
A 解析:因为某7个数的平均数为4,所以这7个数的和为4×7=28.因为加入一个新数据4,所以==4.又因为这7个数的方差为2,且加入一个新数据4,所以这8个数的方差s2==<2.故选A.
2.已知甲、乙两组数据:
甲组:27,28,39,40,m,50;
乙组:24,n,34,43,48,52.
若这两组数据的30%分位数、80%分位数分别相等,则等于(  )
A.
B.
C.
D.
A 解析:因为30%×6=1.8,80%×6=4.8,所以30%分位数为n=28,80%分位数为m=48,所以==.第3节 统计模型
一、教材概念·结论·性质重视
1.线性相关
(1)散点图
一般地,如果收集到了变量x和变量y的n对数据(简称为成对数据),如下表所示.
序号i
1
2
3

n
变量x
x1
x2
x3

xn
变量y
y1
y2
y3

yn
则在平面直角坐标系xOy中描出点(xi,yi),i=1,2,3,…,n,就可以得到这n对数据的散点图.
(2)线性相关
如果由变量的成对数据、散点图或直观经验可知,变量x与变量y之间的关系可以近似地用一次函数来刻画,则称x与y线性相关.
(3)正相关和负相关
已知x与y线性相关,如果一个变量增大,另一个变量大体上也增大,则称这两个变量正相关;如果一个变量增大,另一个变量大体上减少,则称这两个变量负相关.
相关关系与函数关系的区别与联系
(1)相同点:两者均是指两个变量的关系.
(2)不同点:①函数关系是一种确定的关系,相关关系是一种非确定的关系.
②函数关系是一种因果关系,而相关关系不一定是因果关系,也可能是伴随关系.
2.回归直线方程
(1)一般地,已知变量x与y的n对成对数据(xi,yi),i=1,2,3,…,n.任意给定一个一次函数y=bx+a,对每一个已知的xi,由直线方程可以得到一个估计值i=bxi+a,如果一次函数=x+能使残差平方即和(y1-1)2+(y2-2)2+…+(yn-n)2=
(yi-i)2取得最小值,则=x+称为y关于x的回归直线方程(对应的直线称为回归直线).因为是使得平方和最小,所以其中涉及的方法称为最小二乘法.
其中,回归系数==,=-.
=(x1+x2+…+xn)=i;
=(y1+y2+…+yn)=i.
3.回归直线方程:=x+的性质
(1)回归直线一定过点(,).
(2)回归系数的实际意义:
①是回归方程的斜率;
②当x增大一个单位时,增大个单位.
(1)回归直线方程不一定都有实际意义.回归分析是对具有相关关系的两个变量进行统计分析的方法,只有在散点图大致呈线性时,求出的回归直线方程才有实际意义.
(2)根据回归直线方程进行预报,得到的仅是一个估计值,而不一定是真实发生的值.
(3)回归直线一定过样本点的中心.
4.相关系数
(1)定义:统计学里一般用
r=

来衡量y与x的线性相关性强弱,这里的r称为线性相关系数(简称为相关系数).
(2)性质
①|r|≤1,且y与x正相关的充要条件是r>0,y与x负相关的充要条件是r<0;
②|r|越小,说明两个变量之间的线性相关性越弱,也就是得出的回归直线方程越没有价值,即方程越不能反映真实的情况;|r|越大,说明两个变量之间的线性相关性越强,也就是得出的回归直线方程越有价值;
③|r|=1的充要条件是成对数据构成的点都在回归直线上.
5.非线性回归方程
如果具有相关关系的两个变量x,y不是线性相关关系,那么称为非线性相关关系,所得到的方程称为非线性回归方程(也简称为回归方程).
6.2×2列联表
(1)定义:如果随机事件A与B的样本数据整理成如下的表格形式.
A
总计
B
a
b
a+b
c
d
c+d
总计
a+c
b+d
a+b+c+d
因为这个表格中,核心的数据是中间的4个格子,所以这样的表格通常称为2×2列联表.
(2)χ2计算公式:χ2=,其中n=a+b+c+d.
根据χ2的值可以判断两个分类变量有关的可信程度.若χ2的值越大,则两个分类变量有关系的把握越大.
7.独立性检验
任意给定一个α(称为显著性水平,通常取为0.05,0.01等),可以找到满足条件P(χ2≥k)=α的数k(称为显著性水平α对应的分位数).若χ2≥k成立,就称在犯错误的概率不超过α的前提下,可以认为A与B不独立(也称为A与B有关);或说有1-α的把握认为A与B有关.若χ2<k成立,就称不能得到前述结论.这一过程通常称为独立性检验.
二、基本技能·思想·活动体验
1.判断下列说法的正误,对的打“√”,错的打“×”.
(1)“名师出高徒”可以解释为教师的教学水平与学生的水平成正相关关系.(

)
(2)通过回归直线方程=x+可以估计预报变量的取值和变化趋势.(

)
(3)回归直线方程=x+中,若<0,则变量x和y负相关.(
×
)
(4)因为由任何一组观测值都可以求得一个回归直线方程,所以没有必要进行相关性检验.(
×
)
2.根据如下样本数据得到的回归直线方程为=x+,则(  )
x
3
4
5
6
7
8
y
4.0
2.5
-0.5
0.5
-2.0
-3.0
A.>0,>0
B.>0,<0
C.<0,>0
D.<0,<0
B 解析:画出散点图,知>0,<0.
3.甲、乙、丙、丁四位同学在建立变量x,y的回归模型时,分别选择了4种不同模型,计算可得它们的相关系数r分别如下表:




r
0.98
0.78
0.50
0.85
建立的回归模型拟合效果最好的是________.
A 解析:r越大,表示回归模型的拟合效果越好.
4.高二第二学期期中考试,按照甲、乙两个班学生的数学成绩优秀和及格统计人数后,得到如下列联表:
优秀
及格
总计
甲班
11
34
45
乙班
8
37
45
总计
19
71
90
则χ2的值约为________.
A 解析:根据列联表中的数据,可得
χ2=≈0.600.故选A.
5.若变量y与x的非线性回归方程是=2-1,则当的值为2时,x的估计值为________.
 解析:由2-1=2,得x=,即x的估计值为.
考点1 相关关系的判断——基础性
1.
(多选题)下列变量之间的关系是相关关系的是(  )
A.二次函数y=ax2+bx+c中,a,c是已知常数,取b为自变量,因变量是判别式Δ=b2-4ac
B.光照时间和果树亩产量
C.降雪量和交通事故发生率
D.每亩田施肥量和粮食亩产量
BCD 解析:在A中,若b确定,则a,b,c都是常数,Δ=b2-4ac也就唯一确定了,因此,这两者之间是确定性的函数关系;一般来说,光照时间越长,果树亩产量越高;降雪量越大,交通事故发生率越高;施肥量越多,粮食亩产量越高,所以B,C,D是相关关系.
2.以下是在某地搜集到的不同楼盘房屋的销售价格y(单位:万元)和房屋面积x(单位:m2)的数据:
房屋面积x/m2
115
110
80
135
105
销售价格y/万元
49.6
43.2
38.8
58.4
44
(1)画出数据对应的散点图.
(2)判断房屋的销售价格和房屋面积之间是否具有相关关系.如果有相关关系,是正相关还是负相关?
解:(1)数据对应的散点图如图所示.
(2)通过以上数据对应的散点图可以判断,房屋的销售价格和房屋面积之间具有相关关系,并且是正相关.
两个变量是否相关的两种判断方法
(1)根据实际经验,借助积累的经验进行分析判断.
(2)通过散点图,观察它们的分布是否存在一定的规律,直观地进行判断.
考点2 一元线性回归模型及其应用——应用性
考向1 线性回归分析
假设关于某种设备的使用年限x(单位:年)与所支出的维修费用y(单位:万元)有如下统计资料:
x
2
3
4
5
6
y
2.2
3.8
5.5
6.5
7.0
已知=90,≈140.8,iyi=112.3,≈8.9,≈1.4.
(1)计算y与x之间的相关系数(精确到0.001),并求出回归直线方程;
(2)根据回归直线方程,预测假设使用年限为10年时,维修费用约是多少万元?
解:(1)因为==4,
==5.
iyi-5 =112.3-5×4×5=12.3,
-52=90-5×42=10,
-52=140.8-125=15.8,
所以r===≈≈0.987.
又===1.23,
=-=5-1.23×4=0.08.
所以回归直线方程为=1.23x+0.08.
(2)当x=10时,=1.23×10+0.08=12.38(万元),
即假设使用10年时,维修费用约为
12.38万元.
考向2 相关系数
根据统计,某蔬菜基地西红柿亩产量的增加量y(单位:百千克)与某种液体肥料每亩使用量x(单位:千克)之间的对应数据的散点图如图所示.
(1)依据数据的散点图可以看出,可用线性回归模型拟合y与x的关系,请计算相关系数r并加以说明(若|r|>0.75,则线性相关程度很高,可用线性回归模型拟合);
(2)求y关于x的回归方程,并预测液体肥料每亩使用量为12千克时,西红柿亩产量的增加量y约为多少?
附:相关系数公式r==,参考数据:≈0.55,≈0.95.
回归直线方程=x+中斜率和截距的最小二乘估计公式分别为:==,=-.
解:(1)由已知数据可得==5,
==4.
所以(xi-)(yi-)=(-3)×(-1)+(-1)×0+0×0+1×0+3×1=6,

=2,

=,
所以相关系数
r=
==≈0.95.
因为r>0.75,所以可用线性回归模型拟合y与x的关系.
(2)===0.3.
那么=4-5×0.3=2.5.
所以回归直线方程为=0.3x+2.5.
当x=12时,=0.3×12+2.5=6.1,
即当液体肥料每亩使用量为12千克时,西红柿亩产量的增加量约为6.1百千克.
考向3 非线性回归分析
(2020·南平质检)千百年来,人们一直在通过不同的方式传递信息.在古代,烽火狼烟、飞鸽传书、快马驿站等通信方式被人们广泛传知;第二次工业革命后,科技的进步带动了电讯事业的发展,电报、电话的发明让通信领域发生了翻天覆地的变化;之后,计算机和互联网的出现则使得“千里眼”“顺风耳”变为现实……此时此刻,5G的到来即将给人们的生活带来颠覆性的变革.“5G领先”一方面是源于我国顶层设计的宏观布局,另一方面则来自政府高度重视、企业积极抢滩、企业层面的科技创新能力和先发优势.某科技创新公司基于领先技术的支持,丰富的移动互联网应用等明显优势,随着技术的不断完善,该公司的5G经济收入在短期内逐月攀升.业内预测,该创新公司在第1个月至第7个月的5G经济收入y(单位:百万元)关于月份x的数据如下表:
时间(月份)
1
2
3
4
5
6
7
收入(百万元)
6
11
21
34
66
101
196
根据以上数据绘制如下散点图.
(1)为了更充分运用大数据、人工智能、5G等技术,公司需要派出员工实地检测产品性能和使用状况.公司领导要从报名的五名科技人员A,B,C,D,E中随机抽取3个人前往,则A,B同时被抽到的概率为多少?
(2)根据散点图判断,y=ax+b与y=c·dx(a,b,c,d均为大于零的常数)哪一个适宜作为5G经济收入y关于月份x的回归方程类型?(给出判断即可,不必说明理由)根据你的判断结果及表中的数据,求出y关于x的回归方程.
(3)请你预测该公司8月份的5G经济收入.
参考数据:
yi
lg
yi
xiyi
xivi
100.45
100.54
43.5
10.78
2
535
50.12
2.82
3.47
v=lg
y,vi=lg
yi.
参考公式:对于一组具有线性相关关系的数据(xi,vi)(i=1,2,3,…,n),其回归直线=x+的斜率和截距的最小二乘估计公式分别为=,
=-.
解:(1)从报名的科技人员A,B,C,D,E中随机抽取3个人,则所有的情况为{A,B,C},{A,B,D},{A,B,E},{A,C,D},{A,C,E},{A,D,E},{B,C,D},{B,C,E},{B,D,E},{C,D,E},共10种.记“A,B同时被抽到”为事件Q,则事件Q包含的样本点为{A,B,C},{A,B,D},{A,B,E},共3个,故P(Q)=.
(2)根据散点图判断,y=c·dx适宜作为5G经济收入y关于月份x的回归方程类型.由y=c·dx两边同时取常用对数得lg
y=lg(c·dx)=lg
c+xlg
d.
设lg
y=v,所以v=lg
c+xlg
d.
因为=×(1+2+3+4+5+6+7)=4,
所以=vi=lg
yi=×10.78=1.54,x=12+22+32+42+52+62+72=140,
所以lg

===0.25.
把样本中心(4,1.54)的坐标代入=lg
+lg
·x,得1.54=lg
+0.25×4,
所以lg
=0.54,所以=0.54+0.25x,
所以lg
=0.54+0.25x,
所以y关于x的回归方程为=100.54+0.25x=3.47×100.25x.
(3)当x=8时,=100.54+0.25x=3.47×100.25×8=347,
所以预测8月份的5G经济收入为347百万元.
非线性回归分析的步骤
非线性回归问题有时并不给出回归公式.这时我们可以画出已知数据的散点图,把它与学过的各种函数(幂函数、指数函数、对数函数等)图像作比较,挑选一种跟这些散点拟合得最好的函数,然后采用适当的变量变换,把问题化为线性回归分析问题,使之得到解决.其一般步骤如下:
(2020·广州一模)某种昆虫的日产卵数和时间变化有关,现收集了该昆虫第1天到第5天的日产卵数据:
第x天
1
2
3
4
5
日产卵数y(个)
6
12
25
49
95
对数据初步处理后得到了如图所示的散点图和表中的统计量的值.
xi
x
(ln
yi)
(xi·ln
yi)
15
55
15.94
54.75
(1)根据散点图,利用计算机模拟出该种昆虫日产卵数y关于x的回归方程为y=ea+bx(其中e为自然对数的底数),求实数a,b的值(精确到0.1).
(2)根据某项指标测定,若日产卵数在区间(e6,e8)上的时段为优质产卵期.利用(1)的结论,估计在第6天到第10天中任取2天,其中恰有1天为优质产卵期的概率.
附:对于一组数据(v1,μ1),(v2,μ2),…,(vn,μn),其回归直线的斜率和截距的最小二乘估计公式分别为=,=-·.
解:(1)因为y=ea+bx,两边取自然对数,得ln
y=a+bx.
令m=x,n=ln
y,得n=a+bm.
因为===0.693,
所以b≈0.7.
因为=-=-0.7×3=1.088,
所以a≈1.1,即a≈1.1,b≈0.7.
(2)根据(1)得y=e1.1+0.7x.
由e6<e1.1+0.7x<e8,得7<x<.
所以在第6天到第10天中,第8,9天为优质产卵期.
从未来第6天到第10天中任取2天的所有可能事件有(6,7),(6,8),(6,9),(6,10),(7,8),(7,9),(7,10),(8,9),(8,10),(9,10),共10种.
其中恰有1天为优质产卵期的有(6,8),(6,9),(7,8),(7,9),(8,10),(9,10),共6种.
设从未来第6天到第10天中任取2天,其中恰有1天为优质产卵期的事件为A,
则P(A)==.
所以从未来第6天到第10天中任取2天,其中恰有1天为优质产卵期的概率为.
在进行线性回归分析时,要按线性回归分析步骤进行.在求r时,通常采用分步计算的方法,r越大,相关性越强.
考点3 列联表与独立性检验——综合性
某省进行高中新课程改革已经四年了,为了了解教师对新课程教学模式的使用情况,某一教育机构对某学校的教师关于新课程教学模式的使用情况进行了问卷调查.共调查了50人,其中有老教师20人,青年教师30人.老教师对新课程教学模式赞同的有10人,不赞同的有10人;青年教师对新课程教学模式赞同的有24人,不赞同的有6人.
(1)根据以上数据建立一个2×2列联表;
(2)能否在犯错误的概率不超过0.01的前提下认为对新课程教学模式的赞同情况与教师年龄有关系?
解:
(1)2×2列联表如下所示.
赞同
不赞同
总计
老教师
10
10
20
青年教师
24
6
30
总计
34
16
50
(2)由公式得χ2=≈4.963<6.635,所以在犯错误的概率不超过0.1的前提下认为对新课程教学模式的赞同情况与教师年龄没有关系.
(1)利用χ2=求出χ2的值.再利用显著性水平来判断有多大的把握判断两个事件有关.
(2)解题时应注意准确计算,不可错用公式,准确进行比较与判断.
(2020·新高考全国卷Ⅰ)为加强环境保护,治理空气污染,环境监测部门对某市空气质量进行调研,随机抽查了100天空气中的PM2.5和SO2浓度(单位:μg/m3),得下表
  SO2PM2.5   
[0,50]
(50,150]
(150,475]
[0,35]
32
18
4
(35,75]
6
8
12
(75,115]
3
7
10
(1)估计事件“该市一天空气中PM2.5浓度不超过75,且SO2浓度不超过150”的概率;
(2)根据所给数据,完成下面的2×2列联表:
  SO2PM2.5   
[0,150]
(150,475]
[0,75]
(75,115]
(3)根据(2)中的列联表,判断是否有99%的把握认为该市一天空气中PM2.5浓度与SO2浓度有关?
解:(1)根据抽查数据,该市100天的空气中PM2.5浓度不超过75,且SO2浓度不超过150的天数为32+18+6+8=64,因此,该市一天空气中PM2.5浓度不超过75,且SO2浓度不超过150的概率p==0.64.
(2)根据抽查数据,可得2×2列联表如下:
  SO2PM2.5   
[0,150]
(150,475]
[0,75]
64
16
(75,115]
10
10
(3)根据(2)的列联表得
χ2=≈7.484.
因为7.484>6.635,故有99%的把握认为该市一天空气中PM2.5浓度与SO2浓度有关.第9章
统计与统计案例
九 多选题命题热点之统计
统计中的多选题主要考查统计图表的识图和用图、样本的数字特征的计算以及用样本估计总体的方法与应用等,综合性一般较强.解答统计类的多选题,要熟练掌握统计图表的相关知识方法、样本的集中趋势与离散程度的估计方法.
 统计图表及应用
(多选题)(2020·德州一模)某市教体局对全市高三年级的学生身高进行抽样调查,随机抽取了100名学生,他们的身高都处在A,B,C,D,E五个层次内,根据抽样结果得到统计图表,则下面叙述正确的是(  )
A.样本中女生人数多于男生人数
B.样本中B层人数最多
C.样本中E层男生人数为6
D.样本中D层男生人数多于女生人数
ABC 解析:样本中女生人数为9+24+15+9+3=60,男生人数为100-60=40,A正确.样本中A层人数为9+40×10%=13;样本中B层人数为24+40×30%=36;样本中C层人数为15+40×25%=25;样本中D层人数为9+40×20%=17;样本中E层人数为3+40×15%=9,B正确.样本中E层次男生人数为40×15%=6,C正确.样本中D层次男生人数为40×20%=8,女生人数为9,女生人数多于男生人数,D错误.
(1)经常考查的统计图表有条形图、折线图、扇形图、频率分布直方图等,试题一般以生产生活的具体实例或时事热点为背景,考查数据处理的能力.
(2)解决此类问题要准确地识图,清楚图中横轴与纵轴所表示的量,图中折线的变化趋势及对应的意义,提取关键信息,对照选项作答.
(多选题)(2020·衡水模拟)如图是国家统计局发布的2018年3月到2019年3月全国居民消费价格的涨跌幅情况折线图(注:2019年2月与2018年2月相比较称同比,2019年2月与2019年1月相比较称环比).根据该折线图,下列结论正确的是(  )
A.2018年3月至2019年3月全国居民消费价格同比均上涨
B.2018年3月至2019年3月全国居民消费价格环比有涨有跌
C.2019年3月全国居民消费价格同比涨幅最大
D.2019年3月全国居民消费价格环比变化最快
ABD 解析:对于选项A,从图中可以看出同比涨跌幅均为正数,故A正确;对于选项B,从图中可以看出环比涨跌幅有正数有负数,故B正确;对于选项C,从图中可以看出同比涨幅最大的是2018年9月份和2018年10月份,故C错误;对于选项D,从图中可以看出2019年3月份全国居民消费价格环比变化最快,故D正确.故选ABD.
 总体的集中趋势和离散程度的估计
(多选题)甲、乙两班举行电脑汉字录入比赛,参赛学生每分钟录入汉字的个数经统计计算后填入下表.某同学根据表中数据分析得出的结论正确的是(  )
班级
参加人数
中位数
方差
平均数

55
149
191
135

55
151
110
135
A.甲、乙两班学生成绩的平均数相同
B.甲班的成绩波动比乙班的成绩波动小
C.乙班优秀的人数多于甲班优秀的人数(每分钟输入汉字数≥150为优秀)
D.甲班成绩的众数小于乙班成绩的众数
AC 解析:甲、乙两班学生成绩的平均数都是135,故两班成绩的平均数相同,A正确;s甲=191>110=s,甲班成绩不如乙班稳定,即甲班的成绩波动较大,B不正确;甲、乙两班人数相同,但甲班的中位数为149,乙班的中位数为151,从而易知乙班每分钟录入汉字不少于150个的人数要多于甲班,C正确;由题表看不出两班学生成绩的众数,D错误.故选AC.
估计总体的集中趋势和离散程度的解题步骤
(1)从统计图表中提取信息,得到相关数据.
(2)依据相关公式计算样本的数字特征.
(3)根据数字特征或统计图表估计总体的分布.
1.(多选题)某校高三年级共有800名学生参加了数学测验(满分150分).已知这800名学生的数学成绩均不低于90分,将这800名学生的数学成绩分组如下:[90,100),[100,110),[110,120),[120,130),[130,140),[140,150],得到的频率分布直方图如图所示,则下列说法中正确的是
(  )
A.a=0.045
B.这800名学生中数学成绩在110分以下的人数为160
C.这800名学生数学成绩的中位数约为120.14
D.这800名学生数学成绩的平均数为125
BC 解析:由频率分布直方图可知(0.010×2+0.025+a+0.015+0.005)×10=1,解得a=0.035,故A不正确;这800名学生中数学成绩在110分以下的人数为800×(0.010+0.010)×10=160,故B正确;设这800名学生数学成绩的中位数为x,则0.010×10+0.010×10+0.025×10+(x-120)×0.035×10=0.5,解得x≈120.14,故C正确;对于D,这800名学生数学成绩的平均数为95×0.010×10+105×0.010×10+115×0.025×10+125×0.035×10+135×0.015×10+145×0.005×10=120,故D不正确.故选BC.
2.(多选题)(2020·厦门一模)PM2.5是衡量空气质量的重要指标.下图是某地9月1日到10日的PM2.5日均值(单位:μg/m3)的折线图,则下列说法正确的是(  )
A.这10天中PM2.5日均值的众数为33
B.这10天中PM2.5日均值的中位数是32
C.这10天中PM2.5日均值的中位数大于平均数
D.这10天中PM2.5日均值前4天的方差小于后4天的方差
AB 解析:由折线图得,这10天中PM2.5日均值的众数为33,故A正确;中位数为=32,故B正确;平均数为×(36+26+17+23+33+128+42+31+30+33)=39.9,中位数小于平均数,故C错误;前4天的数据波动比后4天的波动大,故前4天的方差大于后4天的方差,故D错误.故选AB.

展开更多......

收起↑

资源列表