2021届高考数学一轮复习第十章统计与统计案例学案理(word解析版3份打包)

资源下载
  1. 二一教育资源

2021届高考数学一轮复习第十章统计与统计案例学案理(word解析版3份打包)

资源简介

第一节 随机抽样
[最新考纲]
[考情分析]
[核心素养]
1.理解随机抽样的必要性和重要性.2.会用简单随机抽样方法从总体中抽取样本,了解分层抽样和系统抽样.
  简单随机抽样、系统抽样、分层抽样的相关概念,是2021年高考考查的热点,题型仍将是以选择题与填空题为主,分值为5分.
1.数学运算2.数据分析
‖知识梳理‖
1.简单随机抽样
(1)抽取方式:逐个不放回地抽取;
(2)特点:每个个体被抽到的概率相等;
(3)常用方法:抽签法和随机数法.
2.分层抽样
(1)在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,作为样本,这种抽样方法叫做分层抽样.
(2)分层抽样的应用范围
当总体是由差异明显的几个部分组成时,往往选用分层抽样.
3.系统抽样的步骤
假设要从容量为N的总体中抽取容量为n的样本.
(1)先将总体的N个个体编号.
(2)确定分段间隔k,对编号进行分段,当(n是样本容量)是整数时,取k=.
(3)在第1段用简单随机抽样确定第一个个体编号l(l≤k).
(4)按照一定的规则抽取样本.通常是将l加上间隔k得到第2个个体编号l+k,再加k得到第3个个体编号l+2k,依次进行下去,直到获取整个样本.
‖基础自测‖
一、疑误辨析
1.判断下列结论是否正确(请在括号中打“√”或“×”).
(1)在简单随机抽样中,某一个个体被抽到的可能性与第几次抽取有关,第一次被抽到的可能性最大.(  )
(2)从100件玩具中随机拿出一件,放回后再拿出一件,连续拿5次,是简单随机抽样.(  )
(3)系统抽样适用于元素个数很多且均衡的总体.(  )
(4)要从1
002个学生中用系统抽样的方法选取一个容量为20的样本,需要剔除2个学生,这样对被剔除者不公平.(  )
(5)分层抽样中,每个个体被抽到的可能性与层数及分层有关.(  )
(6)某校即将召开学生代表大会,现从高一、高二、高三共抽取60名代表,则可用分层抽样的方法抽取.(  )
答案:(1)× (2)× (3)√ (4)× (5)× (6)√
二、走进教材
2.(必修3P100A1改编)在“世界读书日”前夕,为了了解某地5
000名居民某天的阅读时间,从中抽取了200名居民的阅读时间进行统计分析.在这个问题中,5
000名居民的阅读时间的全体是(  )
A.总体
B.个体
C.样本的容量
D.从总体中抽取的一个样本
答案:A
3.(必修3P100A2(2)改编)一个公司共有N名员工,下设一些部门,要采用等比例分层抽样的方法从全体员工中抽取样本容量为n的样本,已知某部门有m名员工,那么从该部门抽取的员工人数是________.
答案:
三、易错自纠
4.从2
017名学生中选取50名学生参加全国数学联赛,若采用以下方法选取:先用简单随机抽样法从2
017名学生中剔除17名学生,剩下的2
000名学生再按系统抽样的方法抽取,则每名学生入选的概率(  )
A.不全相等  
B.均不相等
C.都相等,且为
D.都相等,且为
解析:选C 若从N个个体中抽取M个个体,则每个个体被抽到的概率都等于.
5.从300名学生(其中男生180人,女生120人)中按性别用分层抽样的方法抽取50人参加比赛,则应该抽取男生人数为(  )
A.27
B.30
C.33
D.36
解析:选B 因为男生与女生的比例为180∶120=3∶2,所以应该抽取男生人数为50×=30.
|题组突破|
1.某班级有男生20人,女生30人,从中抽取10人作为样本,其中一次抽样结果是:抽到了4名男生、6名女生,则下列命题正确的是(  )
A.这次抽样可能采用的是简单随机抽样
B.这次抽样一定没有采用系统抽样
C.这次抽样中每个女生被抽到的概率大于每个男生被抽到的概率
D.这次抽样中每个女生被抽到的概率小于每个男生被抽到的概率
解析:选A 这次抽样可能采用的是简单随机抽样,A正确;这次抽样可能采用系统抽样,男生编号为1~20,女生编号为21~50,间隔为5,依次抽取1号,6号,…,46号便可,B错误;这次抽样中每个女生被抽到的概率等于每个男生被抽到的概率,C、D均错误.故选A.
2.(2019届上饶模拟)已知总体由编号为00,01,02,…,48,49的50个个体组成,利用下面的随机数表选取8个个体,选取方法是从随机数表第6行的第9列和第10列数字开始由左向右依次选取两个数字,则选出来的第8个个体的编号为(  )
附:第6行至第9行的随机数表:
16
22
77
94
39 49
54
43
54
82 17
37
93
23
78 87
35
20
96
43 84
26
34
91
64
84
42
17
53
31 57
24
55
06
88 77
04
74
47
67 21
76
33
50
25 83
92
12
06
76
63
01
63
78
59 16
95
55
67
19 98
10
50
71
75 12
86
73
58
07 44
39
52
38
79
33
21
12
34
29 78
64
56
07
82 52
42
07
44
38 15
51
00
13
42 99
66
02
79
54
A.17
B.20
C.23
D.37
解析:选B 从随机数表第6行的第9列和第10列数字开始由左到右依次选取两个数字,符合条件的依次为39,49,43,17,37,23,35,20,故第8个数为20.
3.对一个容量为N的总体抽取容量为n的样本,当选取简单随机抽样、系统抽样和分层抽样三种不同方法抽取样本时,总体中每个个体被抽中的概率分别为p1,p2,p3,则(  )
A.p1=p2B.p2=p3C.p1=p3D.p1=p2=p3
解析:选D 由于三种抽样过程中,每个个体被抽到的概率都是相等的,因此p1=p2=p3.
?名师点津
一个抽样试验用抽签法的2个注意事项
一是抽签是否方便;二是号签是否易搅匀.一般地,当总体容量和样本容量都较小时可用抽签法.
|题组突破|
4.(2019届江西八校联考)从编号为001,002,…,500的500个产品中用系统抽样的方法抽取一个样本,已知样本中编号最小的两个编号分别为007,032,则样本中最大的编号应该为(  )
A.480
B.481
C.482
D.483
解析:选C 根据系统抽样的定义可知,样本的编号成等差数列,令a1=7,a2=32,则d=25,所以an=7+25(n-1)≤500,所以n≤20,所以最大编号为7+25×19=482.
5.采用系统抽样方法从1
000人中抽取50人做问卷调查,将他们随机编号1,2,…,1
000.适当分组后在第一组采用简单随机抽样的方法抽到的号码为8.若抽到的50人中,编号落入区间[1,400]的人做问卷A,编号落入区间[401,750]的人做问卷B,其余的人做问卷C,则抽到的人中,做问卷C的人数为(  )
A.12
B.13
C.14
D.15
解析:选A 根据系统抽样的特点可知,所有做问卷调查的人的编号构成首项为8,公差d==20的等差数列{an},∴通项公式an=8+20(n-1)=20n-12.令751≤20n-12≤1
000,解得≤n≤.又∵n∈N
,∴39≤n≤50,∴做问卷C的共有12人.
6.(2019年全国卷Ⅰ)某学校为了解1
000名新生的身体素质,将这些学生编号为1,2,…,1
000,从这些新生中用系统抽样方法等距抽取100名学生进行体质测验.若46号学生被抽到,则下面4名学生中被抽到的是(  )
A.8号学生
B.200号学生
C.616号学生
D.815号学生
解析:选C 由系统抽样可知,第一组学生的编号为1~10,第二组学生的编号为11~20,…,最后一组学生的编号为991~1
000.设第一组取到的学生编号为x,则第二组取到的学生编号为x+10,以此类推,所取的学生编号为10的倍数加x.因为46号学生被抽到,所以x=6,所以616号学生被抽到,故选C.
?名师点津
解决系统抽样问题的2个关键步骤
(1)分组的方法应依据抽取比例而定,即根据定义每组抽取一个样本.
(2)起始编号的确定应用简单随机抽样的方法,一旦起始编号确定,其他编号便随之确定了.
【例】 (2019届洛阳模拟)某大学数学系共有本科生1
000人,其中一、二、三、四年级的人数比为4∶3∶2∶1,要用分层抽样的方法从所有本科生中抽取一个容量为200的样本,则应抽取三年级的学生人数为(  )
A.80
B.40
C.60
D.20
[解析] 因为要用分层抽样的方法从该系所有本科生中抽取一个容量为200的样本,一、二、三、四年级的学生比为4∶3∶2∶1,所以三年级要抽取的学生人数是×200=40.
[答案] B
?名师点津
分层抽样中的计算问题
分层抽样满足“=”,即“==…=或n1∶n2∶…∶n=N1∶N2∶…∶N”,据此在已知每层间的个体数量或数量比、样本容量、总体数量中的两个时,就可以求出第三个.
|跟踪训练|
某高中在校学生有2
000人.为了响应“阳光体育运动”的号召,学校开展了跑步和登山比赛活动.每人都参与而且只参与其中一项比赛,各年级参与比赛的人数情况如下表:
高一年级
高二年级
高三年级
跑步
a
b
c
登山
x
y
z
其中a∶b∶c=2∶3∶5,全校参与登山的人数占总人数的.为了了解学生对本次活动的满意程度,从中抽取一个200人的样本进行调查,则从高二年级参与跑步的学生中应抽取________人.
解析:根据题意可知,样本中参与跑步的人数为200×=120,所以从高二年级参与跑步的学生中应抽取的人数为120×=36.
答案:36
【例】 (2019年天津卷)2019年,我国施行个人所得税专项附加扣除办法,涉及子女教育、继续教育、大病医疗、住房贷款利息或者住房租金、赡养老人等六项专项附加扣除.某单位老、中、青员工分别有72,108,120人,现采用分层抽样的方法,从该单位上述员工中抽取25人调查专项附加扣除的享受情况.
(1)应从老、中、青员工中分别抽取多少人?
(2)抽取的25人中,享受至少两项专项附加扣除的员工有6人,分别记为A,B,C,D,E,F.享受情况如下表,其中“○”表示享受,“×”表示不享受.现从这6人中随机抽取2人接受采访.
  员工项目  
A
B
C
D
E
F
子女教育


×

×

继续教育
×
×

×


大病医疗
×
×
×

×
×
住房贷款利息


×
×


住房租金
×
×

×
×
×
赡养老人


×
×
×

①试用所给字母列举出所有可能的抽取结果;
②设M为事件“抽取的2人享受的专项附加扣除至少有一项相同”,求事件M发生的概率.
[解] (1)由已知,得老、中、青员工人数之比为6∶9∶10,由于采用分层抽样的方法从中抽取25位员工,因此应从老、中、青员工中分别抽取6人,9人,10人.
(2)①从已知的6人中随机抽取2人的所有可能结果为{A,B},{A,C},{A,D},{A,E},{A,F},{B,C},{B,D},{B,E},{B,F},{C,D},{C,E},{C,F},{D,E},{D,F},{E,F},共15种.
②由表格知,符合题意的所有可能结果为{A,B},{A,D},{A,E},{A,F},{B,D},{B,E},{B,F},{C,E},{C,F},{D,F},{E,F},共11种.
所以,事件M发生的概率P(M)=.
?名师点津
先通过分层抽样确定抽取样本,再根据古典概型确定概率是解决分层抽样与概率问题的关键.
|跟踪训练|
(2019届绵阳模拟)某校共有在职教师140人,其中高级教师28人,中级教师56人,初级教师56人,现采用分层抽样的方法从在职教师中抽取5人进行职称改革调研,然后从抽取的5人中随机抽取2人进行深入了解,则抽取的这2人中至少有1人是初级教师的概率为(  )
A.
B.
C.
D.
解析:选A 由题意得,应从高级、中级、初级教师中抽取的人数分别为5×=1,5×=2,5×=2,记A为抽取的高级教师,B1,B2为抽取的中级教师,C1,C2为抽取的初级教师.从抽取的5人中随机抽取2人的所有可能结果有10种,分别为{A,B1},{A,B2},{A,C1},{A,C2},{B1,B2},{B1,C1},{B1,C2},{B2,C1},{B2,C2},{C1,C2},记“这2人中至少有1人是初级教师”为事件M,则事件M包含的可能结果有{A,C1},{A,C2},{B1,C1},{B1,C2},{B2,C1},{B2,C2},{C1,C2},共有7种,所以所求概率P(M)=.
PAGE第三节 变量间的相关关系与统计案例
[最新考纲]
[考情分析]
[核心素养]
1.会作两个相关变量的散点图,会利用散点图认识变量之间的相关关系.2.了解最小二乘法的思想,能根据给出的线性回归系数公式建立线性回归方程.3.了解独立性检验(只要求2×2列联表)的基本思想、方法及其简单应用.4.了解回归分析的基本思想、方法及其简单应用.
  两个变量线性相关的判断及应用,回归直线方程的求法及应用,利用2×2列联表判断两个变量的相关关系是2021年高考考查的热点,题型为选择题或填空题,分值为5分.或者在解答题中综合考查,分值为12分.
1.数学建模2.数据分析3.数学运算
‖知识梳理‖
1.变量间的相关关系
(1)常见的两变量之间的关系有两类:一类是函数关系,另一类是相关关系;与函数关系不同,相关关系是一种非确定性关系.
(2)从散点图上看,点散布在从左下角到右上角的区域内,两个变量的这种相关关系称为正相关,点散布在左上角到右下角的区域内,两个变量的这种相关关系为负相关.
2.两个变量的线性相关
(1)从散点图上看,如果这些点从整体上看大致分布在通过散点图中心的一条直线附近,称两个变量之间具有线性相关关系,这条直线叫做回归直线.
(2)回归方程为=x+,其中=,=-.
(3)通过求Q=
(yi-bxi-a)2的最小值而得到回归直线的方法,即使得样本数据的点到回归直线的距离的平方和最小,这一方法叫做最小二乘法.
(4)相关系数
当r>0时,表明两个变量正相关;
当r<0时,表明两个变量负相关.
r的绝对值越接近于1,表明两个变量的线性相关性越强.
r的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系.通常|r|大于0.75时,认为两个变量有很强的线性相关性.
3.独立性检验
假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为:
y1
y2
总计
x1
a
b
a+b
x2
c
d
c+d
总计
a+c
b+d
a+b+c+d
K2=(其中n=a+b+c+d为样本容量).
?常用结论
(1)分类变量的取值一定是离散的,分类变量的取值有时可用数字来表示.
(2)分类变量也称为属性变量或定性变量,其不同取值仅表示个体属性的类别.
‖基础自测‖
一、疑误辨析
1.判断下列结论是否正确(请在括号中打“√”或“×”).
(1)散点图是判断两个变量是否相关的一种重要方法和手段.(  )
(2)回归直线方程=x+至少经过点(x1,y1),(x2,y2),…,(xn,yn)中的一个点.(  )
(3)若事件X,Y关系越密切,则由观测数据计算得到的K2的观测值越小.(  )
(4)两个变量的相关系数的绝对值越接近于1,它们的相关性越强.(  )
答案:(1)√ (2)× (3)× (4)√
二、走进教材
2.(选修2-3P91探究改编)为调查中学生近视情况,测得某校150名男生中有80名近视,140名女生中有70名近视.在检验这些学生眼睛近视是否与性别有关时,用下列哪种方法最有说服力(  )
A.回归分析
B.均值与方差
C.独立性检验
D.概率
答案:C
3.(选修2-3P85讲解改编)两个变量y与x的回归模型中,分别选择了4个不同模型,它们的相关指数R2如下,其中拟合效果最好的模型是(  )
A.模型1的相关指数R2为0.98
B.模型2的相关指数R2为0.80
C.模型3的相关指数R2为0.50
D.模型4的相关指数R2为0.25
答案:A
三、易错自纠
4.已知x,y取值如表:
x
0
1
4
5
6
y
1.3
m
3m
5.6
7.4
画散点图分析可知:y与x线性相关,且求得回归方程为=x+1,则m的值(精确到0.1)为(  )
A.1.5
B.1.6
C.1.7
D.1.8
解析:选C 由题意知,==3.2,将=3.2代入回归方程=x+1,可得=4.2,则4m=4.2×5-(1.3+5.6+7.4)=6.7,解得m≈1.7,故选C.
5.为了考察两个变量x和y之间的线性相关性,甲、乙两位同学各自独立地做了10次和15次试验,利用线性回归方法,求得分别为l1和l2的回归直线.已知两个人在试验中发现变量x的观测数据的平均值都是s,变量y的观测数据的平均值都是t,那么下列说法正确的是(  )
A.l1和l2必定平行
B.l1和l2必定重合
C.l1和l2一定有公共点(s,t)
D.l1和l2相交,但交点不一定是(s,t)
解析:选C 回归直线必经过样本中心点(s,t).
6.(2019届阜阳质检)某班主任对全班30名男生进行了作业量多少的调查,数据如下表:
认为作业多
认为作业不多
总计
喜欢玩电脑游戏
12
8
20
不喜欢玩电脑游戏
2
8
10
总计
14
16
30
该班主任据此推断男生认为作业多与喜欢玩电脑游戏有关系,则这种推断犯错误的概率不超过________.
附:K2=.
P(K2>k0)
0.050
0.010
0.001
k0
3.841
6.635
10.828
解析:计算得K2的观测值为k=≈4.286>3.841,则推断犯错误的概率不超过0.05.
答案:0.05
●命题角度一 线性回归分析
【例1】 (2019届邯郸质检)已知某企业近3年的前7个月的月利润(单位:百万元)如下面的折线图所示:
(1)试问这3年的前7个月中哪个月的平均利润最高?
(2)通过计算判断这3年的前7个月的总利润的发展趋势;
(3)试以第3年的前4个月的数据(如下表),用线性回归的拟合模式估测第3年8月份的利润.
月份x
1
2
3
4
利润y(单位:百万元)
4
4
6
6
相关公式:=,=-.
[解] (1)由折线图可知5月和6月的平均利润最高.
(2)第1年前7个月的总利润为1+2+3+5+6+7+4=28(百万元),第2年前7个月的总利润为2+5+5+4+5+5+5=31(百万元),第3年前7个月的总利润为4+4+6+6+7+6+8=41(百万元),∴这3年的前7个月的总利润呈上升趋势.
(3)∵==2.5,==5,12+22+32+42=30,1×4+2×4+3×6+4×6=54,∴==0.8,
∴=5-2.5×0.8=3,∴=0.8x+3,
∴当x=8时,=0.8×8+3=9.4,
∴估计第3年8月份的利润为940万元.
?名师点津
(1)正确理解计算,的公式和准确的计算是求线性回归方程的关键.
(2)回归直线方程=x+必过样本点中心(,).
(3)在分析两个变量的相关关系时,可根据样本数据作出散点图来确定两个变量之间是否具有相关关系,若具有线性相关关系,则可通过线性回归方程来估计和预测.
●命题角度二 非线性回归问题
【例2】 为了解某地区未成年男性身高x(单位:cm)与体重y(单位:kg)的关系,调查了该地区未成年男性身高为xi(i=1,2,…,10)的平均体重yi(i=1,2,…,10),如下表,并得到散点图及一些统计量的值.
身高x/cm
60
75
90
100
115
125
135
150
160
170
体重y/kg
6
8
12
16
19
22
30
42
52
63
zi=log2yi,=4.4,zixi=5
548,26.1=68.6,26.2=73.5.
(1)根据散点图发现样本点分布在函数y=2cx+d表示的曲线周围,请根据所给数据建立y与x的回归方程(小数点后保留两位数字);
(2)若体重超过相同身高男性体重平均值的1.2倍为偏胖,低于0.8倍为偏瘦,请根据回归方程估计这个地区一名身高为175
cm,体重为80
kg的未成年男性的体重是否正常?
(3)根据散点图还可以发现样本点分布在二次函数y=mx2+n表示的曲线周围,如何判断用函数y=2cx+d还是函数y=mx2+n拟合体重与身高关系的效果较好?(只需给出判断的方法即可)
附:对于一组具有线性相关关系的数据(u1,v1),(u2,v2),…,(un,vn),其回归直线v=+u的斜率和截距的最小二乘估计分别为
[解] (1)令z=log2y,则z=cx+d,=×(60+75+90+100+115+125+135+150+160+170)=118,x=602+752+902+1002+1152+1252+1352+1502+1602+1702=151
400,
则==≈0.03,
=-=4.4-0.03×118=0.86,所以z=0.03x+0.86.
所以y与x的回归方程为y=20.03x+0.86.
(2)把x=175代入y=20.03x+0.86,得y=20.03×175+0.86=26.11,因为26.1<26.11<26.2,所以68.6<26.11<73.5.
因为68.6×1.2=82.32>80>73.5×0.8=58.8,
所以这个未成年男性体重正常.
(3)令z=log2y,画出(xi,zi)(i=1,2,…,10)的散点图,令t=x2,画出(ti,yi)(i=1,2,…,10)的散点图,观察变换后的这两个散点图,若某个散点图中样本点分布在一条直线附近,则其对应的函数拟合效果较好;还可以计算两个回归方程的残差,残差的平方和越小,拟合效果越好.
?名师点津
非线性的回归方程一般通过换元法求解,对于指数型y=2cx+b,可令z=log2y,得到z=cx+b;对于二次型y=mx2+n,可令t=x2,得到y=mt+n.拟合效果可通过散点图、相关系数或残差来判断.
|跟踪训练|
1.某机构为研究某种图书每册的成本费y(单位:元)与印刷数量x(单位:千册)的关系,收集了一些数据并进行了初步处理,得到了下面的散点图及一些统计量的值.
表中ui=,=i.
(1)根据散点图判断:y=a+bx与y=c+哪一个模型更适合作为该图书每册的成本费y(单位:元)与印刷数量x(单位:千册)的回归方程?(只要求给出判断,不必说明理由)
(2)根据(1)的判断结果及表中数据,建立y关于x的回归方程(回归系数的结果精确到0.01);
(3)若该图书每册的定价为10元,则至少应该印刷多少册才能使销售利润不低于78
840元?(假设能够全部售出,结果精确到1)
附:对于一组数据(ω1,υ1),(ω2,υ2),…,(ωn,υn),其回归直线v=+ω的斜率和截距的最小二乘估计分别为=.
解:(1)由散点图判断,y=c+更适合作为该图书每册的成本费y(单位:元)与印刷数量x(单位:千册)的回归方程.
(2)令u=,先建立y关于u的线性回归方程.
由于==≈8.957≈8.96,
∴=y-=3.63-8.957×0.269≈1.22,
∴y关于u的线性回归方程为=1.22+8.96u,
∴y关于x的回归方程为=1.22+.
(3)假设印刷x千册,依题意得10x-x≥78.840,解得x≥10,
∴至少印刷10
000册才能使销售利润不低于78
840元.
【例3】 (2019届河北名校联考)某企业有两个分厂生产某种零件,按规定内径尺寸(单位:mm)的值落在[29.94,30.06)的零件为优质品.从两个分厂生产的零件中各抽出了500件,量其内径尺寸,得结果如下表:
甲厂:
分组
[29.86,29.90)
[29.90,29.94)
[29.94,29.98)
[29.98,30.02)
频数
12
63
86
182
分组
[30.02,30.06)
[30.06,30.10)
[30.10,30.14)
频数
92
61
4
  乙厂:
分组
[29.86,29.90)
[29.90,29.94)
[29.94,29.98)
[29.98,30.02)
频数
29
71
85
159
分组
[30.02,30.06)
[30.06,30.10)
[30.10,30.14)
频数
76
62
18
(1)试分别估计两个分厂生产的零件的优质品率;
(2)由以上统计数据完成下面2×2列联表,并判断是否有99%的把握认为“两个分厂生产的零件的质量有差异”.
甲厂
乙厂
总计
优质品
非优质品
总计
附:K2=.
P(K2≥k)
0.050
0.010
0.001
k
3.841
6.635
10.828
[解] (1)甲厂抽查的500件产品中有360件优质品,从而估计甲厂生产的零件的优质品率为×100%=72%;
乙厂抽查的500件产品中有320件优质品,从而估计乙厂生产的零件的优质品率为×100%=64%.
(2)完成的2×2列联表如下:
甲厂
乙厂
总计
优质品
360
320
680
非优质品
140
180
320
总计
500
500
1
000
由表中数据计算得,
K2=≈7.353>6.635,
所以有99%的把握认为“两个分厂生产的零件的质量有差异”.
?名师点津
解独立性检验的应用问题的关注点
(1)两个明确
①明确两类主体;
②明确研究的两个问题.
(2)两个关键
①准确画出2×2列联表;
②准确计算K2.
[提醒] 准确计算K2的值是正确判断的前提.
|跟踪训练|
2.(2019年全国卷Ⅰ)某商场为提高服务质量,随机调查了50名男顾客和50名女顾客,每位顾客对该商场的服务给出了满意或不满意的评价,得到下面列联表:
满意
不满意
男顾客
40
10
女顾客
30
20
(1)分别估计男、女顾客对该商场服务满意的概率;
(2)能否有95%的把握认为男、女顾客对该商场服务的评价有差异?
附:K2=.
P(K2≥k)
0.050
0.010
0.001
k
3.841
6.635
10.828
解:(1)由调查数据知,男顾客中对该商场服务满意的比率为=0.8,因此男顾客对该商场服务满意的概率的估计值为0.8.
女顾客中对该商场服务满意的比率为=0.6,因此女顾客对该商场服务满意的概率的估计值为0.6.
(2)K2=≈4.762.
由于4.762>3.841,故有95%的把握认为男、女顾客对该商场服务的评价有差异.
【例】 (2019届河北石家庄二模)随着网络的发展,网上购物越来越受到人们的喜爱,各大购物网站为增加收入,促销策略越来越多样化,促销费用也不断增加.下表是某购物网站2017年1~8月份促销费用x(万元)和产品销量y(万件)的具体数据:
月份
1
2
3
4
5
6
7
8
促销费用x
2
3
6
10
13
21
15
18
产品销量y
1
1
2
3
3.5
5
4
4.5
(1)根据数据可知y与x具有线性相关关系,请建立y关于x的回归方程=x+(系数精确到0.01);
(2)已知6月份该购物网站为庆祝成立1周年,特制订奖励制度:用z(单位:件)表示日销量,若z∈[1
800,2
000),则每位员工每日奖励100元;若z∈[2
000,2
100),则每位员工每日奖励150元;若z∈[2
100,+∞),则每位员工每日奖励200元.现已知该网站6月份日销量z服从正态分布N(2
000,10
000),请你计算某位员工当月奖励金额总数大约为多少元.(当月奖励金额总数精确到百分位)
参考数据:xiyi=338.5,x=1
308,其中xi,yi分别为第i个月的促销费用和产品销量,i=1,2,3,…,8.
参考公式:①对于一组数据(x1,y1),(x2,y2),…,(xn,yn),其回归方程=x+的斜率和截距的最小二乘估计分别为
②若随机变量Z服从正态分布N(μ,σ2),则P(μ-σ7,P(μ-2σ5.
[解] (1)由题意可知=×(2+3+6+10+13+21+15+18)=11,=×(1+1+2+3+3.5+5+4+4.5)=3,
∴===≈0.22,
∴=-=3-0.22×11=0.58,
∴y关于x的回归方程为=0.22x+0.58.
(2)∵该网站6月份日销量z服从正态分布N(2
000,10
000),
∴P(1
800≤z<2
000)==0.477
25,
P(2
000≤z<2
100)==0.341
35,
P(z≥2
100)=0.5-0.341
35=0.158
65,
∴某位员工当月的奖励金额总数为30×(0.477
25×100+0.341
35×150+0.158
65×200)≈3
919.73(元).
?名师点津
回归分析常与概率、随机变量的分布、期望与方差等知识交汇应用,求解时注意知识交汇点的应用.
|跟踪训练|
(2019届湖南娄底二模)随着食品安全问题逐渐引起人们的重视,有机、健康的高端绿色蔬菜越来越受到消费者的欢迎,同时生产—运输—销售一体化的直销供应模式,不仅减少了成本,而且减去了蔬菜的二次污染等问题.
(1)在有机蔬菜的种植过程中,使用有机肥料是必不可少的.根据统计,某种有机蔬菜的产量与有机肥料的用量有关系,每个有机蔬菜大棚产量的增加量y(百千克)与使用堆沤肥料x(千克)之间对应数据如表:
使用堆沤肥料x(千克)
2
4
5
6
8
产量增加量y(百千克)
3
4
4
4
5
依据表中的数据,用最小二乘法求出y关于x的线性回归方程=x+,并根据所求线性回归方程估计如果每个有机蔬菜大棚使用堆沤肥料10千克,则每个有机蔬菜大棚产量增加量y是多少百千克;
(2)某大棚蔬菜种植基地将采摘的有机蔬菜以每份三千克称重并保鲜分装,以每份10元的价格销售到生鲜超市.“乐购”生鲜超市以每份15元的价格卖给顾客,如果当天前8小时卖不完,则超市通过促销以每份5元的价格卖给顾客(根据经验,当天能够把剩余的有机蔬菜都低价处理完毕,且处理完毕后,当天不再进货).该生鲜超市统计了100天有机蔬菜在每天的前8小时内的销售量(单位:份),制成如下表格(注:x,y∈N
,且x+y=30):
每日前8个小时销售量(单位:份)
15
16
17
18
19
20
21
频数
10
x
16
16
15
13
y
若以100天记录的频率作为每日前8小时销售量发生的概率,以该生鲜超市当天销售有机蔬菜利润的期望为决策依据,当购进17份比购进18份的利润的期望大时,求x的取值范围.
附:回归方程斜率和截距公式=,=-.
解:(1)由题意知,==5,==4,xiyi=2×3+4×4+5×4+6×4+8×5=106,x=22+42+52+62+82=145,
所以==0.3,=4-0.3×5=2.5,
所以y关于x的线性回归方程为=0.3x+2.5.
当x=10时,=0.3×10+2.5=5.5,
所以如果每个有机蔬菜大棚使用堆沤肥料10千克,估计每个有机蔬菜大棚产量的增加量是550千克.
(2)若该超市一天购进17份这种有机蔬菜,设Y1表示当天的利润(单位:元),那么Y1的分布列为
Y1
65
75
85
P
Y1的数学期望E(Y1)=65×+75×+85×=;
若该超市一天购进18份这种有机蔬菜,设Y2表示当天的利润(单位:元),那么Y2的分布列为
Y2
60
70
80
90
P
Y2的数学期望E(Y2)=60×+70×+80×+90×=.
因为购进17份比购进18份的利润的期望大,
故>,解得x>24,故x的取值范围是(24,30)且x∈N
.
PAGE第二节 用样本估计总体
[最新考纲]
[考情分析]
[核心素养]
1.了解分布的意义和作用,会列频率分布表,会画频率分布直方图、频率折线图、茎叶图,理解它们各自的特点.2.理解样本数据标准差的意义和作用,会计算数据标准差.3.能从样本数据中提取基本的数字特征(平均数、标准差),并给出合理解释.4.会用样本的频率分布估计总体的分布,会用样本的基本数字特征估计总体的基本数字特征,理解用样本估计总体的思想.5.会用随机抽样的基本方法和样本估计总体的思想解决一些简单的实际问题.
  频率分布直方图、茎叶图及其应用,将是2021年高考考查的热点,题型将是选择题或填空题,分值为5分,也可能与概率结合一起在解答题中出现.
1.数据分析2.数学运算
‖知识梳理‖
1.作频率分布直方图的步骤
(1)求极差(即一组数据中最大值与最小值的差);
(2)决定组距与组数;
(3)将数据分组;
(4)列频率分布表;
(5)画频率分布直方图.
2.频率分布折线图和总体密度曲线
(1)频率分布折线图:连接频率分布直方图中各小长方形上端的中点,就得到频率分布折线图.
(2)总体密度曲线:随着样本容量的增加,作图时所分的组数增加,组距减小,相应的频率分布折线图会越来越接近于一条光滑曲线,统计中称这条光滑曲线为总体密度曲线.
3.茎叶图的优点
茎叶图的优点是不但可以保留所有信息,而且可以随时记录,这对数据的记录和表示都能带来方便.
4.样本的数字特征
(1)众数、中位数、平均数
数字特征
概念
优点和缺点
众数
一组数据中重复出现次数最多的数
众数通常用于描述变量的值出现次数最多的数,但显然它对其他数据信息的忽视使它无法客观地反映总体特征
中位数
把一组数据按从小到大的顺序排列,处在中间位置的一个数据(或两个数据的平均数)
中位数等分样本数据所占频率,它不受少数几个极端值的影响,这在某些情况下是优点,但它对极端值的不敏感有时也会成为缺点
平均数
如果有n个数据x1,x2,…,xn,那么这n个数的平均数

平均数与每一个样本数据有关,可以反映出更多的关于样本数据全体的信息,但平均数受数据中的极端值的影响较大,使平均数在估计总体时可靠性降低
(2)标准差、方差
①标准差:样本数据到平均数的一种平均距离,一般用s表示,s=eq
\r(\f(1,n)[(x1-)2+(x2-)2+…+(xn-)2]).
②方差:标准差的平方s2,s2=[(x1-)2+(x2-)2+…+(xn-)2],其中xi(i=1,2,3,…,n)是样本数据,n是样本容量,是样本平均数.
?常用结论
平均数、方差的公式推广
(1)若数据x1,x2,…,xn的平均数为,那么mx1+a,mx2+a,mx3+a,…,mxn+a的平均数是m+a.
(2)数据x1,x2,…,xn的方差为s2.
①数据x1+a,x2+a,…,xn+a的方差也为s2;
②数据ax1,ax2,…,axn的方差为a2s2.
‖基础自测‖
一、疑误辨析
1.判断下列结论是否正确(请在括号中打“√”或“×”).
(1)在频率分布直方图中,小矩形的高表示频率.(  )
(2)频率分布直方图中各个长方形的面积之和为1.(  )
(3)茎叶图中的数据要按从小到大的顺序写,相同的数据可以只记一次.(  )
(4)平均数、众数与中位数从不同的角度描述了一组数据的集中趋势.(  )
(5)一组数据的方差越大,说明这组数据的波动越大.(  )
答案:(1)× (2)√ (3)× (4)√ (5)√
二、走进教材
2.(必修3P100A2(1)改编)一个容量为32的样本,已知某组样本的频率为0.25,则该组样本的频数为(  )
A.4
B.8
C.12
D.16
答案:B
3.(必修3P70示例改编)若某校高一年级8个班参加合唱比赛的得分茎叶图如图所示,则这组数据的中位数和平均数分别是(  )
A.91.5和91.5
B.91.5和92
C.91和91.5
D.92和92
答案:A
三、易错自纠
4.10名工人某天生产同一零件,生产的零件数分别是15,17,14,10,15,17,17,16,14,12,设其平均数为a,中位数为b,众数为c,则有(  )
A.a>b>c
B.b>c>a
C.c>a>b
D.c>b>a
解析:选D 依题意,这些数据由小到大依次是10,12,14,14,15,15,16,17,17,17,因此a=14.7,b=15,c=17,所以c>b>a.
5.(2019届郑州质检)已知甲、乙两组数据如茎叶图所示,若它们的中位数相同,平均数也相同,则图中m,n的比值=________.
解析:由茎叶图可知,甲的数据为27,30+m,39,乙的数据为20+n,32,34,38.由此可知,乙的中位数是33,所以甲的中位数也是33,所以m=3.由此可以得出甲的平均数为33,所以乙的平均数也是33,所以有=33,所以n=8,所以=.
答案:
6.某校为了了解教科研工作开展状况与教师年龄之间的关系,将该校不小于35岁的80名教师按年龄分组,分组区间为[35,40),[40,45),[45,50),[50,55),[55,60],由此得到如图所示的频率分布直方图,则这80名教师中年龄小于45岁的有________人.
解析:由频率分布直方图可知45岁以下的教师的频率为5×(0.040+0.080)=0.6,所以共有80×0.6=48(人).
答案:48
|题组突破|
1.(2019届东北三省四市一模)“科技引领,布局未来”,科技研发是企业发展的驱动力量.2007年至2018年,某企业连续12年累计研发投入达4
100亿元.我们将研发投入与经营收入的比值记为研发投入占营收比.这12年间的研发投入(单位:十亿元)用如图所示的条形图表示,研发投入占营收比用图中的折线图表示,根据折线图和条形图,下列结论错误的是(  )
A.2012年至2013年研发投入占营收比增量相比2017年至2018年增量大
B.2013年至2014年研发投入增量相比2015年至2016年增量小
C.该企业连续12年研发投入逐年增加
D.该企业连续12年来研发投入占营收比逐年增加
解析:选D 对于A,2012年至2013年研发投入占营收比增量为13.5%-11.5%=2%,2017年至2018年研发投入占营收比增量为14.9%-14.6%=0.3%,A正确;对于B,2013年至2014年研发投入增量为32-30=2(十亿元),2015年至2016年研发投入增量为60-41=19(十亿元),B正确;对于C,由题图易知该企业连续12年研发投入逐年增加,C正确;对于D,由题图知2008年至2009年研发投入占营收比是减少的,D错误.故选D.
2.(2019届广西桂林市、百色市、崇左市联考)在如图所示的一组数据的茎叶图中,有一个数字被污染后模糊不清,但曾计算得该组数据的极差与中位数之和为61,则被污染的数字为(  )
A.1
B.2
C.3
D.4
解析:选B 由题图可知该组数据的极差为48-20=28,则该组数据的中位数为61-28=33,所以被污染的数字为2.
3.(2020届四川五校联考)如图为截止到2019年3月末,我国外汇储备近1年的变化折线图,由此得到以下说法,其中叙述正确的是(  )
A.近1年来,我国外汇储备月增长量最大的月份是2019年3月
B.2018年4月至10月,我国外汇储备连续下降
C.2018年底,我国外汇储备降至近年来最低
D.截止到2019年3月末,我国外汇储备连续五个月上升
解析:选D 选项A,由图知,我国外汇储备月增长量最大的月份是2019年1月,A错误;选项B,2018年4月至10月,我国外汇储备有升有降,B错误;选项C,由图无法说明2018年底,我国外汇储备降至近年来最低,C错误;选项D,我国外汇储备自2018年11月起连续上升,2019年3月为第五个月,D正确.故选D.
?名师点津
统计图的分析策略:(1)注意统计图中的点、线的变化规律;(2)抓住特殊的数据,明确它们所表示的意义,特别是最大数据与最小数据;(3)涉及两个或两个以上的统计图时,它们之间往往存在某种关系;(4)如果涉及数轴,一定要明确数轴表示的意义.
【例1】 (2019年全国卷Ⅲ)为了解甲、乙两种离子在小鼠体内的残留程度,进行如下试验:将200只小鼠随机分成A,B两组,每组100只,其中A组小鼠给服甲离子溶液,B组小鼠给服乙离子溶液.每只小鼠给服的溶液体积相同、物质的量浓度相同.经过一段时间后用某种科学方法测算出残留在小鼠体内离子的百分比.根据试验数据分别得到如下直方图:
记C为事件:“乙离子残留在体内的百分比不低于5.5%”,根据直方图得到P(C)的估计值为0.70.
(1)求乙离子残留百分比直方图中a,b的值;
(2)分别估计甲、乙离子残留百分比的平均值(同一组中的数据用该组区间的中点值为代表).
[解] (1)由已知得0.70=a+0.20+0.15,故a=0.35.
b=1-0.05-0.15-0.70=0.10.
(2)甲离子残留百分比的平均值的估计值为
2×0.15+3×0.20+4×0.30+5×0.20+6×0.10+7×0.05=4.05.
乙离子残留百分比的平均值的估计值为
3×0.05+4×0.10+5×0.15+6×0.35+7×0.20+8×0.15=6.00.
?名师点津
1.由频率分布直方图进行相关计算时,需掌握的2个关系式
(1)×组距=频率.
(2)=频率,此关系式的变形为=样本容量,样本容量×频率=频数.
2.利用频率分布直方图估计样本的数字特征的方法
(1)中位数:在频率分布直方图中,中位数左边和右边的直方图的面积相等,由此可以估计中位数的值.
(2)平均数:平均数的估计值等于每个小矩形的面积乘以矩形底边中点横坐标之和.
(3)众数:最高的矩形的中点的横坐标.
|跟踪训练|
1.某网络营销部门随机抽查了某市200名网友在2018年11月11日的网购金额,所得数据如下表:
网购金额(单位:千元)
人数
频率
(0,1]
16
0.08
(1,2]
24
0.12
(2,3]
x
p
(3,4]
y
q
(4,5]
16
0.08
(5,6]
14
0.07
总计
200
1.00
已知网购金额不超过3千元与超过3千元的人数比恰为3∶2.
(1)试确定x,y,p,q的值,并补全频率分布直方图(如图);
(2)该营销部门为了了解该市网友的购物体验,从这200名网友中,用分层抽样的方法从网购金额在(1,2]和(4,5]的两个群体中抽取5人进行问卷调查,若需从这5人中随机选取2人继续访谈,则此2人来自不同群体的概率是多少?
解:(1)根据题意有
即解得
∴p==0.40,q==0.25.
补全频率分布直方图如图所示:
(2)根据题意,抽取网购金额在(1,2]内的人数为
×5=3,
抽取网购金额在(4,5]内的人数为×5=2.
故此2人来自不同群体的概率P=eq
\f(CC,C)=.
【例2】 (2019年全国卷Ⅱ)某行业主管部门为了解本行业中小企业的生产情况,随机调查了100个企业,得到这些企业第一季度相对于前一年第一季度产值增长率y的频数分布表.
y的分组
[-0.20,0)
[0,0.20)
[0.20,0.40)
[0.40,0.60)
[0.60,0.80)
企业数
2
24
53
14
7
(1)分别估计这类企业中产值增长率不低于40%的企业比例、产值负增长的企业比例;
(2)求这类企业产值增长率的平均数与标准差的估计值(同一组中的数据用该组区间的中点值代表).(精确到0.01)
附:≈8.602.
[解] (1)根据产值增长率频数分布表得,所调查的100个企业中产值增长率不低于40%的企业频率为=0.21.产值负增长的企业频率为=0.02.
用样本频率分布估计总体分布得这类企业中产值增长率不低于40%的企业比例为21%,产值负增长的企业比例为2%.
(2)=×(-0.10×2+0.10×24+0.30×53+0.50×14+0.70×7)=0.30,
s2=i(yi-)2
=×[(-0.40)2×2+(-0.20)2×24+02×53+0.202×14+0.402×7]=0.029
6,
则s==0.02×≈0.17.
所以,这类企业产值增长率的平均数与标准差的估计值分别为0.30,0.17.
?名师点津
(1)平均数反映了数据取值的平均水平;标准差、方差描述了一组数据围绕平均数波动的大小.标准差、方差越大,数据的离散程度越大,越不稳定;标准差、方差越小,数据的离散程度越小,越稳定.
(2)用样本估计总体就是利用样本的数字特征来描述总体的数字特征.
|跟踪训练|
2.(2019届江西八校联考)规定一个学生数学成绩优秀的标志为连续5次数学考试成绩(满分150分)均不低于120分.现有甲、乙、丙三位学生连续5次数学考试成绩的记录数据(记录数据都是正整数)情况:
①甲学生:5个数据的中位数为127,众数为120;
②乙学生:5个数据的中位数为125,总体均值为127;
③丙学生:5个数据中有一个数据是135,总体均值为128,总体方差为19.8.
则可以断定数学成绩优秀的学生为(  )
A.甲、丙
B.乙、丙
C.甲、乙
D.甲、乙、丙
解析:选A 因为甲学生的5个数据的中位数为127,所以5个数据中有2个数据大于127,又5个数据的众数是120,所以有2个数据为120,所以甲学生的5个数据均不小于120,所以甲学生数学成绩优秀.丙学生的5个数据中的一个数据为135,设另外4个数据分别是a,b,c,d,因为5个数据的总体均值为128,总体方差为19.8,所以=19.8,所以(a-128)2+(b-128)2+(c-128)2+(d-128)2=50 ①,假设a,b,c,d中存在小于120的数据,不妨设a<120,则(a-128)2>64,显然①式不成立,所以假设错误,即a,b,c,d均不小于120,所以丙学生的5个数据均不小于120,所以丙学生数学成绩优秀.根据乙学生的记录数据不能得出连续5次数学考试成绩均不低于120分,即不能断定乙学生数学成绩优秀.故选A.
【例】 (2019届长春模拟)某中学共有1
000名学生参加了该地区高三第一次质量检测的数学考试,数学成绩如下表所示:
数学成绩分组
[0,30)
[30,60)
[60,90)
[90,120)
[120,150]
人数
60
90
300
x
160
(1)为了了解同学们前段复习的得失,以便制定下阶段的复习计划,学校将采用分层抽样的方法抽取100名同学进行问卷调查,甲同学在本次测试中数学成绩为95分,求他被抽中的概率;
(2)已知本次数学成绩的优秀线为110分,试根据所提供数据估计该中学达到优秀线的人数;
(3)作出频率分布直方图,并估计该学校本次考试的数学平均分.(同一组中的数据用该组区间的中点值作代表)
[解] (1)分层抽样中,每个个体被抽到的概率均为,故甲同学被抽到的概率P==.
(2)由题意得x=1
000-(60+90+300+160)=390,故估计该中学达到优秀线的人数为160+390×=290.
(3)由(1)及题表可得频率分布直方图如图所示.
该学校本次考试数学平均分=×(60×15+90×45+300×75+390×105+160×135)=90(分).
所以估计该学校本次考试的数学平均分为90分.
?名师点津
以随机抽样获取样本为基础,首先画频率分布表、频率分布直方图,然后应用这些图表计算频率、频数和数字特征.
|跟踪训练|
(2019·长沙、南昌第一次联考)“2018弘扬中华优秀传统文化经验交流大会”于2018年11月26日在深圳举行,会议同期举行了“深圳市中华优秀传统文化公益讲堂”启动仪式.从2019年1月起到12月,深圳市文化和健康发展促进会将连续举办52场中华优秀传统文化公益讲堂,邀请多位名家名师现场开讲.某学校的文学社团为响应这次活动,举行了国学文化大赛,统计的比赛成绩(单位:分)的数据如频率分布直方图所示,已知成绩在[80,90)内的有50人.
(1)求a的值及参加比赛的总人数;
(2)若成绩在80分及以上的学生将获得荣誉证书,则能否认为参加比赛的学生超过40%获得荣誉证书?
(3)如果从成绩在[80,90)和[90,100]内的学生中按分层抽样的方法选取5人参加决赛,并最终选取其中的2人参加与友好学校的友谊赛,求最终选取的2人成绩在[80,90)和[90,100]内各1人的概率.
解:(1)由题意得(0.01+a+0.02+0.03)×10=1,解得a=0.04.
因为成绩在[80,90)内的有50人且成绩在[80,90)内的频率为0.02×10=0.2,
故参加比赛的总人数为=250.
(2)因为成绩在80分及以上的频率为(0.02+0.03)×10=0.5>40%,
故能认为参加比赛的学生超过40%获得荣誉证书.
(3)由频率分布直方图知,成绩在[80,90)和[90,100]内的学生的人数比为2∶3,故选取的5人成绩在[80,90)和[90,100]内的学生人数分别是2和3.
设成绩在[80,90)内的2名学生分别为A1,A2,成绩在[90,100]内的3名学生分别为B1,B2,B3,
则最终选取的2人的所有情况为A1A2,A1B1,A1B2,A1B3,A2B1,A2B2,A2B3,B1B2,B1B3,B2B3,共10种,
而满足成绩在[80,90)和[90,100]内各1人的情况有A1B1,A1B2,A1B3,A2B1,A2B2,A2B3,共6种,
故所求概率P==.
PAGE

展开更多......

收起↑

资源列表