2022届高考数学一轮复习第十章统计统计案例学案理(3份打包)新人教版

资源下载
  1. 二一教育资源

2022届高考数学一轮复习第十章统计统计案例学案理(3份打包)新人教版

资源简介

第三节 变量间的相关关系与统计案例
1.相关关系与回归方程
(1)相关关系的分类:
①正相关:从散点图上看,点分布在从左下角到右上角的区域内;
②负相关:从散点图上看,点分布在从左上角到右下角的区域内.
(2)线性相关关系:从散点图上看,如果这些点从整体上看大致分布在一条直线附近,则称这两个变量之间具有线性相关关系,这条直线叫做回归直线.
(3)回归方程:
①最小二乘法:使得样本数据的点到回归直线的距离的平方和最小的方法叫做最小二乘法.
②回归方程:两个具有线性相关关系的变量的一组数据:(x1,y1),(x2,y2),…,(xn,yn),其回归方程为=x+,则其中,是回归方程的斜率,是在y轴上的截距.
(4)样本相关系数:
,用它来衡量两个变量间的线性相关关系.
①当r>0时,表明两个变量正相关;
②当r<0时,表明两个变量负相关;
③r的绝对值越接近1,表明两个变量的线性相关性越强;r的绝对值越接近于0,表明两个变量之间几乎不存在线性相关关系.通常当|r|>0.75时,认为两个变量有很强的线性相关关系.
2.独立性检验
(1)2×2列联表:假设有两个分类变量X和Y,它们的值域分别为{x1,x2}和{y1,y2},其样本频数列联表(称2×2列联表)为:
y1
y2
合计
x1
a
b
a+b
x2
c
d
c+d
合计
a+c
b+d
a+b+c+d
(2)K2统计量:
k=(其中n=a+b+c+d为样本容量).
1.两种关系——函数关系与相关关系
(1)区别:
①函数关系是一种确定性关系,相关关系是一种非确定性关系.
②函数关系是一种因果关系,相关关系不一定是因果关系,也可能是伴随关系.
(2)联系:对线性相关关系求回归方程后,可以通过确定的函数关系对两个变量间的取值进行估计.
2.回归直线方程的两个关注点
(1)样本数据点不一定在回归直线上,回归直线必过(,)点.
(2)在回归直线方程=x+中,>0时,两个变量呈正相关关系;<0时,两个变量呈负相关关系.
3.回归分析的意义
回归分析是对具有相关关系的两个变量进行统计分析的一种常用方法.在线性回归模型y=bx+a+e中,因变量y的值由自变量x和随机误差e共同确定,即自变量x只能解释部分y的变化,在统计中,我们把自变量x称为解释变量,因变量y称为预报变量.
4.独立性检验
利用独立性假设、随机变量K2来确定是否有一定把握认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.
两个分类变量X和Y是否有关系的判断标准:
统计学研究表明:
当K2≤2.706时,认为没有充分证据显示X与Y有关系;
当K2>3.841时,有95%的把握说X与Y有关;
当K2>6.635时,有99%的把握说X与Y有关;
当K2>10.828时,有99.9%的把握说X与Y有关.
1.(基础知识:回归分析的相关指数)两个变量y与x的回归模型中,分别选择了4个不同模型,它们的相关指数R2如下,其中拟合效果最好的模型是
(  )
A.模型1的相关指数R2为0.98
B.模型2的相关指数R2为0.80
C.模型3的相关指数R2为0.50
D.模型4的相关指数R2为0.25
答案:A
2.(基本应用:回归直线方程的特征)某研究机构对高三学生的记忆力x和判断力y进行统计分析,所得数据如下表:
x
6
8
10
12
y
2
3
5
6
则y对x的线性回归直线方程为(  )
A.=2.3x-0.7
B.=2.3x+0.7
C.=0.7x-2.3
D.=0.7x+2.3
答案:C
3.(基础知识:独立性检验)为了判断高中三年级学生选修文科是否与性别有关,现随机抽取50名学生,得到如下2×2列联表:
理科
文科

13
10

7
20
已知P(K2≥3.841)≈0.05,P(K2≥5.024)≈0.025.根据表中数据,得到K2的观测值k=≈4.844.
则认为选修文科与性别有关系出错的可能性为________.
答案:5%
4.(基本运算:回归直线方程的特征)某车间为了规定工时定额,需要确定加工零件所花费的时间,为此进行了5次试验.根据收集到的数据(如下表),由最小二乘法求得回归方程=0.67x+54.9.
零件数x(个)
10
20
30
40
50
加工时间y(min)
62
75
81
89
现发现表中有一个数据看不清,请你推断出该数据的值为________.
答案:68
5.(基本能力:回归直线方程的应用)设某大学的女生体重y(单位:kg)与身高x(单位:cm)具有线性相关关系,根据一组样本数据(xi,yi)(i=1,2,…,n),用最小二乘法建立的回归方程为=0.85x-85.71,则下列结论中不正确的是________.(填序号)
①y与x具有正的线性相关关系;
②回归直线过样本点的中心(,);
③若该大学某女生身高增加1
cm,则其体重约增加0.85
kg;
④若该大学某女生身高为170
cm,则可断定其体重必为58.79
kg.
答案:④
题型一 回归分析 
    
[典例剖析]
类型
1 相关关系的判断
[例1] (1)(2021·云南昆明诊断)某商家今年上半年各月的人均销售额(单位:千元)与利润率统计表如下:
月份
1
2
3
4
5
6
人均销售额
6
5
8
3
4
7
利润率(%)
12.6
10.4
18.5
3.0
8.1
16.3
根据表中数据,下列说法正确的是(  )
A.利润率与人均销售额成正相关关系
B.利润率与人均销售额成负相关关系
C.利润率与人均销售额成正比例函数关系
D.利润率与人均销售额成反比例函数关系
解析:利润率随人均销售额增大而增大是相关关系,而不是函数关系.
答案:A
(2)对四组数据进行统计,获得如图所示的散点图,关于其相关系数的比较,正确的是(  )
A.r2B.r4C.r4D.r2解析:易知题中图①与图③是正相关,图②与图④是负相关,且图①与图②中的样本点集中分布在一条直线附近,则r2答案:A
类型
2 线性回归方程及应用
[例2] (2020·高考全国卷Ⅱ)某沙漠地区经过治理,生态系统得到很大改善,野生动物数量有所增加.为调查该地区某种野生动物的数量,将其分成面积相近的200个地块,从这些地块中用简单随机抽样的方法抽取20个作为样区,调查得到样本数据(xi,yi)(i=1,2,…,20),其中xi和yi分别表示第i个样区的植物覆盖面积(单位:公顷)和这种野生动物的数量,并计算得i=60,i=1
200,(xi-)2=80,(yi-)2=9
000,(xi-)·(yi-)=800.
(1)求该地区这种野生动物数量的估计值(这种野生动物数量的估计值等于样区这种野生动物数量的平均数乘以地块数);
(2)求样本(xi,yi)(i=1,2,…,20)的相关系数(精确到0.01);
(3)根据现有统计资料,各地块间植物覆盖面积差异很大,为提高样本的代表性以获得该地区这种野生动物数量更准确的估计,请给出一种你认为更合理的抽样方法,并说明理由.
附:相关系数,≈1.414.
解析:(1)由已知得样本平均数y=i=60,从而该地区这种野生动物数量的估计值为60×200=12
000.
(2)样本(xi,yi)(i=1,2,…,20)的相关系数==≈0.94.
(3)分层抽样:根据植物覆盖面积的大小对地块分层,再对200个地块进行分层抽样.
理由如下:由②知各样区的这种野生动物数量与植物覆盖面积有很强的正相关.由于各地块间植物覆盖面积差异很大,从而各地块间这种野生动物数量差异也很大,采用分层抽样的方法较好地保持了样本结构与总体结构的一致性,提高了样本的代表性,从而可以获得该地区这种野生动物数量更准确的估计.
类型
3 非线性回归分析
[例3] 为方便市民出行,倡导低碳出行.某市公交公司推出利用支付宝和微信扫码支付乘车活动,活动设置了一段时间的推广期,在推广期内采用随机优惠鼓励市民扫码支付乘车.该公司某线路公交车队统计了活动推广期第一周内使用扫码支付的情况,其中x(单位:天)表示活动推出的天数,y(单位:十人次)表示当天使用扫码支付的人次,整理后得到如图所示的统计表1和散点图.
表1:
x
第1天
第2天
第3天
第4天
第5天
第6天
第7天
y
7
12
20
33
54
90
148
(1)由散点图分析后,可用y=ebx+a作为该线路公交车在活动推广期使用扫码支付的人次y关于活动推出天数x的回归方程,根据表2的数据,求此回归方程,并预测第8天使用扫码支付的人次(精确到整数).
表2:
x
xiyi
xizi
4
52
3.5
140
2
069
112
其中z=ln
y,=zi.
(2)推广期结束后,对此期间乘客的支付情况进行统计,结果如表3.
表3:
支付方式
现金
乘车卡
扫码
频率
10%
60%
30%
优惠方式
无优惠
按7折支付
随机优惠(见下面统计结果)
统计结果显示,扫码支付中享受5折支付的频率为,享受7折支付的频率为,享受9折支付的频率为.
已知该线路公交车票价为1元,将上述频率作为相应事件发生的概率,记随机变量ξ为在活动期间该线路公交车搭载乘客一次的收入(单位:元),求ξ的分布列和期望.
参考公式:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其回归直线=+u的斜率和截距的最小二乘估计分别为

eq
\f(\o(∑,\s\up6(n),\s\do4(i=1))uivi-n\x\to(u)
\x\to(v),\o(∑,\s\up6(n),\s\do4(i=1))u-n\x\to(u)2)
,=-.
参考数据:e
5.3≈200.34,e5.5≈244.69,e5.7≈298.87.
解析:(1)由题意得z=ln
y=ln
ebx+a=bx+a,
∴=
eq
\f(\o(∑,\s\up6(7),\s\do4(i=1))xizi-7\x\to(x)
\x\to(z),\o(∑,\s\up6(7),\s\do4(i=1))x-7\x\to(x)2)
==0.5,
∴=-=3.5-0.5×4=1.5,
∴z关于x的线性回归方程为=0.5x+1.5,
∴y关于x的回归方程为=e0.5x+1.5,当x=8时,=e5.5≈244.69,
∴第8天使用扫码支付的人次约为2
447.
(2)由题意得ξ的所有可能取值为0.5,0.7,0.9,1,
P(ξ=0.5)=×30%=0.10,P(ξ=0.7)=60%+×30%=0.75,
P(ξ=0.9)=×30%=0.05,P(ξ=1)=10%=0.10,
∴ξ的分布列为
ξ
0.5
0.7
0.9
1
P
0.10
0.75
0.05
0.10
∴E(ξ)=0.5×0.10+0.7×0.75+0.9×0.05+1×0.10=0.72.
方法总结?
1.利用散点图判断两个变量是否有相关关系是比较简便的方法:
(1)在散点图中如果所有的样本点都落在某一函数的曲线上,就用该函数来描述变量之间的关系,即变量之间具有函数关系.
(2)如果所有的样本点落在某一函数的曲线附近,变量之间就有相关关系.
(3)如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系.
(4)若呈圆形区域且分布较乱,则不具备相关性.
2.线性回归直线方程中:>0时,正相关;<0时,负相关.
3.线性回归分析问题的类型及解题方法:
(1)求线性回归方程:
①利用公式,求出回归系数,.
②待定系数法:利用回归直线过样本点中心求系数.
(2)利用回归方程进行预测:把回归直线方程看作一次函数,求函数值.
(3)利用回归直线判断正、负相关:决定正相关还是负相关的是系数.  ?
[题组突破]
1.(2021·河南濮阳模拟)根据下表中的数据,得到的回归方程为=x+9,则=(  )
x
4
5
6
7
8
y
5
4
3
2
1
A.2
B.1
C.0
D.-1
解析:由题意可得=×(4+5+6+7+8)=6,=×(5+4+3+2+1)=3.∵回归方程为=x+9且回归直线过点(6,3),∴3=6+9,解得=-1.
答案:D
2.(2021·山东泰安模拟)某商场对每天进店人数和商品销售件数进行了统计对比,得到如下表格:
人数xi
10
15
20
25
30
35
40
件数yi
4
7
12
15
20
23
27
其中i=1,2,3,4,5,6,7.
(1)以每天进店人数为横轴,每天商品销售件数为纵轴,画出散点图.
(2)求回归直线方程.(结果保留到小数点后两位)
(参考数据:xiyi=3
245,=25,=15.43,x=5
075,7()2=4
375,7
=2
700)
(3)预测进店人数为80人时,商品销售的件数.(结果保留整数)
解析:(1)散点图如图所示.
(2)因为xiyi=3
245,=25,=15.43,
x=5
075,7()2=4
375,7
=2
700.
所以=
eq
\f(\o(∑,\s\up6(7),\s\do4(i=1))xiyi-7\x\to(x)
\x\to(y),\o(∑,\s\up6(7),\s\do4(i=1))x-7(\x\to(x))2)
≈0.78,
=-=-4.07,所以回归直线方程是=0.78x-4.07.
(3)进店人数为80人时,商品销售的件数=0.78×80-4.07≈58(件).
题型二 独立性检验 
  
[典例剖析]
[典例] (2020·高考全国卷Ⅰ)为加强环境保护,治理空气污染,环境监测部门对某市空气质量进行调研,随机抽查了100天空气中的PM2.5和SO2浓度(单位:μg/m3),得下表:
    SO2PM2.5  
[0,50]
(50,150]
(150,475]
[0,35]
32
18
4
(35,75]
6
8
12
(75,115]
3
7
10
(1)估计事件“该市一天空气中PM2.5浓度不超过75,且SO2浓度不超过150”的概率;
(2)根据所给数据,完成下面的2×2列联表:
   SO2PM2.5  
[0,150]
(150,475]
[0,75]
(75,115]
(3)根据(2)中的列联表,判断是否有99%的把握认为该市一天空气中PM2.5浓度与SO2浓度有关?
附:K2=,
P(K2≥k)
0.050
0.010
0.001
k
3.841
6.635
10.828
解析:(1)根据抽查数据,该市100天的空气中PM2.5浓度不超过75,且SO2浓度不超过150的天数为32+18+6+8=64,因此,该市一天空气中PM2.5浓度不超过75,且SO2浓度不超过150的概率的估计值为=0.64.
(2)根据抽查数据,可得2×2列联表:
   SO2PM2.5  
[0,150]
(150,475]
[0,75]
64
16
(75,115]
10
10
(3)根据(2)中的列联表得
K2=≈7.484.
由于7.484>6.635,故有99%的把握认为该市一天空气中PM2.5浓度与SO2浓度有关.
方法总结?
1.独立性检验的原理
独立性检验的基本思想类似于反证法,要确认“两个分类变量有关系”这一结论成立的可信度,首先假设该结论不成立.即假设结论“两个分类变量没有关系”成立.在该假设下构造的随机变量K2应该很小.如果由观测数据计算得到的K2的观测值k很大,则在一定程度上说明不合理.
2.独立性检验的一般步骤
(1)根据样本数据列出2×2列联表.
(2)计算随机变量K2的观测值k,查表确定临界值k0.
(3)如果k≥k0,就推断“X与Y有关系”,这种推断犯错误的概率不超过P(K2≥k0);否则,就认为在犯错误的概率不超过P(K2≥k0)的前提下不能推断“X与Y有关系”.  ?
[对点训练]
某次模拟考试中,某校共有100名学生参加考试,其中语文考试成绩低于130分的占95%,数学成绩的频率分布直方图如图所示:
(1)如果成绩不低于130分的为特别优秀,这100名学生中本次考试语文、数学成绩特别优秀的大约各多少人?
(2)如果语文和数学两科都特别优秀的共有3人.
①从(1)中的这些同学中随机抽取2人,求这两人两科成绩都特别优秀的概率;
②根据以上数据,完成2×2列联表,并分析是否有99.9%的把握认为语文特别优秀的同学,数学也特别优秀.
语文特别优秀
语文不特别优秀
合计
数学特别优秀
数学不特别优秀
合计
附注:K2=.
P(K2≥k0)
0.15
0.10
0.05
0.025
0.010
0.005
0.001
k0
2.072
2.706
3.841
5.024
6.635
7.879
10.828
解析:(1)该校共有100名学生参加考试,其中语文考试成绩低于130分的占95%,语文成绩特别优秀的概率为P1=1-0.95=0.05,语文成绩特别优秀的同学有100×0.05=5(人);数学成绩特别优秀的频率为P2=0.002×20=0.04,数学成绩特别优秀的同学有100×0.04=4(人).
(2)①语文、数学两科都特别优秀的有3人,单科特别优秀的有3人,
记两科都特别优秀的3人分别为A1,A2,A3,单科特别优秀的3人分别为B1,B2,B3,从中随机抽取2人,有(A1,A2),(A1,A3),(A2,A3),(B1,B2),(B1,B3),(B2,B3),(A1,B1),(A1,B2),(A1,B3),(A2,B1),(A2,B2),(A2,B3),(A3,B1),(A3,B2),(A3,B3),共15种,其中这两人两科成绩都特别优秀的有(A1,A2),(A1,A3),(A2,A3),共3种,则这两人两科成绩都特别优秀的概率为P==.
②2×2列联表:
语文特别优秀
语文不特别优秀
合计
数学特别优秀
3
1
4
数学不特别优秀
2
94
96
合计
5
95
100
∴K2=≈42.982>10.828,
∴有99.9%的把握认为语文特别优秀的同学,数学也特别优秀.
eq
\a\vs4\al(
再研高考\x(概率统计的生活应用))
1.(2020·高考全国卷Ⅰ)某校一个课外学习小组为研究某作物种子的发芽率y和温度x(单位:℃)的关系,在20个不同的温度条件下进行种子发芽实验,由实验数据(xi,yi)(i=1,2,…,20)得到下面的散点图:
由此散点图,在10
℃至40
℃之间,下面四个回归方程类型中最适宜作为发芽率y和温度x的回归方程类型的是(  )
A.y=a+bx    
B.y=a+bx2
C.y=a+bex
D.y=a+b
ln
x
解析:由散点图可以看出,点大致分布在对数型函数的图象附近.
答案:D
2.(2020·高考全国卷Ⅲ)某学生兴趣小组随机调查了某市100天中每天的空气质量等级和当天到某公园锻炼的人次,整理数据得到下表(单位:天):
   锻炼人次空气质量等级   
[0,200]
(200,400]
(400,600]
1(优)
2
16
25
2(良)
5
10
12
3(轻度污染)
6
7
8
4(中度污染)
7
2
0
(1)分别估计该市一天的空气质量等级为1,2,3,4的概率;
(2)求一天中到该公园锻炼的平均人次的估计值(同一组中的数据用该组区间的中点值为代表);
(3)若某天的空气质量等级为1或2,则称这天“空气质量好”;若某天的空气质量等级为3或4,则称这天“空气质量不好”.根据所给数据,完成下面的2×2列联表,并根据列联表,判断是否有95%的把握认为一天中到该公园锻炼的人次与该市当天的空气质量有关?
人次≤400
人次>400
空气质量好
空气质量不好
附:K2=,
P(K2≥k)
0.050
0.010
0.001
k
3.841
6.635
10.828
解析:(1)由所给数据,得该市一天的空气质量等级为1,2,3,4的概率的估计值如下表:
空气质量等级
1
2
3
4
概率的估计值
0.43
0.27
0.21
0.09
(2)一天中到该公园锻炼的平均人次的估计值为×(100×20+300×35+500×45)=350.
(3)根据所给数据,可得2×2列联表:
人次≤400
人次>400
空气质量好
33
37
空气质量不好
22
8
根据列联表得
K2的观测值k=≈5.820.
由于5.820>3.841,故有95%的把握认为一天中到该公园锻炼的人次与该市当天的空气质量有关.
eq
\a\vs4\al(
素养升华\x(实际生活中的概率统计))
(2020·山东高三模拟)共享单车进驻城市,绿色出行引领时尚.某市有统计数据显示,2020年该市共享单车用户年龄等级分布如图1所示,一周内市民使用单车的频率分布扇形图如图2所示.若将共享单车用户按照年龄分为“年轻人”(20岁~39岁)和“非年轻人”(19岁及以下或者40岁及以上)两类,将一周内使用的次数为6次或6次以上的称为“经常使用单车用户”,使用次数为5次或不足5次的称为“不常使用单车用户”.已知在“经常使用单车用户”中有是“年轻人”.
(1)现对该市市民进行“经常使用共享单车与年龄关系”的调查,采用随机抽样的方法,抽取一个容量为200的样本,请你根据图表中的数据,补全下列2×2列联表,并根据列联表的独立性检验,判断是否有85%的把握认为经常使用共享单车与年龄有关?
使用共享单车情况与年龄列联表
年轻人
非年轻人
合计
经常使用共享单车用户
120
不常使用共享单车用户
80
合计
160
40
200
(2)将(1)中频率视为概率,若从该市市民中随机任取3人,设其中经常使用共享单车的“非年轻人”人数为随机变量X,求X的分布列与数学期望.
参考数据:独立性检验界值表
P(K2≥k0)
0.15
0.10
0.050
0.025
0.010
k0
2.072
2.706
3.841
5.024
6.635
其中,K2=,n=a+b+c+d.
解析:(1)补全的列联表如下:
年轻人
非年轻人
合计
经常使用共享单车用户
100
20
120
不常使用共享单车用户
60
20
80
合计
160
40
200
于是a=100,b=20,c=60,d=20,n=200,
∴K2=≈2.083>2.072,
∴有85%的把握认为经常使用共享单车与年龄有关.
(2)由(1)的列联表可知,
经常使用共享单车的“非年轻人”占样本总数的频率为×100%=10%,
即在抽取的用户中出现经常使用共享单车的“非年轻人”的概率为0.1,
∵X~B(3,0.1),X=0,1,2,3,
∴P(X=0)=(1-0.1)3=0.729,P(X=1)=C0.1×(1-0.1)2=0.243,
P(X=2)=C0.12×(1-0.1)=0.027,P(X=3)=0.13=0.001,
∴X的分布列为
X
0
1
2
3
P
0.729
0.243
0.027
0.001
∴X的数学期望E(X)=3×0.1=0.3.
PAGE第二节 用样本估计总体
1.常用统计图表
(1)频率分布表的画法:
第一步:求极差,决定组数和组距,组距=;
第二步:分组,通常对组内数值所在区间取左闭右开区间,最后一组取闭区间;
第三步:登记频数,计算频率,列出频率分布表.
(2)频率分布直方图:反映样本频率分布的直方图.
如图所示:
横轴表示样本数据,纵轴表示,每个小矩形的面积表示样本落在该组内的频率.
(3)茎叶图的画法:
第一步:将每个数据分为茎(高位)和叶(低位)两部分;
第二步:将最小茎与最大茎之间的数按大小次序排成一列,写在左(右)侧;
第三步:将各个数据的叶依次写在其茎的右(左)侧.
2.样本的数字特征
(1)众数、中位数、平均数:
数字特征
定义与求法
优点与缺点
众数
一组数据中重复出现次数最多的数
通常用于描述变量的值出现次数最多的数,但显然它对其他数据信息的忽视使得无法客观地反映总体特征
中位数
把一组数据按大小顺序排列,处在最中间位置的一个数据(或两个数据的平均数)
是样本数据所占频率的等分线,它不受少数几个极端值的影响,这在某些情况下是优点,但它对极端值的不敏感有时也会成为缺点
平均数
如果有n个数据x1,x2,…,xn,那么这n个数的平均数x=(x1+x2+…+xn)
平均数和每一个数据有关,可以反映样本数据全体的信息,但平均数受数据中极端值的影响较大,使平均数在估计总体时可靠性降低
(2)标准差、方差:
①标准差:表示样本数据到平均数的一种平均距离,一般用s表示,
s=.
②方差:标准差的平方s2叫做方差.
s2=[(x1-)2+(x2-)2+…+(xn-)2],其中xi(i=1,2,3,…,n)是样本数据,n是样本容量,是样本平均数.
1.频率分布直方图中的常见结论
(1)众数的估计值为最高矩形的中点对应的横坐标.
(2)平均数的估计值等于频率分布直方图中每个小矩形的面积乘小矩形底边中点的横坐标之和.
(3)中位数的估计值的左边和右边的小矩形的面积和是相等的.
2.平均数、方差的公式推广
(1)若数据x1,x2,…,xn的平均数为,则mx1+a,mx2+a,mx3+a,…,mxn+a的平均数是m+a.
(2)若数据x1,x2,…,xn的方差为s2,则数据ax1+b,ax2+b,…,axn+b的方差为a2s2.
1.(基本能力:频率分布表)某便利店记录了100天某商品的日需求量(单位:件),整理得下表:
日需求量n/件
14
15
16
18
20
频率
0.1
0.2
0.3
0.2
0.2
试估计该商品日平均需求量为(  )
A.16件  
B.16.2件 
 
C.16.6件 
 
D.16.8件
答案:D
2.(基础知识:平均数与方差)甲、乙两名篮球运动员5场比赛得分的原始记录如茎叶图所示,若甲、乙两人的平均得分分别为甲,乙,则下列结论正确的是(  )
A.甲<乙,乙比甲得分稳定
B.甲>乙,甲比乙得分稳定
C.甲>乙,乙比甲得分稳定
D.甲<乙,甲比乙得分稳定
答案:A
3.(基础知识:样本方差的计算)已知一个样本中的数据为1,2,3,4,5,则该样本的方差为(  )
A.1
B.2
C.3
D.4
答案:B
4.(基础知识:中位数和平均数)若某校高一年级8个班参加合唱比赛的得分如茎叶图所示,则这组数据的中位数和平均数分别是(  )
A.91.5和91.5
B.91.5和92
C.91和91.5
D.92和92
答案:A
5.(基本应用:频率分布直方图)某校100名学生期中考试数学成绩的频率分布直方图如图所示,其中成绩分组区间是:[50,60),[60,70),[70,80),[80,90),[90,100],则图中a的值为________.
答案:0.005
题型一 频率分布直方图 
    
         
[典例剖析]
类型
1 作频率分布直方图
[例1] 某家庭记录了未使用节水龙头50天的日用水量数据(单位:m3)和使用了节水龙头50天的日用水量数据,得到频数分布表如下:
未使用节水龙头50天的日用水量频数分布表
日用水量
[0,0.1)
[0.1,0.2)
[0.2,0.3)
[0.3,0.4)
[0.4,0.5)
[0.5,0.6)
[0.6,0.7)
频数
1
3
2
4
9
26
5
使用了节水龙头50天的日用水量频数分布表
日用水量
[0,0.1)
[0.1,0.2)
[0.2,0.3)
[0.3,0.4)
[0.4,0.5)
[0.5,0.6)
频数
1
5
13
10
16
5
(1)在下图中作出使用了节水龙头50天的日用水量数据的频率分布直方图;
(2)估计该家庭使用节水龙头后,日用水量小于0.35
m3的概率.
解析:(1)如图所示.
(2)根据以上数据,该家庭使用节水龙头后50天日用水量小于0.35
m3的频率约为0.2×0.1+1×0.1+2.6×0.1+2×0.05=0.48,
因此该家庭使用节水龙头后,日用水量小于0.35
m3的概率的估计值为0.48.
类型
2 应用频率分布直方图估计总体
[例2] (2020·山西四校联考)某学校组织学生参加数学测试,成绩的频率分布直方图如图所示,数据的分组依次为[20,40),[40,60),[60,80),[80,100].若低于60分的人数是15,则该班的学生人数是(  )
A.45
B.50
C.55
D.60
解析:∵[20,40),[40,60)的频率和为(0.005+0.01)×20=0.3,
∴该班的学生人数是=50.
答案:B
方法总结?
1.直方图能够很容易地表示大量数据,非常直观地表明数据分布的形状,使我们能够看到在分布表中看不清楚的数据模式.
2.频率、频数、样本容量的计算方法:
(1)×组距=频率.
(2)=频率,=样本容量,样本容量×频率=频数.
3.利用频率分布直方图估计样本的数字特征的思路:
(1)中位数:在频率分布直方图中,中位数左边和右边的直方图的面积应该相等,由此可以估计中位数的值.
(2)平均数:平均数的估计值等于频率分布直方图中每个小矩形的面积乘小矩形底边中点的横坐标之和.
(3)众数:在频率分布直方图中,众数是最高矩形的底边中点的横坐标.  ?
[题组突破]
1.港珠澳大桥是中国境内一座连接香港、珠海和澳门的桥隧工程,桥隧全长55
km.桥面为双向六车道高速公路,大桥通行限速100
km/h,现对大桥某路段上1
000辆汽车的行驶速度进行抽样调查,据此画出频率分布直方图(如图所示),根据直方图估计在此路段上汽车行驶速度在区间[85,90)内的车辆数和汽车行驶速度超过90
km/h的频率分别为(  )
A.300,0.25
B.300,0.35
C.60,0.25
D.60,0.35
解析:由频率分布直方图得,在此路段上汽车行驶速度在区间[85,90)内的频率为0.06×5=0.3,
所以在此路段上汽车行驶速度在区间[85,90)内的车辆数为0.3×1
000=300,
汽车行驶速度超过90
km/h的频率为(0.05+0.02)×5=0.35.
答案:B
2.从某小区抽取100户居民进行月用电量调查,发现其用电量都在50至350度之间,频率分布直方图如图所示.
①直方图中x的值为________;
②在这些用户中,月用电量落在区间[100,250)内的户数为________.
解析:①由频率分布直方图知数据落在[200,250)内的频率为1-(0.002
4+0.003
6+0.006
0+0.002
4+0.001
2)×50=0.22,于是x==0.004
4.
②因为数据落在[100,250)内的频率为(0.003
6+0.006
0+0.004
4)×50=0.7,所以所求户数为0.7×100=70.
答案:①0.004
4 ②70
题型二 茎叶图及应用 
[典例剖析]
[典例] 某市旅游局为了进一步开发旅游资源,需要了解游客的情况,以便制定相应的策略.在某月中随机抽取甲、乙两个景点各10天的游客数,画出茎叶图如图所示,若景点甲中的数据的中位数是126,景点乙中的数据的平均数是124.
(1)求x,y的值;
(2)若将图中景点甲中的数据作为该景点较长一段时期内的样本数据(视样本频率为概率),现从这段时间内任取4天,记其中游客数不低于125的天数为ξ,求概率P(ξ≤2);
(3)现从上图的共20天的数据中任取2天的数据(甲、乙两景点中各取1天),记其中游客数不低于115且不高于135的天数为η,求η的分布列和期望.
解析:(1)由题知x>4,且=126,所以x=5.
=124,所以y=4.
(2)由题意知,景点甲每一天的游客数不低于125的概率为=,任取4天,即是进行了4次独立重复试验,其中有ξ次发生,故随机变量ξ服从二项分布,则P(ξ≤2)=C+C+C=.
(3)从茎叶图中看出:景点甲的数据中符合条件的有3天,景点乙的数据中符合条件的有7天,所以在景点甲中被选出的概率为,在景点乙中被选出的概率为.
由题意知,η的所有可能取值为0,1,2.
则P(η=0)=×=,P(η=1)=×+×=,
P(η=2)=×=.
所得分布列为
η
0
1
2
P
E(η)=0×+1×+2×=1.
方法总结?
茎叶图的使用策略
(1)茎叶图的绘制需注意:
①“叶”的位置只有一个数字,而“茎”的位置的数字位数一般不需要统一;
②重复出现的数据要重复记录,不能遗漏,特别是“叶”的位置上的数据.
(2)茎叶图通常用来记录两位数的数据,可以用来分析单组数据,也可以用来比较两组数据,通过茎叶图可以确定数据的中位数,数据大致集中在哪个茎,数据是否关于该茎对称,数据分布是否均匀等.  ?
[对点训练]
 (2021·河北石家庄教学质量检测)某学校A、B两个班的兴趣小组在一次对抗赛中的成绩如茎叶图所示,通过茎叶图比较两个班兴趣小组成绩的平均值及标准差.
①A班兴趣小组的平均成绩高于B班兴趣小组的平均成绩;
②B班兴趣小组的平均成绩高于A班兴趣小组的平均成绩;
③A班兴趣小组成绩的标准差大于B班兴趣小组成绩的标准差;
④B班兴趣小组成绩的标准差大于A班兴趣小组成绩的标准差.
其中正确结论的编号为(  )
A.①④
B.②③
C.②④
D.①③
解析:A班兴趣小组的平均成绩为
=78,
其方差为×[(53-78)2+(62-78)2+…+(95-78)2]=121.6,
则其标准差为≈11.03;
B班兴趣小组的平均成绩为
=66,
其方差为×[(45-66)2+(48-66)2+…+(91-66)2]=175.2,
则其标准差为≈13.24.
综上可知,结论①④正确.
答案:A
题型三 用样本的数字特征估计总体 
    
      
[典例剖析]
[典例] (1)为比较甲、乙两地某月14时的气温状况,随机选取该月中的5天,将这5天中14时的气温数据(单位:℃)制成如图所示的茎叶图,考虑以下结论:
①甲地该月14时的平均气温低于乙地该月14时的平均气温;
②甲地该月14时的平均气温高于乙地该月14时的平均气温;
③甲地该月14时的气温的标准差小于乙地该月14时的气温的标准差;
④甲地该月14时的气温的标准差大于乙地该月14时的气温的标准差.
其中根据茎叶图能得到的统计结论的编号为(  )
A.①③
B.①④
C.②③
D.②④
解析:由题中茎叶图,知甲==29,
s=×[(26-29)2+(28-29)2+(29-29)2+(31-29)2+(31-29)2]=,
则s甲==;
乙==30,
s=×[(28-30)2+(29-30)2+(30-30)2+(31-30)2+(32-30)2]=2,则s乙=,
所以甲<乙,s甲>s乙.
答案:B
(2)甲、乙两名射击运动员参加某大型运动会的预选赛,他们分别射击了5次,成绩如下表(单位:环):

10
8
9
9
9

10
10
7
9
9
如果甲、乙两人中只有1人入选,则入选的最佳人选应是________.
解析:由题可得甲=乙=9,
又∵s=×[(9-10)2+(9-8)2+(9-9)2+(9-9)2+(9-9)2]=,
s=×[(9-10)2+(9-10)2+(9-7)2+(9-9)2+(9-9)2]=>s,
∴甲的成绩更稳定,故入选的最佳人选应是甲.
答案:甲
方法总结?
1.用样本估计总体时,样本的平均数、标准差只是总体的平均数、标准差的近似值.实际应用时,需先计算样本数据的平均数,分析平均水平,再计算方差(标准差)分析稳定情况.
2.若给出图形,一方面可以由图形得到相应的样本数据,再计算平均数、方差(标准差);另一方面,可以从图形直观分析样本数据的分布情况,大致判断平均数的范围,并利用数据的波动性大小比较方差(标准差)的大小.  ?
[对点训练]
 在某地区某高传染性病毒流行期间,为了建立指标显示疫情已受控制,以便向该地区居民显示可以正常生活,有公共卫生专家建议的指标是“连续7天每天新增感染人数不超过5人”,根据连续7天的新增病例数计算,下列各选项中,一定符合上述指标的是(  )
①平均数≤3;
②标准差s≤2;
③平均数≤3且标准差s≤2;
④平均数≤3且极差小于或等于2;
⑤众数等于1且极差小于或等于1.
A.①②
B.③④
C.③④⑤
D.④⑤
解析:①错.举反例:0,0,0,0,0,0,7;其平均数≤3,但不符合上述指标;
②错.举反例:7,7,7,7,7,7,7;其标准差s=0≤2,但不符合上述指标;
③错.举反例:0,3,3,3,3,3,6;其平均数≤3且标准差s≤2,但不符合上述指标;
④对.若极差小于2,显然符合上述指标;若极差小于或等于2,有可能(a)0,1,2;(b)1,2,3;(c)2,3,4;(d)3,4,5;(e)4,5,6.
在平均数≤3的条件下,只有(a)(b)(c)成立,符合上述指标;
⑤对.在众数等于1且极差小于或等于1的条件下,则最大数不超过5,符合指标.
答案:D
eq
\a\vs4\al(
再研高考\x(创新思维))
1.(2020·高考海南卷)(多选题)我国新冠肺炎疫情进入常态化,各地有序推进复工复产,下面是某地连续11天复工复产指数折线图,下列说法正确的是(  )
A.这11天复工指数和复产指数均逐日增加
B.这11天期间,复产指数增量大于复工指数的增量
C.第3天至第11天复工复产指数均超过80%
D.第9天至第11天复产指数增量大于复工指数的增量
答案:CD
2.(2020·高考全国卷Ⅲ)在一组样本数据中,1,2,3,4出现的频率分别为p1,p2,p3,p4,且i=1,则下面四种情形中,对应样本的标准差最大的一组是(  )
A.p1=p4=0.1,p2=p3=0.4
B.p1=p4=0.4,p2=p3=0.1
C.p1=p4=0.2,p2=p3=0.3
D.p1=p4=0.3,p2=p3=0.2
解析:X的可能取值为1,2,3,4,四种情形的数学期望E(X)=1×p1+2×p2+3×p3+4×p4都为2.5,方差D(X)=[1-E(X)]2×p1+[2-E(X)]2×p2+[3-E(X)]2×p3+[4-E(X)]2×p4,标准差为.
选项A的方差D(X)=0.65;选项B的方差D(X)=1.85;
选项C的方差D(X)=1.05;选项D的方差D(X)=1.45.
可知选项B的情形对应样本的标准差最大.
答案:B
3.(2019·高考全国卷Ⅱ)演讲比赛共有9位评委分别给出某选手的原始评分,评定该选手的成绩时,从9个原始评分中去掉1个最高分、1个最低分,得到7个有效评分.7个有效评分与9个原始评分相比,不变的数字特征是(  )
A.中位数 
 B.平均数
C.方差   D.极差
解析:中位数是将9个数据从小到大或从大到小排列后,处于中间位置的数据,因而去掉1个最高分和1个最低分,不变的是中位数,平均数、方差、极差均受影响.
答案:A
4.(2018·高考全国卷Ⅰ)某地区经过一年的新农村建设,农村的经济收入增加了一倍,实现翻番.为更好地了解该地区农村的经济收入变化情况,统计了该地区新农村建设前后农村的经济收入构成比例,得到如下饼图:
则下面结论中不正确的是(  )
A.新农村建设后,种植收入减少
B.新农村建设后,其他收入增加了一倍以上
C.新农村建设后,养殖收入增加了一倍
D.新农村建设后,养殖收入与第三产业收入的总和超过了经济收入的一半
解析:设新农村建设前,农村的经济收入为a,则新农村建设后,农村经济收入为2a.新农村建设前后,各项收入的对比如下表:
新农村建设前
新农村建设后
新农村建设后变化情况
结论
种植收入
60%a
37%×2a=74%a
增加
A错
其他收入
4%a
5%×2a=10%a
增加一倍以上
B对
养殖收入
30%a
30%×2a=60%a
增加了一倍
C对
养殖收入+第三产业收入
(30%+6%)a=36%a
(30%+28%)×2a=116%a
超过经济收入2a的一半
D对
答案:A
eq
\a\vs4\al(
素养升华\x(用样本估计总体))
1.据2020年8月12日国家邮政局网站消息,1~7月份邮政行业业务总量完成10
497.9亿元,同比增长23.79%;业务收入完成5
909.5亿元,增长11.77%.其中,快递业务量完成408.2亿件,同比增长13.66%,超过2017年全年业务量400.6亿件;快递业务收入完成4
547.1亿元,增长13.53%.某省邮政局统计了该省1~7月份快递业务量,并绘制了如图所示的统计图.根据此图,下列结论错误的是(  )
A.2月份城市地区和农村地区快递业务总量比1月份有明显下降
B.从2月份起,农村地区快递业务量逐月增长
C.3~7月份,城市地区快递业务量平均增长量高于农村地区
D.从2月份起,农村地区快递业务量增长幅度最大的是3月份
解析:对于选项A,2月份快递业务总量显然低于1月份的,所以选项A正确;
对于选项B,从2月份起,农村地区快递业务量逐月增长,所以选项B正确;
对于选项C,3~7月份,农村地区快递业务量平均增长量要高于城市地区,所以选项C错误;
对于选项D,从2月份起,3月份农村地区快递业务量增长幅度几乎为100%,而其他月份的增长幅度均比3月份的增长幅度要小很多,所以选项D正确.
答案:C
2.“搜索指数”是网民通过搜索引擎,以每天搜索关键词的次数为基础所得到的统计指标.“搜索指数”越大,表示网民对该关键词的搜索次数越多,对该关键词相关的信息关注度也越高.2018年9月到2019年2月这半年中,某个关键词的搜索指数变化的走势图如图所示.
根据该走势图,下列结论正确的是(  )
A.这半年中,网民对该关键词相关的信息关注度呈周期性变化
B.这半年中,网民对该关键词相关的信息关注度不断减弱
C.从网民对该关键词的搜索指数来看,2018年10月份的方差小于11月份的方差
D.从网民对该关键词的搜索指数来看,2018年12月份的平均值大于2019年1月份的平均值
解析:对于选项A,并无周期变化.故选项A错误;
对于选项B,并不是不断减弱,中间有增强.故选项B错误;
对于选项C,2018年10月份的波动幅度大于11月份,所以方差要大.故选项C错误;
对于选项D,由题图可知,2018年12月份起到2019年1月份有下降的趋势,所以2018年12月份的平均值大于2019年1月份的平均值.故选项D正确.
答案:D
PAGE第一节 随机抽样
1.简单随机抽样
(1)定义:设一个总体含有N个个体.从中逐个不放回地抽取n个个体作为样本(n≤N),如果每次抽取时总体内各个个体被抽到的机会都相等,就把这种抽样方法叫做简单随机抽样.
(2)常用方法:抽签法和随机数法.
2.系统抽样
(1)定义:在抽样时,将总体分成均衡的几个部分,然后按照预先定出的规则,从每一部分抽取一个个体,得到所需要的样本,这种抽样叫做系统抽样(也称为机械抽样).
(2)适用范围:适用于总体中的个数较多时.
3.分层抽样
(1)定义:在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本,这种抽样方法是一种分层抽样.
(2)适用范围:适用于总体由差异明显的几部分组成时.
1.一条规律
三种抽样方法的共同点都是等概率不放回抽样.若样本容量为n,总体的个体数为N,则用这三种方法抽样时,每个个体被抽到的概率都是.
2.三种抽样方法的差异
(1)简单随机抽样:总体容量较少,尤其是样本容量较少.
(2)系统抽样:适用于元素个数很多且均衡的总体.
(3)分层抽样:适用于总体由差异明显的几部分组成的情形.
1.(基础知识:抽样的概念)2019年4月13日,某中学初三650名学生参加了中考体育测试,为了了解这些学生的体考成绩,现从中抽取了50名学生的体考成绩进行了分析,以下说法正确的是(  )
A.这50名学生是总体的一个样本
B.每位学生的体考成绩是个体
C.50名学生是样本容量
D.650名学生是总体
答案:B
2.(基础知识:分层抽样)某工厂生产A,B,C三种不同型号的产品,产品的数量之比依次为3∶4∶7,现在用分层抽样的方法抽出容量为n的样本,样本中A型号产品有15件,那么样本容量n为(  )
A.50
B.60
C.70
D.80
答案:C
3.(基本方法:随机数法抽样)假设从高一年级全体同学(500人)中随机抽出60人参加一项活动,利用随机数法抽取样本时,先将500名同学按000,001,…,499进行编号,如果从随机数表第8行第11列的数开始,按三位数连续向右读取,最先抽出的5名同学的号码是(下面摘取了此随机数表第7行和第8行)(  )
84421 75331 57245 50688 77047 44767 21763 35025 83921 20676
63016 37859 16955 56719 98105 07175 12867 35807 44395 23879
A.455 068 047 447 176
B.169 105 071 286 443
C.050 358 074 439 332
D.447 176 335 025 212
答案:B
4.(基本能力:系统抽样)设某校共有112名教师,为了支援西部教育事业,现要从中抽取12名组成暑期西部讲师团.若用系统抽样法,则抽样间隔和随机剔除的个体数分别为(  )
A.9,4
B.12,3
C.10,2
D.8,2
答案:A
5.(基本应用:分层抽样)(2018·高考全国卷Ⅲ)某公司有大量客户,且不同年龄段客户对其服务的评价有较大差异.为了解客户的评价,该公司准备进行抽样调查,可供选择的抽样方法有简单随机抽样、分层抽样和系统抽样,则最合适的抽样方法是________.
答案:分层抽样
题型一 简单随机抽样 
1.下列抽取样本的方式属于简单随机抽样的有(  )
①从无限多个个体中抽取100个个体作为样本;
②盒子里共有80个零件,从中选出5个零件进行质量检验.在抽样操作时,从中任意拿出一个零件进行质量检验后再把它放回盒子里;
③从20件玩具中一次性抽取3件进行质量检验;
④某班有56名同学,指定个子最高的5名同学参加学校组织的篮球赛.
A.0个
B.1个
C.2个
D.3个
解析:①不是简单随机抽样,因为被抽取样本的总体的个数是无限的,而不是有限的;②不是简单随机抽样,因为它是有放回抽样;③不是简单随机抽样,因为这是“一次性”抽取,而不是“逐个”抽取;④不是简单随机抽样,因为不是等可能抽样.
答案:A
2.下列抽样试验中,适合用抽签法的有________.(填序号)
①从某厂生产的5
000件产品中抽取600件进行质量检验;
②从某厂生产的两箱(每箱18件)产品中抽取6件进行质量检验;
③从甲、乙两厂生产的两箱(每箱18件)产品中抽取6件进行质量检验;
④从某厂生产的5
000件产品中抽取10件进行质量检验.
解析:①④中总体的个体数较大,不适合用抽签法;③中甲、乙两厂生产的产品质量可能差别较大,因此未达到搅拌均匀的条件,也不适合用抽签法;②中总体容量和样本容量都较小,且同厂生产的产品可视为搅拌均匀了.
答案:②
3.假设要考察某公司生产的500克袋装牛奶的三聚氰胺是否超标,现从800袋牛奶中抽取60袋进行检验,利用随机数表抽取样本时,先将800袋牛奶按000,001,…,799进行编号,如果从随机数表第7行第8列的数开始向右读,则得到的第4个样本个体的编号是________.(下面摘取了随机数表第7行至第9行)
87 42 17 53 31 57 24 55 06 88 77 04 74
47 67 21 76 33 50 25 83 92 12 06 76
63 01 63 78 59 16 95 56 67 19 98 10 50
71 75 12 86 73 58 07 44 39 52 38 79
33 21 12 34 29 78 64 56 07 82 52 42 07
44 38 15 51 00 13 42 99 66 02 79 54
解析:由随机数表,可以看出前4个样本个体的编号是331,572,455,068,所以第4个样本个体的编号是068.
答案:068
方法总结?
1.能否用简单随机抽样,要注意
(1)抽取的个体数较少.
(2)是逐个抽取.
(3)是不放回抽取.
(4)是等可能抽取.
只有四个特点都满足的抽样才是简单随机抽样.
2.抽签法与随机数法的适用情况
(1)抽签法适用于总体中个体数较少的情况,随机数法适用于总体中个体数较多的情况.
(2)一个抽样试验能否用抽签法,关键看两点:
一是抽签是否方便;二是号签是否易搅匀.一般地,当总体容量和样本容量都较小时可用抽签法.  
题型二 系统抽样 
    
         
1.(2021·河北石家庄模拟)某校为了解1
000名高一新生的身体生长状况,用系统抽样法(按等距的规则)抽取40名同学进行检查,将学生从1~1
000进行编号,现已知第18组抽取的号码为443,则第一组用简单随机抽样抽取的号码为(  )
A.16      
B.17
C.18
D.19
解析:因为从1
000名学生中抽取一个容量为40的样本,所以系统抽样的分段间隔为=25,
设第一组随机抽取的号码为x,
则抽取的第18组编号为x+17×25=443,所以x=18.
答案:C
2.(2021·四川成都模拟)将参加冬季越野跑的600名选手编号为001,002,…,600,采用系统抽样方法抽取一个容量为50的样本,把编号分为50组后,在第一组的001到012这12个编号中随机抽得的号码为004,这600名选手穿着三种颜色的衣服,从001到301穿红色衣服,从302到496穿白色衣服,从497到600穿黄色衣服,则抽到穿白色衣服的选手人数为________.
解析:由题意及系统抽样的定义可知,将这600名选手按编号依次分成50组,每一组各有12名选手,第k(k∈N
)组抽中的号码是4+12(k-1).令302≤4+12(k-1)≤496,得25≤k≤42,因此抽到穿白色衣服的选手人数为42-25=17.
答案:17
3.一个总体中有90个个体,随机编号为0,1,2,…,89,按从小到大的编号顺序平均分成9个小组,组号依次为1,2,3,…,9.现抽取一个容量为9的样本,规定如果在第1组随机抽取的号码为m,那么在第k组中抽取的号码个位数字与m+k的个位数字相同.若m=8,则在第8组中抽取的号码是________.
解析:由题意知,m=8,k=8,则m+k=16.也就是第8组抽取的号码个位数字为6,十位数字为8-1=7,故在第8组中抽取的号码为76.
答案:76
方法总结?
1.系统抽样中所抽取编号的特点
系统抽样又称等距抽样,所以依次抽取的样本对应的号码就是一个等差数列,首项就是第1组所抽取样本的号码,公差为间隔数,根据等差数列的通项公式就可以确定每一组内所要抽取的样本号码.
2.抽样间隔不是整数的处理策略
系统抽样时,如果总体中的个数不能被样本容量整除时,可以先用简单随机抽样从总体中剔除几个个体,然后再按系统抽样进行.  ?
题型三 分层抽样 
    
         
[典例剖析]
类型
1 简单计算
[例1] (1)(2021·云南昆明检测)某公司员工对户外运动分别持“喜欢”“不喜欢”和“一般”三种态度,其中持“一般”态度的比持“不喜欢”态度的多12人,按分层抽样方法从该公司全体员工中选出部分员工座谈户外运动,如果选出的人有6位对户外运动持“喜欢”态度,有1位对户外运动持“不喜欢”态度,有3位对户外运动持“一般”态度,那么这个公司全体员工中对户外运动持“喜欢”态度的有(  )
A.36人
B.30人
C.24人
D.18人
解析:设公司员工对户外运动持“喜欢”“不喜欢”“一般”态度的人数分别为6x,x,3x,由题意可得3x-x=12,x=6,所以对户外运动持“喜欢”态度的有6×6=36(人).
答案:A
(2)某学校共有师生3
200人,现用分层抽样的方法,从所有师生中抽取一个容量为160的样本,已知从学生中抽取的人数为150,那么该学校的教师人数是________.
解析:本题属于分层抽样,设该学校的教师人数为x,所以=,所以x=200.
答案:200
类型
2 分层抽样与概率综合
[例2] 设甲、乙、丙三个乒乓球协会的运动员人数分别为27,9,18,现采用分层抽样的方法从这三个协会中抽取6名运动员组队参加比赛.
(1)求应从这三个协会中分别抽取的运动员的人数;
(2)将抽取的6名运动员进行编号,编号分别为A1,A2,A3,A4,A5,A6.现从这6名运动员中随机抽取2人参加双打比赛,设A为事件“编号为A5和A6的两名运动员中至少有1人被抽到”,求事件A发生的概率.
解析:(1)应从甲、乙、丙三个协会中抽取的运动员人数分别为3,1,2.
(2)从6名运动员中随机抽取2人参加双打比赛的所有可能结果为:
(A1,A2),(A1,A3),(A1,A4),(A1,A5),(A1,A6),(A2,A3),(A2,A4),(A2,A5),(A2,A6),(A3,A4),(A3,A5),(A3,A6),(A4,A5),(A4,A6),(A5,A6),共15种.
事件A包含:(A1,A5),(A1,A6),(A2,A5),(A2,A6),(A3,A5),(A3,A6),(A4,A5),(A4,A6),(A5,A6),共9个基本事件.
因此事件A发生的概率P(A)==.
方法总结?
解决分层抽样问题的关键
先确定抽样比,然后把各层个体数乘抽样比,即得各层要抽取的个体数.常用公式:
(1)抽样比==;
(2)层1的容量∶层2的容量∶层3的容量=样本中层1的容量∶样本中层2的容量∶样本中层3的容量.  ?
[题组突破]
1.某市电视台为调查节目收视率,从全市3个区用分层抽样的方法抽取一个容量为n的样本,已知3个区人口数之比为2∶3∶5,如果从人口最多的一个区抽出60人,那么这个样本的容量等于(  )
A.96
B.120
C.180
D.240
解析:因为3个区人口数之比为2∶3∶5,所以第三个区所抽取的人口数最多,所占比例为50%.又因为从此区抽取60人,所以三个区所抽取的总人口数为60÷50%=120,即这个样本的容量等于120.
答案:B
2.某工厂生产甲、乙、丙、丁四种不同型号的产品,产量分别为200,400,300,100件.为检验产品的质量,现用分层抽样的方法从以上所有的产品中抽取60件进行检验,则应从丙种型号的产品中抽取________件.
解析:∵==,
∴应从丙种型号的产品中抽取×300=18(件).
答案:18
eq
\a\vs4\al(
重温经典\x(传统文化中的抽样方法))
(2020·吉林百校联盟高三联考)分层抽样是将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,组成一个样本的抽样方法.在《九章算术》第三章“衰分”中有如下问题:“今有甲持钱五百六十,乙持钱三百五十,丙持钱一百八十,凡三人俱出关,关税百钱.欲以钱多少衰出之,问各几何?”其译文为:今有甲持560钱,乙持350钱,丙持180钱,甲、乙、丙三人一起出关,关税共100钱,要按照各人带钱多少的比例进行交税,问三人各应付多少税?下列说法错误的有(  )
①甲应付51钱;②乙应付32钱;③丙应付16钱;④三者中甲付的钱最多,丙付的钱最少.
A.0个
B.1个
C.2个
D.3个
解析:依题意,抽样比为=.
由分层抽样知识可知,甲应付×560=51钱,故①正确;
乙应付×350=32钱,故②不正确;
丙应付×180=16钱,故③正确.
显然51>32>16,④正确.
答案:B
eq
\a\vs4\al(
素养升华\x(分层抽样的创新应用))
从某学校所有高一学生某次计算机笔试成绩中选出40名学生的成绩(单位:分),成绩分组区间为[50,70),[70,90),[90,110),[110,130),[130,150],由此绘制成如图所
示的频率分布直方图,规定成绩低于90分为不及格,成绩不低于90分为及格.
(1)求频率分布直方图中m的值;
(2)求这40名学生中不及格的学生人数;
(3)从不及格的学生中按成绩用分层抽样的方法任选5人,再从这5人中任选2人,求这2人的成绩均在[70,90)内的概率.
解析:(1)由题中频率分布直方图知,组距为20,由×20=1,
解得m=0.005.
(2)这40名学生中不及格的学生人数为×0.005×20×40=10.
(3)按成绩分层抽样,则从成绩在[50,70),[70,90)的学生中应选取的人数分别为×5=2,×5=3,记成绩在[50,70)内的2人分别为A1,A2,成绩在[70,90)内的3人分别为B1,B2,B3,“2人的成绩均在[70,90)内”为事件A,则从这5人中任选2人的基本事件有(A1,A2),(A1,B1),(A1,B2),(A1,B3),(A2,B1),(A2,B2),(A2,B3),(B1,B2),(B1,B3),(B2,B3),共10个.
其中这2人的成绩都在[70,90)内的基本事件有(B1,B2),(B1,B3),(B2,B3),共3个.
故所求概率P(A)=.
PAGE

展开更多......

收起↑

资源列表