2022届高考数学一轮复习第十章算法初步统计统计案例学案理含解析(4份打包)北师大版

资源下载
  1. 二一教育资源

2022届高考数学一轮复习第十章算法初步统计统计案例学案理含解析(4份打包)北师大版

资源简介

算法初步、统计、统计案例
第一节 算法初步
命题分析预测
学科核心素养
从近五年的考查情况来看,本节是高考的必考内容,一般以选择题、填空题的形式出现,难度中等偏下.主要的命题角度有选择结构与分段函数相结合,求循环结构的输入、输出值,补全程序框图等.
本节通过算法流程图及其应用考查考生的数学运算和逻辑推理核心素养.
授课提示:对应学生用书第233页
知识点 算法与算法流程图
1.算法
(1)算法通常是指按照一定规则解决某一类问题的明确和有限的步骤.
(2)应用:算法通常可以编成计算机程序,让计算机执行并解决问题.
2.算法流程图
定义:流程图又称程序框图,是一种用程序框、流程线及文字说明来表示算法的图形.
3.三种基本逻辑结构
名称内容  
顺序结构
选择结构
循环结构
定义
由若干个依次执行的步骤组成,这是任何一个算法都离不开的基本结构
算法的流程根据条件是否成立有不同的流向,条件结构就是处理这种过程的结构
从某处开始,按照一定的条件反复执行某些步骤的情况,反复执行的步骤称为循环体
算法流程图
?
温馨提醒
?
1.易混淆处理框与输入框,处理框主要是赋值、计算,而输入框只是表示一个算法输入的信息.
2.易忽视循环结构中必有选择结构,其作用是控制循环进程,避免进入“死循环”,是循环结构必不可少的一部分.
1.(2021·唐山摸底)如图所示的算法流程图的功能是(  )
A.求1-+-+…-的值
B.求1++++…+的值
C.求1++++…+的值
D.求1-+-+…+的值
解析:输入a=1,n=1,S=0;S=1,a=-1,n=3;S=1-,a=1,n=5;S=1-+,a=-1,n=7;S=1-+-,a=1,n=9;…;S=1-+-+…-,a=1,n=21,21>19,退出循环.输出S=1-+-+…-.
答案:A
2.执行如图所示的算法流程图,则输出S的值为________.
解析:按照算法流程图依次循环运算,当k=5时,停止循环,当k=5时,S=sin=.
答案:
3.(易错题)若[x]表示不超过x的最大整数,执行如图所示的算法流程图,则输出S的值为________.
解析:由算法流程图可以看出,当n=8时,S>6时,算法结束,故输出S=[]+[]+[]+[]+[]=7.
答案:7
授课提示:对应学生用书第234页
题型一 算法流程图输出结果问题  
1.(2020·高考全国卷Ⅰ)执行下面的程序框图,则输出的n=(  )
A.17         
B.19
C.21
D.23
解析:由程序框图可知S=1+3+5+…+(2m-1)=m2(m∈N+),由S>100,得m>10(m∈N+),故当m=11时循环结束,输出的值为n=2m-1=21.
答案:C
2.(2021·哈尔滨六中期中测试)执行如图所示的算法流程图,若输出的结果是,则输入的a为(  )
A.3
B.6
C.5
D.4
解析:第1次循环,n=1,S=;第2次循环,n=2,S=+;第3次循环,n=3,S=++;第4次循环,n=4,S=+++=.因为输出的结果为,所以判断框的条件为n<4,所以输入的a为4.
答案:D
3.(2020·高考江苏卷)如图是一个算法流程图,若输出y的值为-2,则输入x的值是_________.
解析:由于2x>0,所以y=x+1=-2,
解得x=-3.
答案:-3
解决程序框图推结果问题要注意几个常用变量
(1)计数变量:用来记录某个事件发生的次数,如i=i+1.
(2)累加变量:用来计算数据之和,如S=S+i.
(3)累乘变量:用来计算数据之积,如p=p×i.
题型二 算法流程图的补全问题  
[例] (1)(2019·高考全国卷Ⅰ)如图是求的程序框图,图中空白框中应填入(  )
A.A=       
B.A=2+
C.A=
D.A=1+
(2)(2021·石家庄模拟)执行如图所示的算法流程图,若输出的s=25,则判断框中可填入的条件是(  )
A.i≤4
B.i≥4
C.i≤5
D.i≥5
[解析] (1)对于选项A,A=.
当k=1时,A=,
当k=2时,A=,故A正确;
经验证选项B,C,D均不符合题意.
(2)执行算法流程图,i=1,s=100-5=95;i=2,s=95-10=85;i=3,s=85-15=70;i=4,s=70-20=50;i=5,s=50-25=25;i=6,退出循环.此时输出的s=25.结合选项知,选C.
[答案] (1)A (2)C
算法流程图的补全及逆向求解问题
(1)先假设参数的判断条件满足或不满足;
(2)运行循环结构,一直到运行结果与题目要求的输出结果相同为止;
(3)根据此时各个变量的值,补全算法流程图.
[题组突破]
1.如图所示的算法流程图是为了求出满足2+++…+<2
019的最大正整数n的值,那么在中,应填入(  )
A.T<2
019
B.T≤2
019
C.T≥2
018
D.T≥2
019
解析:执行程序框图,T=0,i=1;T=0+2=2,i=2;T=2+=2+,i=3;…;T=2+++…+,i=i+1.由题中算法流程图的功能是求出满足2+++…+<2
019的最大正整数n的值,知T=2+++…+≥2
019满足判断框内成立的条件,此时结束循环.故判断框中应填T≥2
019.
答案:D
2.(2021·洛阳质检)执行如图所示的算法流程图,若输出的S=,则判断框内填入的条件不可以是(  )
A.k≤7
B.k<7
C.k≤8
D.k<8
解析:模拟执行算法流程图,可得S=0,k=0;k=2,S=;k=4,S=+;k=6,S=++;k=8,S=+++=.由题意,此时应不满足条件,退出循环,输出S的值为.结合选项可得判断框内填入的条件不可以是“k≤8”.
答案:C
 算法流程图应用中的核心素养
逻辑推理——算法与数学文化的交汇问题
1.辗转相除法:求两个正整数的最大公约数的一种方法,这种算法是由欧几里得在公元前330年左右首先提出的,因此又叫欧几里得算法.
2.更相减损术:任给两个正整数(若是偶数,先用2约数),以较大的数减较小的数,接着把所得的差与较小的数比较,并以大数减小数,直到所得的数相等为止,则这个数(等数)(或这个数与约简的数的乘积)就是所求的最大公约数.
3.秦九韶算法:我国南宋数学家秦九韶在他的代表作《数书九章》中提出的一种用于计算一元n次多项式的值的方法.
[例] 南宋数学家秦九韶在《数书九章》中提出的秦九韶算法至今仍是多项式求值比较先进的算法.已知f(x)=2
018x2
017+2
017x2
016+…+2x+1,如图所示的算法流程图是求f(x0)的值,在“?”中应填的语句是(  )
A.n=i       
B.n=i+1
C.n=2
018-i
D.n=2
017-i
[解析] 由秦九韶算法得f(x)=2
018x2
017+2
017x2
016+…+2x+1=(…((2
018x+2
017)x+2
016)x+…+2)x+1,所以算法流程图的执行框内应填写的语句是n=2
018-i.
[答案] C
本例将算法流程图与数学史有机地交融在一起,不仅考查了应用算法思想和逻辑结构分析、解决实际问题,更弘扬了数学文化,陶冶考生的情操.
[对点训练]
如图所示的算法流程图的算法思路源于我国古代数学名著《九章算术》中的“更相减损术”.执行该算法流程图,若输入的a,b分别为14,18,则输出的a=(  )
A.0
B.2
C.4
D.14
解析:第一次执行,输入a=14,b=18,因为ab,所以a=14-4=10;第三次执行,因为a=10,b=4,a>b,所以a=10-4=6;第四次执行,因为a=6,b=4,a>b,所以a=6-4=2;第五次执行,因为a=2,b=4,a答案:B
PAGE第二节 随机抽样
命题分析预测
学科核心素养
对于随机抽样,主要考查三种抽样方法,尤其是分层抽样和系统抽样,一般以选择题和填空题的形式出现.
本节通过三种抽样方法,考查考生的数据分析、逻辑推理核心素养.
授课提示:对应学生用书第237页
知识点一 简单随机抽样、分层抽样
1.简单随机抽样
(1)抽取方式:逐个不放回抽取;
(2)每个个体被抽到的概率相等;
(3)常用方法:抽签法和随机数法W.
2.分层抽样
(1)在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本,这种抽样方法是一种分层抽样.
(2)分层抽样的应用范围
当总体是由差异明显的几个部分组成时,往往选用分层抽样.
?
温馨提醒
?
1.分层抽样中,易忽视每层抽取的个体的比例是相同的,即.
2.不论哪种抽样方法,总体中的每一个个体入样的概率是相同的.
1.一段高速公路有300个太阳能标志灯,其中进口的有30个,联合研制的有75个,国产的有195个,为了掌握每个标志灯的使用情况,要从中抽取一个容量为20的样本,若采用分层抽样的方法,抽取的进口的标志灯的数量为(  )
A.2       
B.3
C.5
D.13
解析:20×=2.
答案:A
2.利用简单随机抽样,从n个个体中抽取一个容量为10的样本.若第二次抽取时,余下的每个个体被抽到的概率为,则在整个抽样过程中,每个个体被抽到的概率为(  )
A.
B.
C.
D.
解析:根据题意,=,解得n=28.故每个个体被抽到的概率为=.
答案:C
3.(2021·东北三校联考)某工厂生产甲、乙、丙三种型号的产品,产品数量之比为3∶5∶7,现用分层抽样的方法抽出容量为n的样本,其中甲种产品有18件,则样本容量n=(  )
A.54
B.90
C.45
D.126
解析:依题意得×n=18,解得n=90,即样本容量为90.
答案:B
知识点二 系统抽样
 系统抽样的步骤
假设要从容量为N的总体中抽取容量为n的样本.
(1)先将总体的N个个体编号;
(2)确定分段间隔k,对编号进行分段W.当(n是样本容量)是整数时,取k=;
(3)在第1段用简单随机抽样确定第一个个体编号l(l≤k);
(4)按照一定的规则抽取样本.通常是将l加上间隔k得到第2个个体编号(l+k),再加k得到第3个个体编号(l+2k),依次进行下去,直到获取整个样本.
?
温馨提醒
?
系统抽样中,易忽视抽取的样本数也就是分段的段数,当不是整数时,注意剔除,剔除的个体是随机的,各段入样的个体编号成等差数列.
1.在一次游戏中,获奖者可以得到5件不同的奖品,这些奖品要从由1~50编号的50种不同奖品中随机抽取确定,用系统抽样的方法为某位获奖者确定5件奖品的编号可以为(  )
A.5,15,25,35,45
B.1,3,5,7,9
C.11,22,33,44,50
D.12,15,19,23,28
解析:1~50编号依次分成5组,在第一组随机抽取一个号码,其他组依次加10即可,选项A符合要求.
答案:A
2.(易错题)某次考试结束后,从考号为1~1
000的1
000份试卷中,采用系统抽样法抽取50份试卷进行试评,则在考号区间[850,949]之中被抽到的试卷份数(  )
A.一定是5
B.可能是4
C.可能是10
D.不能具体确定
解析:样本间隔为1
000÷50=20,考号在区间[850,949]的个数为949-850+1=100,100÷20=5,所以在考号区间[850,949]之中被抽到的试卷份数一定是5.
答案:A
授课提示:对应学生用书第238页
题型一 简单随机抽样  
1.下列抽样试验中,适合用抽签法的有(  )
A.从某厂生产的5
000件产品中抽取600件进行质量检验
B.从某厂生产的两箱(每箱18件)产品中抽取6件进行质量检验
C.从甲、乙两厂生产的两箱(每箱18件)产品中抽取6件进行质量检验
D.从某厂生产的5
000件产品中抽取10件进行质量检验
解析:A,D中的总体中个体数较多,不适宜抽签法,C中甲、乙两厂的产品质量有区别,也不适宜抽签法.
答案:B
2.总体由编号为01,02,…,19,20的20个个体组成.利用下面的随机数表选取5个个体,选取方法是从随机数表第1行的第5列和第6列数字开始由左到右依次选取两个数字,则选出来的第5个个体的编号为(  )
7816
6572
0802
6314
0702
4369
9728
0198
3204
9234
4935
8200
3623
4869
6938
7481
A.08       
B.07
C.02
D.01
解析:由题意知前5个个体的编号为08,02,14,07,01.
答案:D
3.“七乐彩”的中奖号码是从分别标有1,2,…,30的30个小球中逐个不放回地摇出7个小球来按规则确定中奖情况,这种从30个号码中选7个号码的抽样方法是(  )
A.系统抽样法
B.抽签法
C.随机数法
D.其他抽样方法
解析:30个小球相当于号签,搅拌均匀后逐个不放回地抽取,是典型的抽签法.
答案:B
简单随机抽样的特点
(1)抽取的个体数较少;(2)是逐个抽取;(3)是不放回抽取;(4)是等可能抽取.只有四个特点都满足的抽样才是简单随机抽样.
题型二 系统抽样
  
1.(2019·高考全国卷Ⅰ)某学校为了解1
000名新生的身体素质,将这些学生编号为1,2,…,1
000,从这些新生中用系统抽样方法等距抽取100名学生进行体质测验.若46号学生被抽到,则下面4名学生中被抽到的是(  )
A.8号学生       
B.200号学生
C.616号学生
D.815号学生
解析:根据题意,系统抽样是等距抽样,
所以抽样间隔为=10.
因为46除以10余6,所以抽到的号码都是除以10余6的数,结合选项知应为616.
答案:C
2.(2020·贵州凯里一中检测)利用系统抽样法从编号分别为1,2,3,…,80的80件不同产品中抽出一个容量为16的样本,如果抽出的产品中有一件产品的编号为13,则抽的产品的最大编号为(  )
A.73
B.78
C.77
D.76
解析:样本的分段间隔为=5,所以13号在第三组,则最大的编号为13+(16-3)×5=78.
答案:B
3.从编号为1,2,…,59,60的60个产品中,用系统抽样的方法抽取一个样本,已知样本中最大的两个编号为51,57,则第一个入样的编号为_________.
解析:由最大的两个编号为51,57,知分段间隔为57-51=6,即共抽取了=10个产品,设第一个入样的编号为x,则x+(10-1)×6=57,解得x=3.
答案:3
题型三 分层抽样  
[例] (1)(2021·河南名校联考)《九章算术》第三章“衰分”中有如下问题:“今有甲持钱五百六十,乙持钱三百五十,丙持钱一百八十,凡三人俱出关,关税百钱,欲以钱数多少衰出之,问各几何.”其意为:今有甲带了560钱,乙带了350钱,丙带了180钱,三人一起出关,共需要交关税100钱,依照钱的多少按比例出钱,则丙应出    钱(所得结果四舍五入,保留整数).
(2)某学校三个兴趣小组的学生人数分布如下表(每名同学只参加一个小组)(单位:人).
篮球组
书画组
乐器组
高一
45
30
a
高二
15
10
20
学校要对这三个小组的活动效果进行抽样调查,按小组分层抽样的方法,从参加这三个兴趣小组的学生中抽取30人,结果篮球组被抽出12人,则a的值为_________.
[解析] (1)按照钱的多少按比例出钱,所以丙应该出钱为×100=≈17.
(2)由分层抽样得=,解得a=30.
[答案] (1)17 (2)30
分层抽样中的计算问题
分层抽样满足“=”,即“==…=或n1∶n2∶…∶n=N1∶N2∶…∶N”,据此在已知每层间的个体数量或数量比、样本容量、总体数量中的两个时,就可以求出第三个.
[题组突破]
1.某校老年、中年和青年教师的人数见下表,采用分层抽样的方法调查教师的身体状况,在抽取的样本中,青年教师有320人,则该样本中的老年教师人数为(  )
类别
人数
老年教师
900
中年教师
1
800
青年教师
1
600
合计
4
300
A.90       
B.100
C.180
D.300
解析:设该样本中的老年教师人数为x,由题意及分层抽样的特点得=,故x=180.
答案:C
2.甲、乙两套设备生产的同类型产品共4
800件,采用分层抽样的方法从中抽取一个容量为80的样本进行质量检测.若样本中有50件产品由甲设备生产,则乙设备生产的产品总数为    件.
解析:由题设,抽样比为=.
设甲设备生产的产品为x件,则=50,所以x=3
000.故乙设备生产的产品总数为4
800-3
000=1
800.
答案:1
800
 抽样方法中的核心素养
数据分析、数学运算——分层抽样的创新应用
[例] (2021·湖南四校摸底调研)某家电公司销售部门共有200名销售员,每年部门对每名销售员都有1
400万元的年度销售任务.已知这200名销售员去年的销售额都在区间[2,22](单位:百万元)内,现将其分成5组,第1组、第2组、第3组、第4组、第5组对应的区间分别为[2,6),[6,10),[10,14),[14,18),[18,22],并绘制出如下的频率分布直方图.
(1)求a的值,并计算完成年度任务的人数;
(2)用分层抽样的方法从这200名销售员中抽取容量为25的样本,求这5组分别应抽取的人数;
(3)现从(2)中完成年度任务的销售员中随机选取2名,奖励海南三亚三日游,求获得此奖励的2名销售员在同一组的概率.
[解析] (1)∵(0.02+0.08+0.09+2a)×4=1,∴a=0.03,
∴完成年度任务的人数为2×0.03×4×200=48.
(2)第1组应抽取的人数为0.02×4×25=2,
第2组应抽取的人数为0.08×4×25=8,
第3组应抽取的人数为0.09×4×25=9,
第4组应抽取的人数为0.03×4×25=3,
第5组应抽取的人数为0.03×4×25=3,
(3)在(2)中完成年度任务的销售员中,第4组有3人,记这3人分别为A1,A2,A3;第5组有3人,记这3人分别为B1,B2,B3.
从这6人中随机选取2名,所有的基本事件为A1A2,A1A3,A1B1,A1B2,A1B3,A2A3,A2B1,A2B2,A2B3,A3B1,A3B2,A3B3,B1B2,B1B3,B2B3,共有15个基本事件,
获得此奖励的2名销售员在同一组所包含的基本事件有6个,
故所求概率P==.
  解决分层抽样与样本数据分析问题的注意点
(1)弄清分层抽样问题中每层的数据.
(2)求解概率时注意概率类型的判断.
[对点训练]
(2021·重庆九校联盟模拟)某社区为了解该社区退休老人每天的平均户外活动时间,从该社会退休老人中随机抽取了100位老人进行调查,获得了每人每天的平均户外活动时间(单位:时),活动时间按照[0,0.5),[0.5,1),…,[4,4.5]分成9组,制成样本的频率分布直方图如图所示.
(1)求图中a的值;
(2)估计该社区退休老人每人每天的平均户外活动时间的中位数;
(3)在[1,1.5),[1.5,2)这两组中采用分层抽样的方法抽取7人,再从这7人中随机抽取2人,求抽取的2人恰好在同一个组的概率.
解析:(1)由频率分布直方图,可知平均户外活动时间在[0,0.5)内的频率为0.08×0.5=0.04.
同理,平均户外活动时间在[0.5,1),[1.5,2),[2,2.5),[3,3.5),[3.5,4),[4,4.5]内的频率分别为0.08,0.20,0.25,0.07,0.04,0.02,
由1-(0.04+0.08+0.20+0.25+0.07+0.04+0.02)=0.5a+0.5a,解得a=0.30.
(2)设中位数为m时.
因为前5组的频率之和为0.04+0.08+0.15+0.20+0.25=0.72>0.5,
而前4组的频率之和为0.04+0.08+0.15+0.20=0.47<0.5,所以2≤m<2.5.
所以0.50×(m-2)=0.5-0.47,解得m=2.06.
故可估计该社区退休老人每人每天的平均户外活动时间的中位数为2.06时.
(3)由题意得平均户外活动时间在[1,1.5),[1.5,2)内的人数分别为15,20,
按分层抽样的方法在[1,1.5),[1.5,2)内分别抽取3人、4人,再从7人中随机抽取2人,共有21种方法,抽取的两人恰好都在同一个组有9种方法,故抽取的2人恰好在同一个组的概率P==.
PAGE第三节 用样本估计总体
命题分析预测
学科核心素养
从近五年高考来看,主要考查利用频率分布直方图、茎叶图、样本的数字特征估计总体,各种题型都有,难度中档偏下.
本节主要通过用样本估计总体提升数据分析与数学运算及直观想象核心素养.
授课提示:对应学生用书第240页
知识点一 频率分布直方图、茎叶图
1.作频率分布直方图的步骤
(1)求极差(即一组数据中最大值与最小值的差);
(2)决定组距与组数;
(3)将数据分组;
(4)列频率分布表;
(5)画频率分布直方图W.
2.频率分布折线图和总体密度曲线
(1)频率分布折线图:连接频率分布直方图中各小长方形上端的中点,就得到频率分布折线图.
(2)总体密度曲线:随着样本容量的增加,作图时所分的组数增加,组距减小,相应的频率折线图会越来越接近于一条光滑曲线,统计中称这条光滑曲线为总体密度曲线.
3.茎叶图的优点
茎叶图的优点是不但可以保留所有信息,而且可以随时记录,这对数据的记录和表示都能带来方便.
?
温馨提醒
?
 频率分布直方图与众数、中位数与平均数的关系
(1)最高的小长方形底边中点的横坐标即是众数的估计值.
(2)中位数左边和右边的小长方形的面积和是相等的.
(3)平均数是频率分布直方图的“重心”,等于频率分布直方图中每个小长方形的面积乘以小长方形底边中点的横坐标之和.
1.学校为了解学生在课外读物方面的支出情况,抽取了n位同学进行调查,结果显示这些同学的支出都在[10,50](单位:元)之间,其频率分布直方图如图所示,其中支出在[10,30)(单位:元)内的同学有33人,则支出在[40,50](单位:元)内的同学人数为(  )
A.100       
B.120
C.30
D.300
解析:支出[10,30)的同学所占的频率为(0.01+0.023)×10=0.33,所以n==100.支出在[40,50)的同学所占的频率为1-(0.01+0.023+0.037)×10=0.3,故支出在[40,50)的同学人数是100×0.3=30.
答案:C
2.在如图所示的茎叶图所示的数据中,众数和中位数分别是(  )
A.23,26
B.31,26
C.24,30
D.26,30
解析:由茎叶图得到所有的数据从小到大排列依次为12,14,20,23,25,26,30,31,31,41,42,∴众数和中位数分别为31,26.
答案:B
3.(2021·衡水中学五调)某“跑团”为了解团队每月跑步的平均里程,收集并整理了2020年1月至2020年11月期间“跑团”每月跑步的平均里程(单位:千米)的数据,绘制了下面的折线图.
根据折线图,下列结论正确的是(  )
A.月跑步平均里程的中位数为6月份对应的平均里程数
B.月跑步平均里程逐月增加
C.月跑步平均里程高峰期大致在8月和9月
D.1月至5月的月跑步平均里程相对于6月至11月,波动性更小,变化比较平稳
解析:由折线图知,月跑步平均里程的中位数为5月份对应的平均里程数,A错;月跑步平均里程不是逐月增加的,B错;月跑步平均里程高峰期大致在9月和10月,C错.
答案:D
知识点二 样本的数字特征
1.众数、中位数、平均数
数字特征
概念
优点与缺点
众数
一组数据中重复出现次数最多的数
众数通常用于描述变量的值出现次数最多的数.但显然它对其他数据信息的忽视使它无法客观地反映总体特征
中位数
把一组数据按从小到大的顺序排列,处在中间位置的一个数据(或两个数据的平均数)
中位数等分样本数据所占频率,它不受少数几个极端值的影响,这在某些情况下是优点,但它对极端值的不敏感有时也会成为缺点
平均数
如果有n个数据x1,x2,…,xn,那么这n个数的平均数=
平均数与每一个样本数据有关,可以反映出更多的关于样本数据全体的信息,但平均数受数据中的极端值的影响较大,使平均数在估计总体时可靠性降低
2.标准差、方差
(1)标准差:样本数据到平均数的一种平均距离,一般用s表示,s=

(2)方差:标准差的平方s2
s2=[(x1-)2+(x2-)2+…+(xn-)2],其中xi(i=1,2,3,…,n)是样本数据,n是样本容量,是样本平均数.
?
温馨提醒
?
1.众数、中位数与平均数都是描述一组数据集中趋势的量,平均数是最重要的量.
2.平均数反映的是样本个体的平均水平,众数和中位数则反映样本中个体的“重心”.
1.已知样本数据3,5,7,4,6,则该样本标准差为(  )
A.1
B.
C.
D.2
解析:数据3,5,7,4,6的平均数为=×(3+5+7+4+6)=5,方差为s2=×[(3-5)2+(5-5)2+(7-5)2+(4-5)2+(6-5)2]=2,∴标准差为.
答案:B
2.(易错题)10名工人某天生产同一零件,生产的零件数分别是15,17,14,10,15,17,17,16,14,12,设其平均数为a,中位数为b,众数为c,则有(  )
A.a>b>c
B.b>c>a
C.c>a>b
D.c>b>a
解析:依题意,这些数据由小到大依次是10,12,14,14,15,15,16,17,17,17,因此a<15,b=15,c=17,c>b>a.
答案:D
授课提示:对应学生用书第242页
题型一 统计图表的应用  
1.(2021·广州四校联考)如图是2019年第一季度A、B、C、D、E五省GDP情况图,则下列叙述中不正确的是(  )
A.2019年第一季度GDP增速由高到低排位第5的是A省
B.与2018年同期相比,各省2019年第一季度的GDP总量实现了增长
C.2018年同期C省的GDP总量不超过4
000亿元
D.2019年第一季度GDP总量和增速由高到低排位均居同一位的省只有1个
解析:由折线图可知A,B正确;4
067.4÷(1+6.6%)≈3
816<4
000,故C正确;2019年第一季度GDP总量和增速由高到低排位均居同一位的省有B省均第一、C省均第四,共有2个,故D错误.
答案:D
2.(2021·珠海摸底)某班级在一次数学竞赛中设置了一等奖、二等奖、三等奖以及参与奖,各个奖品的单价分别为一等奖20元、二等奖10元、三等奖5元、参与奖2
元,获奖人数的分配情况如图所示,则以下说法不正确的是(  )
A.获得参与奖的人数最多
B.各个奖项中三等奖的总费用最高
C.购买奖品的平均费用为9.25元
D.购买奖品的费用的中位数为2元
解析:设全班人数为a,由扇形统计图可知,一等奖占5%,二等奖占10%,三等奖占30%,参与奖占65%.获得参与奖的人数最多,故A正确;一等奖的总费用为5%a×20=a,二等奖的总费用为10%a×10=a,三等奖的总费用为30%a×5=a,参与奖的总费用为65%a×2=a,所以各个奖项中三等奖的总费用最高,故B正确;购买奖品的平均费用为5%×20+10%×10+30%×5+65%×2=4.8(元),故C错误;参与奖占65%,所以购买奖品的费用的中位数为2元,故D正确.
答案:C
利用折线图、饼图分析问题的关键是结合图形,弄清图中数据,读准问题要求.
题型二 频率分布直方图  
[例] (2021·四川五校联考)随着新课程改革和高考综合改革的实施,高中教学以发展学生学科核心素养为导向,学习评价更关注学科核心素养的形成和发展.为此,某市于2020年举行第一届高中数学学科素养竞赛,竞赛结束后,为了评估该市高中学生的数学学科素养,从所有参赛学生中随机抽取1
000名学生的成绩(单位:分)作为样本进行估计,将抽取的成绩整理后分成五组,依次记为[50,60),[60,70),[70,80),[80,90),[90,100],并绘制成如图所示的频率分布直方图.
(1)请补全频率分布直方图,并估计这1
000名学生成绩的平均数(同一组数据用该组区间的中点值作代表);
(2)该市决定对本次竞赛成绩排在前180名的学生给予表彰,授予“数学学科素养优秀标兵”称号,一名学生本次竞赛成绩为79分,请你判断该学生能否被授予“数学学科素养优秀标兵”称号.
[解析] (1)成绩在[60,70)的频率为1-(0.30+0.15+0.10+0.05)=0.40,补全的频率分布直方图如图:
样本的平均数=55×0.30+65×0.40+75×0.15+85×0.10+95×0.05=67.
(2)因为=0.18,
所以由频率分布直方图可以估计获得“数学学科素养优秀标兵”称号学生的最低成绩为80-=78(分).
因为79>78,所以该同学能被授予“数学学科素养优秀标兵”称号.
由频率分布直方图进行相关计算时,需掌握的两个关系式
(1)×组距=频率.
(2)=频率,此关系式的变形为=样本容量,样本容量×频率=频数.
[对点训练]
第23届冬季奥林匹克运动会于2018年2月9日~25日在韩国平昌郡举行,简称“平昌冬奥会”.某媒体随机采访了某市20名关注“平昌冬奥会”的市民,其年龄数据可绘制成如图所示的茎叶图,由于其中部分数据缺失,故打算根据频率分布直方图中的数据估计被采访的市民的平均年龄.
(1)完成频率分布直方图;
(2)根据(1)中的频率分布直方图估计被采访的市民的平均年龄x(同一组中的数据用该组区间的中点值作代表);
(3)根据茎叶图计算出被采访的市民的平均年龄为y,并假设a∈{n∈Z|0≤n≤9},且a取得每一个可能值的机会相等,在(2)的条件下,求P(y>x).
解析:(1)频率分布直方图如图:
(2)x=25×0.1+35×0.15+45×0.3+55×0.25+65×0.2=48,
即估计被采访的市民的平均年龄为48岁.
(3)y==,
故P(y>x)=P(>48)=P(a>2)=0.7.
题型三 样本的数字特征及应用  
[例] (2019·高考全国卷Ⅱ)某行业主管部门为了解本行业中小企业的生产情况,随机调查了100个企业,得到这些企业第一季度相对于前一年第一季度产值增长率y的频数分布表.
y的分组
[-0.20,0)
[0,0.20)
[0.20,0.40)
[0.40,0.60)
[0.60,0.80)
企业数
2
24
53
14
7
(1)分别估计这类企业中产值增长率不低于40%的企业比例、产值负增长的企业比例;
(2)求这类企业产值增长率的平均数与标准差的估计值(同一组中的数据用该组区间的中点值为代表).(精确到0.01)
附:≈8.602.
[解析] (1)根据产值增长率频数分布表得,所调查的100个企业中产值增长率不低于40%的企业频率为=0.21.
产值负增长的企业频率为=0.02.
用样本频率分布估计总体分布得这类企业中产值增长率不低于40%的企业比例为21%,产值负增长的企业比例为2%.
(2)=×(-0.10×2+0.10×24+0.30×53+0.50×14+0.70×7)=0.30,
s2=ni(yi-)2
=×[(-0.40)2×2+(-0.20)2×24+02×53+0.202×14+0.402×7]
=0.029
6,
s==0.02×≈0.17.
所以,这类企业产值增长率的平均数与标准差的估计值分别为0.30,0.17.
利用样本的数字特征解决优化决策问题
(1)平均数反映了数据取值的平均水平;标准差、方差描述了一组数据围绕平均数波动的大小.标准差、方差越大,数据的离散程度越大,越不稳定;标准差、方差越小,数据的离散程度越小,越稳定.
(2)用样本估计总体就是利用样本的数字特征来描述总体的数字特征.
[题组突破]
1.(2020·高考全国卷Ⅲ)设一组样本数据x1,x2,…,xn的方差为0.01,则数据10x1,10x2,…,10xn的方差为(  )
A.0.01       
B.0.1
C.1
D.10
解析:10x1,10x2,…,10xn的方差为102×0.01=1.
答案:C
2.为比较甲、乙两名篮球运动员的近期竞技状态,选取这两名球员最近五场比赛的得分,制成如图所示的茎叶图.有下列结论:
①甲最近五场比赛得分的中位数高于乙最近五场比赛得分的中位数;
②甲最近五场比赛得分的平均数低于乙最近五场比赛得分的平均数;
③从最近五场比赛的得分看,乙比甲更稳定;
④从最近五场比赛的得分看,甲比乙更稳定.
其中所有正确结论的编号为(  )
A.①③        
B.①④
C.②③
D.②④
解析:对于①,甲得分的中位数为29,乙得分的中位数为30,错误;对于②,甲得分的平均数为×(25+28+29+31+32)=29,乙得分的平均数为×(28+29+30+31+32)=30,正确;对于③,甲得分的方差为×[(25-29)2+(28-29)2+(29-29)2+(31-29)2+(32-29)2]=×(16+1+0+4+9)=6,乙得分的方差为×[(28-30)2+(29-30)2+(30-30)2+(31-30)2+(32-30)2]=×(4+1+0+1+4)=2,所以乙比甲更稳定,③正确,④错误.所以正确结论的编号为②③.
答案:C
 用样本估计总体应用中的核心素养
直观想象、数据分析——用样本估计总体的创新问题
[例] (2021·惠州市一调)某大学生在开学季准备销售一种文具盒进行试创业,在一个开学季内,每售出1盒该产品获得的利润为30元,未售出的产品,每盒亏损10元.该大学生通过查询资料得到开学季市场需求量的频率分布直方图,如图所示.该大学生为这个开学季购进了160盒该产品,以x(单位:盒,100≤x≤200)表示这个开学季内的市场需求量,y(单位:元)表示这个开学季内经销该产品的利润.
(1)根据直方图估计这个开学季内市场需求量x的众数和平均数;
(2)将y表示为x的函数;
(3)根据直方图估计利润y不少于4
000元的概率.
[解析] (1)由题中频率分布直方图得,这个开学季内市场需求量x的众数是150盒,
需求量在[100,120)内的频率为0.005
0×20=0.1,
需求量在[120,140)内的频率为0.010
0×20=0.2,
需求量在[140,160)内的频率为0.015
0×20=0.3,
需求量在[160,180)内的频率为0.012
5×20=0.25,
需求量在[180,200]内的频率为0.007
5×20=0.15.
则平均数=110×0.1+130×0.2+150×0.3+170×0.25+190×0.15=153(盒).
(2)因为每售出1盒该产品获得的利润为30元,未售出的产品,每盒亏损10元,
所以当100≤x<160时,y=30x-10×(160-x)=40x-1
600;
当160≤x≤200时,y=160×30=4
800.
所以y=
(3)因为利润y不少于4
000元,所以当100≤x<160时,由40x-1
600≥4
000,解得140≤x<160;
当160≤x≤200时,y=4
800>4
000恒成立,所以140≤x≤200时,利润y不少于4
000元.
故由(1)知利润y不少于4
000元的概率P=1-0.1-0.2=0.7.
用样本估计总体常与函数、不等式、概率求法等交汇考查,处理时需注意读图数据的准确性及交汇点的应用.
[对点训练]
如图是依据某城市年龄在20岁到45岁的居民上网情况调查而绘制的频率分布直方图,现已知年龄在[30,35),[35,40),[40,45]的网民人数成递减的等差数列,则年龄在[35,40)的网民出现的频率为(  )
A.0.04       
B.0.06
C.0.2
D.0.3
解析:由题意得,年龄在[20,25)的网民出现的频率为0.01×5=0.05,[25,30)的网民出现的频率为0.07×5=0.35,又[30,35),[35,40),[40,45]的网民人数成递减的等差数列,则其频率也成等差数列,又[30,45]的频率为1-0.05-0.35=0.6,则年龄在[35,40)的网民出现的频率为0.6÷3=0.2.
答案:C
PAGE第四节 变量间的相关关系与统计案例
命题分析预测
学科核心素养
对于回归分析,高考考查较多,主要考查求线性回归方程、利用回归方程进行预测,一般以解答题的形式出现,难度中等,有时也会以小题的形式考查变量的相关性;对于独立性检验,一般以解答题的第一问进行考查,常与概率知识相交汇命题.
本节通过回归分析、独立性检验考查考生分析解决问题的能力,提升数学运算、直观想象、数据分析、逻辑推理、数学建模等核心素养.
授课提示:对应学生用书第245页
知识点一 变量间的相关关系
1.变量间的相关关系
(1)常见的两变量之间的关系有两类:一类是函数关系,另一类是相关关系;与函数关系不同,相关关系是一种非确定性关系.
(2)从散点图上看,点散布在从左下角到右上角的区域内,两个变量的这种相关关系称为正相关,点散布在左上角到右下角的区域内,两个变量的相关关系为负相关W.
2.两个变量的线性相关
(1)从散点图上看,如果这些点从整体上看大致分布在通过散点图中心的一条直线附近,称两个变量之间具有线性相关关系,这条直线叫做回归直线W.
(2)回归方程为y=bx+a,其中b=eq
\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-n\o(x,\s\up6(-)) \o(y,\s\up6(-)),\o(∑,\s\up6(n),\s\do4(i=1))x-n\o(x,\s\up6(-))2),
a=-b
W.
(3)通过求Q=
(yi-bxi-a)2的最小值而得到回归直线的方法,即使得样本数据的点到回归直线的距离的平方和最小,这一方法叫做最小二乘法.
(4)相关系数:当r>0时,表明两个变量正相关;当r<0时,表明两个变量负相关W.
r的绝对值越接近于1,表明两个变量的线性相关性越强W.r的绝对值越接近于0时,表明两个变量之间几乎不存在线性相关关系W.通常|r|大于0.75时,认为两个变量有很强的线性相关性.
?
温馨提醒
?
1.易混淆相关关系与函数关系,两者的区别是函数关系是一种确定的关系,而相关关系是一种非确定的关系,函数关系是一种因果关系,而相关关系不一定是因果关系,也可能是伴随关系.
2.回归分析中易误认为样本数据必在回归直线上,实质上回归直线必过(,)点,可能所有的样本数据点都不在直线上.
1.为研究语文成绩和英语成绩之间是否具有线性相关关系,统计两科成绩得到如图所示的散点图(两坐标轴单位长度相同),用回归直线y=bx+a近似地刻画其相关关系,根据图形,以下结论最有可能成立的是(  )
A.线性相关关系较强,b的值为3.25
B.线性相关关系较强,b的值为0.83
C.线性相关关系较强,b的值为-0.87
D.线性相关关系太弱,无研究价值
解析:依题意,注意到题中相关的点均集中在某条直线的附近,且该直线的斜率小于1,结合各选项知,选B.
答案:B
2.相关变量x,y的样本数据如下表:
x
1
2
3
4
5
y
2
2
3
5
6
经回归分析可得y与x线性相关,并由最小二乘法求得回归直线方程为y=1.1x+a,则a=(  )
A.0.1       
B.0.2
C.0.3
D.0.4
解析:=×(1+2+3+4+5)=3,=×(2+2+3+5+6)=3.6,回归直线经过点(,),所以3.6=1.1×3+a,得a=0.3.
答案:C
3.(易错题)(2021·兰州市高三实战考试)已知变量x,y具有线性相关关系,它们之间的一组数据如下表所示,若y关于x的回归方程为y=1.3x-1,则m=_________.
x
1
2
3
4
y
0.1
1.8
m
4
解析:由题知=,y关于x的回归方程为y=1.3x-1,所以=×1.3-1=2.25,所以2.25=×(0.1+1.8+m+4),解得m=3.1.
答案:3.1
知识点二 独立性检验
假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称为2×2列联表)为:
y1
y2
总计
x1
a
b
a+b
x2
c
d
c+d
总计
a+c
b+d
a+b+c+d
χ2=(其中n=a+b+c+d为样本容量).
1.下面是2×2列联表:
y1
y2
总计
x1
a
21
73
x2
22
25
47
总计
b
46
120
则表中a,b的值分别为(  )
A.94,72
B.52,50
C.52,74
D.74,52
答案:C
2.为考察某种药物预防疾病的效果,对100只某种动物进行试验,得到如下的列联表:
患病
未患病
合计
服用药
10
40
50
没服用药
20
30
50
合计
30
70
100
附表:
P(χ2≥k)
0.10
0.05
0.025
0.010
k
2.706
3.841
5.024
6.635
经计算,统计量χ2≈4.762,则有    把握认为药物有效.(  )
A.99.5%
B.95%
C.99%
D.97.5%
解析:因为χ2>3.841,所以有95%的把握认为药物有效.
答案:B
授课提示:对应学生用书第246页
题型一 相关关系的判断 
1.(2021·昆明市诊断测试)某商家今年上半年各月的人均销售额(单位:千元)与利润率统计表如下:
月份
1
2
3
4
5
6
人均销售额
6
5
8
3
4
7
利润率(%)
12.6
10.4
18.5
3.0
8.1
16.3
根据表中数据,下列说法正确的是(  )
A.利润率与人均销售额成正相关关系
B.利润率与人均销售额成负相关关系
C.利润率与人均销售额成正比例函数关系
D.利润率与人均销售额成反比例函数关系
解析:画出利润率与人均销售额的散点图,如图.由图可知利润率与人均销售额成正相关关系.
答案:A
2.甲、乙、丙、丁四位同学各自对A,B两变量的线性相关性做试验,并用回归分析方法分别求得相关系数r与残差平方和m如下表:




r
0.82
0.78
0.69
0.85
m
106
115
124
103
则哪位同学的试验结果体现A,B两变量有更强的线性相关性(  )
A.甲       
B.乙
C.丙
D.丁
解析:在验证两个变量之间的线性相关关系时,相关系数的绝对值越接近于1,相关性越强,在四个选项中只有丁的相关系数最大;残差平方和越小,相关性越强,只有丁的残差平方和最小,综上可知丁的试验结果体现了A,B两变量有更强的线性相关性.
答案:D
3.(2020·高考全国卷Ⅰ)某校一个课外学习小组为研究某作物种子的发芽率y和温度x(单位:℃)的关系,在20个不同温度条件下进行种子发芽实验,由实验数据(xi,yi)(i=1,2,…,20)得到下面的散点图:
由此散点图,在10
℃至40
℃之间,下面四个回归方程类型中最适宜作为发芽率y和温度x的回归方程类型的是(  )
A.y=a+bx
B.y=a+bx2
C.y=a+bex
D.y=a+bln
x
解析:由散点图可以看出,这些点大致分布在对数型函数的图像附近.
答案:D
1.散点图中如果所有的样本点都落在某一函数的曲线附近,变量之间就有相关关系.如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系.若点散布在从左下角到右上角的区域,则正相关.
2.利用相关系数判定,当|r|越趋近于1,相关性越强.当残差平方和越小,相关指数R2越大,相关性越强.若r>0,则正相关;r<0时,则负相关.
3.线性回归直线方程中:b>0时,正相关;b<0时,负相关.
题型二 回归分析  
[例] (2021·福州市模拟)随着我国中医学的发展,药用昆虫的使用相应愈来愈多.每年春暖以后至寒冬前,昆虫大量活动与繁殖,易于采集各种药用昆虫.已知一只药用昆虫的产卵数y(单位:个)与一定范围内的温度x(单位:℃)有关,于是科研人员在3月份的31天中随机挑选了5天进行研究,现收集了该种药用昆虫的5组观测数据如下表:
日期
2日
7日
15日
22日
30日
温度x/℃
10
11
13
12
8
产卵数y/个
23
25
30
26
16
(1)从这5天中任选2天,记这2天药用昆虫的产卵数分别为m,n,求事件“m,n均不小于25”的概率;
(2)科研人员确定的研究方案是:先从这5组数据中任选2组,用剩下的3组数据建立y关于x的线性回归方程,再对被选取的2组数据进行检验.
①若选取的是3月2日与30日这2组的数据,请根据3月7日、15日和22日这3组的数据,求出y关于x的线性回归方程;
②若由线性回归方程得到的估计数据与所选出的检验数据的误差均不超过2个,则认为得到的线性回归方程是可靠的,试问①中所得的线性回归方程是否可靠?
附:回归直线的斜率和截距的最小二乘估计公式分别为b=,a=-b.
[解析] (1)依题意得,m,n的所有情况有{23,25},{23,30},{23,26},{23,16},{25,30},{25,26},{25,16},{30,26},{30,16},{26,16},共10个.设“m,n均不小于25”为事件A,则事件A包含的所有情况有{25,30},{25,26},{30,26},共3个,所以P(A)=,故事件“m,n均不小于25”的概率为.
(2)①由已知数据得=12,=27,
(xi-)(yi-)=5,
(xi-)2=2,所以b==,a=
-=27-×12=-3.所以y关于x的线性回归方程为y=x-3.
②由①知,y关于x的线性回归方程为y=x-3.当x=10时,y=×10-3=22,|22-23|<2,当x=8时,y=×8-3=17,|17-16|<2.所以①中所得的线性回归方程y=x-3是可靠的.
1.回归直线方程中系数的两种求法
(1)公式法:利用公式,求出回归系数b,a.
(2)待定系数法:利用回归直线过样本点中心(,)求系数.
2.回归分析的两种策略
(1)利用回归方程进行预测:把回归直线方程看作一次函数,求函数值.
(2)利用回归直线判断正、负相关:决定正相关还是负相关的是回归系数b.
[对点训练]
随着我国经济的发展,居民的储蓄存款逐年增长.设某地区城乡居民人民币储蓄存款(年底余额)如下表:
年份
2016
2017
2018
2019
2020
时间代号t
1
2
3
4
5
储蓄存款y(千亿元)
5
6
7
8
10
(1)求y关于t的回归方程y=bt+a;
(2)用所求回归方程预测该地区2021年(t=6)的人民币储蓄存款.
附:回归方程y=bt+a中,b=eq
\f(\o(∑,\s\up6(n),\s\do4(i=1))tiyi-n\o(t,\s\up6(-))\o(y,\s\up6(-)),\o(∑,\s\up6(n),\s\do4(i=1))t-n\o(t,\s\up6(-))2),a=-b.
解析:(1)列表计算如下:
i
ti
yi
t
tiyi
12345
12345
567810
1491625
512213250

15
36
55
120
这里n=5,=ti==3,=yi==7.2.
又t-n2=55-5×32=10,tiyi-n=120-5×3×7.2=12,
从而b==1.2,a=-b=7.2-1.2×3=3.6,
故所求回归方程为y=1.2t+3.6.
(2)将t=6代入回归方程可预测该地区2021年的人民币储蓄存款为y=1.2×6+3.6=10.8(千亿元).
题型三 独立性检验  
[例] (2021·洛阳市统考)某共享单车经营企业欲向甲市投放单车,为制定适宜的经营策略,该企业首先在已投放单车的乙市进行单车使用情况调查.调查过程分随机问卷、整理分析及开座谈会三个阶段.在随机问卷阶段,A,B两个调查小组分赴全市不同区域发放问卷并及时收回;在整理分析阶段,两个调查小组从所获取的有效问卷中,针对15至45岁的人群,按比例随机抽取了300份,进行数据统计,具体情况如下表:
组别年龄  
A组统计结果
B组统计结果
经常使用单车
偶尔使用单车
经常使用单车
偶尔使用单车
[15,25)
27人
13人
40人
20人
[25,35)
23人
17人
35人
25人
[35,45]
20人
20人
35人
25人
(1)先用分层抽样的方法从上述300人中按“年龄是否达到35岁”抽出一个容量为60人的样本,再用分层抽样的方法将“年龄达到35岁”的被抽个体分配到“经常使用单车”和“偶尔使用单车”中去,
①求这60人中“年龄达到35岁且偶尔使用单车”的人数;
②为听取对发展共享单车的建议,调查小组专门组织所抽取的“年龄达到35岁且偶尔使用单车”的人员召开座谈会.会后共有3份礼品赠送给其中3人,每人1份(其余人员仅赠送骑行优惠券).已知参加座谈会的人员中有且只有4人来自A组,求A组这4人中得到礼品的人数X的分布列和数学期望.
(2)从统计数据可直观得出“经常使用共享单车与年龄达到m岁有关”的结论.在用独立性检验的方法说明该结论成立时,为使犯错误的概率尽可能小,年龄m应取25还是35?请通过比较χ2的大小加以说明.
参考公式:χ2=,其中n=a+b+c+d.
[解析] (1)①从300人中抽取60人,其中“年龄达到35岁”的人数为100×=20,再将这20人用分层抽样法按“是否经常使用单车”进行名额划分,其中“年龄达到35岁且偶尔使用单车”的人数为20×=9.
②A组这4人中得到礼品的人数X的可能取值为0,1,2,3,相应概率为P(X=0)=eq
\f(C,C)=,P(X=1)=eq
\f(CC,C)=,P(X=2)=eq
\f(CC,C)=,P(X=3)=eq
\f(C,C)=.
故其分布列为
X
0
1
2
3
P
所以EX=0×+1×+2×+3×=.
(2)按“年龄是否达到35岁”对数据进行整理,得到如下列联表:
经常使用单车
偶尔使用单车
合计
未达到35岁
125
75
200
达到35岁
55
45
100
合计
180
120
300
m=35时,可求得
χ=
==.
按“年龄是否达到25岁”对数据进行整理,得到如下列联表:
经常使用单车
偶尔使用单车
合计
未达到25岁
67
33
100
达到25岁
113
87
200
合计
180
120
300
m=25时,可求得
χ=
==.
所以χ>χ.
欲使犯错误的概率尽可能小,需取m=25.
1.在2×2列联表中,如果两个变量没有关系,则应满足ad-bc≈0.|ad-bc|越小,说明两个变量之间关系越弱;|ad-bc|越大,说明两个变量之间关系越强.
2.解决独立性检验的应用问题,一定要按照独立性检验的步骤得出结论.独立性检验的一般步骤:
(1)根据样本数据制成2×2列联表.
(2)根据公式χ2=计算χ2.
(3)比较χ2与临界值的大小关系,作统计推断.
[对点训练]
3(2021·惠州调研)在某校举行的航天知识竞赛中,参与竞赛的文科生与理科生人数之比为1∶3,且成绩分布在[40,100],分数在80以上(含80)的同学获奖.按文理科用分层抽样的方法抽取200人的成绩作为样本,得到成绩的频率分布直方图如下.
(1)求a的值,并计算所抽取样本的平均值
(同一组中的数据用该组区间的中点值作代表);
(2)填写下面的2×2列联表,是否有超过95%的把握认为“获奖与学生的文理科有关”?
文科生
理科生
合计
获奖
5
不获奖
合计
200
附表及公式:
χ2=,其中n=a+b+c+d.
P(χ2≥k)
0.15
0.10
0.05
0.025
0.010
0.005
0.001
k
2.072
2.706
3.841
5.024
6.635
7.879
10.828
解析:(1)由频率分布直方图,可得a=[1-(0.01+0.015+0.03+0.015+0.005)×10]÷10=0.025,
=45×0.1+55×0.15+65×0.25+75×0.3+85×0.15+95×0.05=69.
(2)填写2×2列联表如下:
文科生
理科生
合计
获奖
5
35
40
不获奖
45
115
160
合计
50
150
200
则χ2==≈4.167>3.841,∴有超过95%的把握认为“获奖与学生的文理科有关”.
 非线性回归问题中的核心素养
数学建模、数学运算——非线性回归的应用问题
[例] 为了研究一种昆虫的产卵数y(单位:个)和温度x(单位:℃)是否有关,现收集了7组观测数据列于下表中,并作出了如图所示的散点图,发现样本点没有分布在某个带状区域内,两个变量不呈线性相关关系,现分别用模型①:y=C1x2+C2与模型②:y=eC3x+C4作为产卵数y和温度x的回归方程来建立两个变量之间的关系.
温度x/℃
20
22
24
26
28
30
32
产卵数y/个
6
10
21
24
64
113
322
t=x2
400
484
576
676
784
900
1
024
z=ln
y
1.79
2.30
3.04
3.18
4.16
4.73
5.77
26
692
80
3.57
1
157.54
0.43
0.32
0.000
12
其中ti=x,=ti,zi=ln
yi,=zi.
(1)分别在下图(1)(2)中画出y关于t的散点图和z关于x的散点图,根据散点图判断哪一个模型更适宜作为昆虫的产卵数y关于温度x的回归方程类型?(给出判断即可,不必说明理由)
(1)
(2)
(2)根据表中数据,分别在两个模型下建立y关于x的回归方程,并在两个模型下分别估计温度为30
℃时的产卵数;(参考数据:e4.65≈104.58,e4.85≈127.74,e5.05≈156.02)
(3)若模型①②的相关指数分别为R=0.82,R=0.96,请根据相关指数判断哪个模型的拟合效果更好.
附:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其回归直线v=βu+α的斜率和截距的最小二乘估计分别为β=,α=-β.
解析:(1)画出y关于t的散点图,如图所示.
画出z关于x的散点图,如图所示.
根据散点图可以判断模型②更适宜作为昆虫的产卵数y关于温度x的回归方程类型.
(2)对于模型①,因为t=x2,所以y=C1x2+C2=C1t+C2,
所以C1==0.43,C2=-C1=80-0.43×692=-217.56,
故所求回归方程为y=0.43x2-217.56,
当x=30时,y=0.43×302-217.56=169.44,
故估计温度为30
℃时的产卵数为169个;
对于模型②,因为y=eC3x+C4,所以z=ln
y=C3x+C4,
所以C3==0.32,C4=-C3=3.57-0.32×26=-4.75,
故所求回归方程为y=e0.32x-4.75,
当x=30时,y=e0.32×30-4.75≈127.74,
故估计温度为30
℃时的产卵数为128个.
(3)因为R=0.82,R=0.96,R<R,所以模型②的拟合效果更好.
非线性回归方程的求法
(1)根据原始数据作出散点图;
(2)根据散点图,选择恰当的拟合函数;
(3)作恰当变换,将其转化成线性函数,求线性回归方程;
(4)在(3)的基础上通过相应变换,即可得非线性回归方程.
[对点训练]
 (2021·汕头模拟)二手车经销商小王对其所经营的A型号二手汽车的使用年数x与销售价格y(单位:万元/辆)进行整理,得到如下数据:
使用年数x
2
3
4
5
6
7
售价y
20
12
8
6.4
4.4
3
z=ln
y
3.00
2.48
2.08
1.86
1.48
1.10
下面是z关于x的折线图:
(1)由折线图可以看出,可以用线性回归模型拟合z与x的关系,请用相关系数加以说明;
(2)求y关于x的回归方程,并预测某辆A型号二手车当使用年数为9年时售价约为多少;(b、a小数点后保留两位有效数字)
(3)基于成本的考虑,该型号二手车的售价不得低于7
118元,请根据(2)求出的回归方程预测在收购该型号二手车时车辆的使用年数不得超过多少年.
参考公式:b==eq
\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-n\o(x,\s\up6(-))
\o(y,\s\up6(-)),\o(∑,\s\up6(n),\s\do4(i=1))x-n\o(x,\s\up6(-))2),a=-b,r=.
参考数据:xiyi=187.4,xizi=47.64,x=139,
=4.18,
=13.96,
=1.53,ln
1.46≈0.38,ln
0.711
8
≈-0.34.
解析:(1)由题意,知=×(2+3+4+5+6+7)=4.5,
=×(3+2.48+2.08+1.86+1.48+1.10)=2,
又xizi=47.64,
=4.18,
=1.53,
∴r==-≈-0.99,
∴z与x的相关系数大约为-0.99,说明z与x的线性相关程度很高.
(2)b=
=-≈-0.36,
∴a=-b=2+0.36×4.5=3.62,
∴z与x的线性回归方程是z=-0.36x+3.62,又z=ln
y,
∴y关于x的回归方程是y=e-0.36x+3.62.
令x=9,
得y=e-0.36×9+3.62=e0.38,∵ln
1.46≈0.38,
∴y=1.46,
即预测某辆A型号二手车当使用年数为9年时售价约为1.46万元.
(3)当≥0.711
8,
即e-0.36x+3.62≥0.711
8=eln
0.711
8=e-0.34时,
则有-0.36x+3.62≥-0.34,解得x≤11,
因此,预测在收购该型号二手车时车辆的使用年数不得超过11年.
PAGE

展开更多......

收起↑

资源列表