23.5 数据的分类 课件 (23页PPT)2026-2027学年数学冀教版九年级上册

资源下载
  1. 二一教育资源

23.5 数据的分类 课件 (23页PPT)2026-2027学年数学冀教版九年级上册

资源简介

23.5 数据的分类
第二十三章 数据分析与统计估计
1.经历数据分组的活动,了解组内离差平方和与组间离差平方和的概念.
2.能够按照组内离差平方和最小的分组原则对数据进行分组,解决实际问题.
在大数据分析中,对一组数据进行分类是重要的方法之一.
例如,世界上的国家可以按某一指标分为发达国家与发展中国家,全体国民按人均收入分为高收入组、中等收人组与低收人组,初中生某项体能测试成绩分为优秀、合格与不合格,这些本质上都是按照某种原则对数据进行分类.
二氧化碳是一种温室气体,超量排放已对全球气候形成影响,我国已庄严承诺:力争在 2030年前实现碳达峰,2060年前实现碳中和,2019年全球人均二氧化碳排放量为6.6 t,我国人均排放量为7.1 t,世界不同地区人均二氧化碳排放量(单位:t)的数据如右表.
{5940675A-B579-460E-94D1-54222C63F5DA}序号
地区
人均二氧化碳排放量/t
1
非洲
1.6
2
南亚和东南亚
2.6
3
拉丁美洲
4.8
4
中东
7.4
5
东亚
8.6
6
欧洲
9.7
7
中亚和俄罗斯
9.9
8
北美
20.8
思考:怎么刻画组内差异的大小呢?哪种分法能使两组的组内差异最小?
观察下图,如果把这8个地区的人均二氧化碳排放量分成两个层次,你认为应该如何划分?
6
8
10
12
0
4
2
14
16
18
20
数据的分组可以有多种方法,例如,以中位数为分界点(可以把一组数据分为两组,每组各有4个数据.
如果把这8个地区的人均二氧化碳排放量分成两组,则共有___种分组方法.
7
但从图中看出,前7个数据的差异相对不大,而 20.8是一个异常数据.
如果将前7个数据分为一组,20.8单独作为一组,那么两组数据的组内离差平方和较小,两组间差异较大,按照“组内离差平方和最小”的原则分组是传统且合理的.
6
8
10
12
0
4
2
14
16
18
20
下面,先了解在一般情形下,数据的离差平方和的分解公式.
设一组数据为x1,x2, ···,xm , xm+1 , xm+2, ···,xn ,将这组数据分成两组,第一组为x1,x2, ···,xm ,第二组为 xm+1 , xm+2, ···,xn ,两组数据的平均数分别为
则n个数据的平均数为
用完全平方公式展开:(a + b)2 = a2 + 2ab + b2
我们先只观察 2 倍项,你有什么发现?
所有 2 倍项的和为 0 ,计算时就不必考虑了.
则有
称 为组内离差平方和(简称组内差),表示两个组内数据的离散程度.
为组间离差平方和(简称组间差),表示两个组间的差异.
其中设
一个合理的分组原则是使组内差 达到最小,组间差 达到最大,但根据 ,由于总体的离差平方和 不变,则只需考虑使组内差 达到最小即可.
将8个数据按从小到大的顺序排列为1.6,2.6,4.8,7.4,8.6,9.7,9.9,20.8,所有可能的分组方案有7种,利用计算机软件计算组内离差平方和,结果如下表:
{5940675A-B579-460E-94D1-54222C63F5DA}分组情况
组内差
第一组7个,第二组1个
69.6
第一组6个,第二组2个
114.5
第一组5个,第二组3个
117.5
第一组4个,第二组4个
117.6
第一组3个,第二组5个
122.6
第一组2个,第二组6个
152.8
第一组1个,第二组7个
201.8
最小
计算结果表明,前7个数据分为一组,第8个数据单独一组,此时组内离差平方和最小.
由于 20.8远离其他数据,直观判断每次将第一组的一个数据移到第二组时,组内离差平方和会增大,由此基本断定组内离差平方和最小的分组方案就是:第一组7个,第二组1个.
1.6,2.6,4.8,7.4,8.6,9.7,9.9,20.8
①排序:将一组数据从小到大排列;
②分组:把数据分成两组,前?m?(m③计算:计算这两组数据的组内离差平方和,离差平方和最小的为最优分组.
组内离差平方和的计算步骤:
有一组数据: 5,6,8,9,10,按照“组内离差平方和最小”原则将这组数据分成两组,下列选项正确的是( )
A. {5} 和 {6,8,9,10}     B. {5,6} 和 {8,9,10}
C. {5,6,8} 和 {9,10}
D. {5,6,8,9} 和 {10}
????12 = 8.75
?
????12= 2.5
?
????12?= 5.17
?
????12= 10
?
B
例 国家统计局发布的数据显示,2022年全国31个省、自治区、直辖市(不含港澳台地区,简称3不省区市)的人均GDP数据(单位:万元)如下表:
按照组内离差平方和最小的原则,把这 31个省区市的人均GDP分为两个层次.
{5940675A-B579-460E-94D1-54222C63F5DA}序号
人均GDP
1
19.03
2
17.99
3
14.44
4
12.68
5
11.92
6
11.85
7
10.19
8
9.65
{5940675A-B579-460E-94D1-54222C63F5DA}序号
人均GDP
9
9.21
10
9.07
11
8.60
12
8.29
13
7.37
14
7.36
15
7.36
16
7.09
{5940675A-B579-460E-94D1-54222C63F5DA}序号
人均GDP
17
6.98
18
6.88
19
6.86
20
6.78
21
6.66
22
6.21
23
6.17
24
6.07
{5940675A-B579-460E-94D1-54222C63F5DA}序号
人均GDP
25
5.84
26
5.70
27
5.53
28
5.23
29
5.22
30
5.11
31
4.50
分析:将 31个省区市的人均GDP按从小到大的顺序排列后分成两组,共有 30种可能分法,如果分别计算组内差,最后选择组内差最小的分组方案,那么计算量会很大.
7
8
9
10
11
3
4
5
6
16
17
18
19
20
12
13
14
15
4
2
6
8
10
20
12
14
16
18
0
频数
人均GDP/万元
如图,这是31个省区市人均GDP的频数分布直方图.
观察图形,发现前25 个数据分布于4.5~10.5万元的范围内,而后6个数据分布于10.5~19.5万元的范围内.
因此,先以10.5万元为分界点将数据分为两组,计算组内差,然后每次将第一组的最后一个数据加入第二组(或将第二组的第一个数据加入第一组),重新计算组内差,最后进行比较.
{5940675A-B579-460E-94D1-54222C63F5DA}分组情况
组内差
第一组25个,第二组6个
104.1
第一组24个,第二组7个
110.3
第一组23个,第二组8个
118.7
第一组26个,第二组5个
117.7
第一组27个,第二组4个
126.2


解:将数据由小到大排列,利用统计软件计算组内离差平方和,结果如下表:
将第一组的最后一个数据加入第二组时,离差平方和变大,则考虑将第二组的第一个数据加入第一组
经比较,将排序后的前 25 个数据分为一组,后6个数据分为一组,可以使组内离差平方和达到最小,即人均 GDP小于10.5万元的省区市为一个层次,人均 GDP 大于 10.5万元的省区市为另一个层次.
组内离差平方和直接衡量每组内部数据的离散程度,分组目标是让同一层次内经济水平尽可能接近,有明确的数值最优标准;
中位数仅单纯平分样本数量,没有考虑数据本身的分布差异,分层后同一组内部发展差距过大,失去分层分析价值.
思考:
1.在例题中,用中位数7.09万元为分界点将数据分为两组,和利用组内离差平方和最小的原则将数据分为两组,哪种方法更合理?为什么?
2.如果将 31个省区市的人均GDP分为3个层次,应该如何划分?
数据的分类
离差平方和
组内离差平方和
组间离差平方和
分组原则
组内离差平方和最小
什么是组内离差平方和?什么是组间离差平方和?对一组数据进行分组时,应遵循什么原则?
1.小明将一组数据分成了两组{78,80}和{84,85,85,86},则第一组离差平方和与第二组离差平方和分别为(   )
A.2,3 B.3,2
C.3,4 D.2,2
D
2. 五个城市某月的平均低温(单位:℃) 如下表所示:
?
{5940675A-B579-460E-94D1-54222C63F5DA}城市
A
B
C
D
E
平均低温/℃
0
-2
5
2
3
{5940675A-B579-460E-94D1-54222C63F5DA}城市
A
B
C
D
0
-2
5
2
3
根据平均低温的组内离差平方和最小的原则,把这5个城市分为两组.
解:将平均低温按从小到大的顺序排列,5个平均低温按顺序排列形成4个间隔,如图所示.
?2?|?0?|?2?|?3?|?5
?
每个间隔都可以把平均低温分成两组,共有4种分法.
{C4B1156A-380E-4F78-BDF5-A606A8083BF9}分组
组内离差平方和
第1个间隔
13
第2个间隔
6.67
第3个间隔
10
第4个间隔
14.75
观察最后一列组内离差平方和可以发现,当按第2个间隔分组时,组内离差平方和最小,因此,按组内离差平方和最小的分法为{A ,B}和{C,D,E} .

展开更多......

收起↑

资源预览