1重点一览
先花 2 分钟看清这章有几个考点、哪几个是必考,心里有数再读书。
2教材标色 + 三色笔记
左边是教材原文,彩色句子就是《考点速记》收了的内容,颜色是星级。右边是速记的考点表,和左边的小节对齐。读一节,看一眼右边的表,再往下走。
一、统计学
在工作和生活中,人们经常面对各种各样的数据,并希望从数据中得出某些结论以帮助决策。统计学就是一门关于数据的学科,它提供了一系列用于收集、处理、分析和解释数据的方法。例如,根据人口普查数据和 1% 人口抽样调查数据推算我国总人口,根据公司的财务数据和商业资料判断公司信用等级,根据电脑寿命的实验数据确定产品免费保修期的长短,根据寿命记录数据确定人寿保险的定价等,这些都是统计学的范畴。概括来讲,统计学是关于收集、整理、分析数据和从数据中得出结论的科学。
统计学有两个分支:描述统计和推断统计。
描述统计是研究数据收集、整理和描述的统计学方法,其内容包括如何取得所需要的数据,如何用图表或数学方法对数据进行整理和展示,如何描述数据的一般性特征。例如,为了解与居民生活相关的商品及服务价格水平的变动情况,收集国家统计局发布的居民消费价格指数(CPI)数据,利用统计图形展示 CPI 的变化,利用增长率计算 CPI 的基本走势。
推断统计是研究如何利用样本数据来推断总体特征的统计学方法,其内容包括参数估计和假设检验两大类。参数估计是利用样本信息推断总体特征;假设检验是利用样本信息判断对总体的假设是否成立。例如,某公司要评测顾客满意度,由于时间、人力和财力等条件的限制不可能对公司所有的顾客进行满意度调查,于是从中随机抽取一部分顾客,调查他们对该公司的质量感知、满意状况和忠诚度等信息,再对公司顾客总体满意度情况进行估计,这就需要用到参数估计方法;然后验证满意度高的顾客更倾向于成为忠诚顾客,这就是假设检验要解决的问题。
统计学是帮助我们认识周围世界的工具。描述统计和推断统计可以一起发挥作用,具体使用哪种方法取决于要解决的问题。
二、变量和数据
变量是研究对象的属性或特征,它是相对于常数而言的。常数只有一个固定取值,而变量可以有两个或更多个可能的取值。研究对象从不同的角度考察,可以有许多不同的属性或特征,也就有许多变量。比如,研究某个企业,我们可以研究其销售额、注册员工数量、员工受教育水平、所属行业等。当变量的取值是数量时,该变量被称为定量变量或数量变量。例如,企业销售额、注册员工数量等。当变量的取值表现为类别时则被称为分类变量,比如企业所属行业。当变量的取值表现为类别且具有一定顺序时被称为顺序变量,比如员工受教育水平。分类变量和顺序变量统称为定性变量。
数据是对变量进行测量、观测的结果。例如,对企业销售额的测量可以得到其销售金额数据;对员工受教育水平的观测可以得到员工受教育水平的数据。数据根据需要可以是数值、文字或者图像等形式。分类变量的观测结果称为分类数据,表现为类别,一般用文字来表述,也可用数值代码表示。比如用 1 表示“男性”,用 2 表示“女性”。顺序数据是对顺序变量的观测结果,也表现为类别,一般用文字表述,也可用数值代码表示。比如用 1 表示“硕士及以上”,用 2 表示“本科”,用 3 表示“大专及以下”。数值型数据是对定量变量的观测结果,其取值表现为具体表示大小或多少的数值。对不同类型的数据,可采用不同的统计方法来处理和分析。例如,对分类数据可以计算出各类别的频率,但对其进行加、减、乘或除等数学运算是没有意义的。而数值型数据则可以进行数学运算,比如计算均值和方差等统计量。
三、数据的来源
(一)观测数据和实验数据
统计数据,按其收集方法,可以分为观测数据和实验数据。通过直接调查或测量而收集到的数据,称为观测数据。观测数据是在没有对事物施加任何人为控制因素的条件下得到的,几乎所有与社会经济现象有关的统计数据都是观测数据,如 GDP、CPI、房价等。通过在实验中控制实验对象以及其所处的实验环境收集到的数据,称为实验数据。比如,一种新产品使用寿命的数据,一种新药疗效的数据。自然科学领域的数据大多是实验数据。
(二)一手数据和二手数据
统计数据,就其本身的来源来看,最初都来源于调查或实验。但从使用者的角度看,数据的来源主要有两种:一是直接的调查和科学实验,对使用者来说,这是数据的直接来源,称为直接数据或一手数据;二是别人的调查或实验的数据,对使用者来说,这是数据的间接来源,称为间接数据或二手数据。一手数据的来源主要有两个:一是调查或观察,二是实验。在社会经济领域,统计调查是获得数据的主要方法,也是获得一手数据的重要方式。
四、统计调查
(一)统计调查的概念与分类
统计调查是按照预定的目的和任务,运用科学的统计调查方法,有计划、有组织地收集数据信息资料的过程。调查过程有两个重要特征:首先,调查是一种有计划、有方法、有程序的活动;其次,调查的结果表现为收集到的数据。
统计调查可以按不同标准分类:
1. 按调查对象的范围不同,分为全面调查和非全面调查。全面调查是对构成调查对象的所有单位进行逐一的、无一遗漏的调查,包括全面统计报表和普查。例如,人口普查就要对全国人口无一例外地进行登记调查。又如,经济普查的对象是中华人民共和国境内从事第二、第三产业活动的全部法人单位、产业活动单位和个体经营户。
全面调查由于调查的单位多、组织工作量大,往往需要耗费大量的人力和财力。因此,在不影响实现统计研究目的的条件下,常常采用非全面调查。
非全面调查是对调查对象中的一部分单位进行调查,包括非全面统计报表、抽样调查、重
点调查和典型调查等。例如,为了研究城市居民家庭的生活水平,可以只对一定数量的住户进行调查;为了掌握进出口商品的质量,抽取一部分商品做检验。又如,为了研究出生婴儿的性别比,可以抽选一定数量的医院、保健院,对其出生婴儿进行调查,而不必对全国每一个出生婴儿都进行调查。
2. 按调查登记的时间是否连续,分为连续调查和不连续调查。连续调查是为了观察总体现象在一定时期内(通常是一年内)的数量变化,它要求随着调查对象的发展变化,连续地进行调查登记。例如,工厂的产品生产、原材料的投入、能源的消耗、人口的出生、死亡等,必须在调查期内连续登记,然后再进行加总。可见,连续调查的资料可以说明现象的发展过程,目的是了解现象在一段时期内的总量。
不连续调查是间隔一个相当长的时间(通常是一年以上)所作的调查,一般是为了对总体现象在一定时点上的状态进行研究。例如,生产设备拥有量、耕地面积等,这些指标的数值在短期内变化不大,不需要连续登记,通常是隔一段时间登记其某时刻或某一天的数量。
(二)统计调查的方式
在我国,常用的统计调查的方式有统计报表、普查、抽样调查、重点调查和典型调查。
1. 统计报表。统计报表是目前我国收集统计数据的一种重要方式。统计报表是按照国家有关法规的规定,自上而下地统一布置、自下而上地逐级提供基本统计数据的一种调查方式。统计报表要以一定的原始数据为基础,按照统一的表式、统一的指标、统一的报送时间和报送程序进行填报。
统计报表的类型多样,按调查对象范围的不同可分为全面统计报表和非全面统计报表。全面统计报表要求调查对象中的每一个单位都填报,非全面统计报表只要求调查对象中的一部分单位填报。目前的大多数统计报表都是全面统计报表,按报送周期长短不同可分为日报、月报、季报、年报等;按报表内容和实施范围不同可分为国家的、部门的、地方的统计报表。
2. 普查。普查是为某一特定目的而专门组织的一次性全面调查,如人口普查、经济普查、农业普查等。世界各国一般都定期进行各种普查,以便掌握有关国情国力的基本统计数据。普查是适合特定目的、特定对象的一种调查方式,主要用于了解处于某一时点状态上的社会经济现象的基本全貌,为国家制定有关政策提供依据。普查作为一种特殊的数据收集方式,具有以下几个特点:①普查通常是一次性的或周期性的。由于普查涉及面广、调查单位多,需要耗费大量的人力、物力和财力,通常需要间隔较长的时间,一般每隔 10 年或 5 年进行一次。经济普查每 10 年进行两次,分别在每逢年份的末尾数字为“3”和“8”的年份实施。人口普查逢“0”的年份进行,农业普查逢“6”的年份进行,均为每 10 年一次。②普查一般需要规定统一的标准调查时间,以避免调查数据的重复或遗漏,保证普查结果的准确性。例如,我国前四次人口普查的标准时间定为普查年份的 7 月 1 日 0 时,第五次至第七次人口普查的标准时间定为普查年份的 11 月 1 日 0 时,农业普查的标准时间定为普查年份的 1 月 1 日 0 时,第四次全国经济普查的标准时间定为普查年份的 1 月 1 日 0 时。标准时间一般定为调查对象比较集中、相对变动较小的时间。③普查的数据一般比较准确,规范化程度也较高,因此,它可以为抽样调查或其他调查提供基本依据。④普查的适用范围比较窄,只能调查一些最基本及特定的现象。
3. 抽样调查。抽样调查是从调查对象的总体中抽取一部分单位作为样本进行调查,并根
据样本调查结果来推断总体数量特征的一种非全面调查。
抽样调查具有以下几个特点:①经济性。这是抽样调查的一个最显著优点。由于调查的样本单位通常是总体单位中的很小一部分,调查的工作量小,因而可以节省大量的人力、物力、财力和时间。②时效性强。抽样调查可以迅速、及时地获得所需要的信息。由于工作量小,调查的准备时间、调查时间、数据处理时间等都可以大大缩短,从而提高数据的时效性。与普查等全面调查相比,抽样调查可以频繁地进行,随着事物的发生和发展及时取得有关信息,以弥补普查等全面调查的不足。例如,在两次人口普查之间各年份的人口数据都是通过抽样调查取得的。③适应面广。抽样调查可以获得更广泛的信息,它适用于对各个领域、各种问题的调查。从适用的范围和问题来看,抽样调查可用于调查全面调查能够调查的现象,也能调查全面调查所不能调查的现象,特别适合对一些特殊现象的调查,如产品质量检验、农产品实验、医药的临床试验等。从调查的项目和指标来看,抽样调查的内容和指标可以更详细、更深入,能获得更全面、更广泛和更深入的数据。④准确性高。抽样调查的数据质量有时比全面调查更高,因为全面调查的工作量大,环节多,登记性(或调查)误差往往很大,而抽样调查由于工作量小,可使各环节的工作做得更细致,误差往往很小。
抽样调查是应用最广泛的一种调查方式和方法,后面将对其进行更为详细的介绍。
4. 重点调查。重点调查是一种非全面调查,它是在所要调查的总体中选择一部分重点单位进行的调查。所选择的重点单位虽然只是全部单位中的一部分,但就调查的标志值来说在总体中占绝大部分比重,调查这一部分单位的情况,能够大致反映被调查对象的基本情况。
重点调查的适用范围很广。当调查目的只要求了解基本状况和发展趋势,不要求掌握全面数据,而调查少数重点单位就能满足需要时,采用重点调查就比较适宜。
例如,为了及时了解全国城市零售物价的变动趋势,就可以对全国 35 个大中型城市的零售物价的变化进行调查,这种调查就是重点调查。
又如,要及时了解全国工业企业的增加值和资产总额情况,只需对全国大中型工业企业进行重点调查即可。因为虽然大中型工业企业数占全国工业企业数不到 5%,但是这些大中型企业的增加值和资产总额却均占全国工业的 60% 以上。
重点调查能以较少的投入、较快的速度取得某些现象主要标志的基本情况或变动趋势。我国有一些重点调查已列入定期报表制度,以便及时取得必要的资料。例如,国家统计局的全国 5000 家工业企业联网直报制度。
5. 典型调查。典型调查是一种非全面调查,它是根据调查的目的与要求,在对被调查对象进行全面分析的基础上,有意识地选择若干具有典型意义的或有代表性的单位进行的调查。
典型调查的主要作用有:①通过对典型单位深入细致的调查,可以及时发现新情况、新问题;②在一定条件下可以验证全面调查数据的真实性。例如,在一次重大普查之后,可以选择若干个典型单位,检查统计数据的准确程度。
典型调查与其他调查方法比较,具有灵活机动、通过少数典型单位即可取得深入翔实的统计资料的优点。典型调查虽然不是统计活动所特有的方法,但从统计活动的全过程来说,它是一种必不可少的方法。在统计活动中运用典型调查的方法,一般来说主要不在于反映现象的总体数量特征,而在于了解与统计数字有关的生动的具体情况,即与现象数量有关的社会条件及其相互联系,以便进行深入的统计分析,做到定性分析与定量分析相结合。
但是,这种调查由于受“有意识地选出若干有代表性单位”的限制,在很大程度上受到人们主观认识的影响。如果调查者对情况相当熟悉,研究问题的态度比较客观,深入调查研究的作风比较好,便可以使典型调查运用得当,取得好的效果;反之,可能会产生较大偏差。因此,必须同其他调查结合起来使用,才能避免出现片面性。
(三)统计质量评价标准
国家统计局制定的《国家统计质量保证框架(2021)》针对统计数据生产全过程,从真实性、准确性、完整性、及时性、适用性、经济性、可比性、协调性和可获得性九个方面,确定了统计数据的质量评价标准。
1. 真实性,要求统计源头数据必须符合统计调查对象的实际情况,确保统计数据有依据、可溯源。侧重于对基础数据质量的评价。
2. 准确性,要求统计数据的误差必须控制在允许范围内,能够为形势判断、政策制定、宏观调控等提供可靠依据。侧重于对统计数据生产科学性的评价。
3. 完整性,要求统计数据应当全面完整,统计范围不重不漏,统计口径完备无缺。侧重于对统计数据全面系统反映客观实际程度的评价。
4. 及时性,要求统计数据生产应当在符合统计科学规律的前提下,尽可能缩短从调查到公布的时间间隔。侧重于对统计数据生产效率的评价。
5. 适用性,要求统计数据能够最大限度为用户所用,统计指标要紧跟时代发展,切合统计需求。侧重于对统计用户满意度的评价。
6. 经济性,要求统计数据生产应当尽可能降低成本,统计调查、行政记录、大数据等数据资源得到充分利用。侧重于对统计数据成本效益的评价。
7. 可比性,要求统计数据应当连续、可比,不同时间、空间数据生产使用规范统一的统计标准和统计原则。侧重于对统计工作标准化、规范化程度的评价。
8. 协调性,要求统计数据结构严谨、逻辑合理,各总量数据、结构数据相互之间高度匹配。侧重于对统计数据间逻辑关系的评价。
9. 可获得性,要求多渠道、多方式公布统计数据,同时公布相应的统计制度方法,加强数据解读,满足社会需求。侧重于对统计服务质量的评价。
五、数据科学与大数据
在大数据爆发式增长的时代,数据科学这门学科受到越来越多的关注。“数据科学”这个词已有近 60 年历史,最早由丹麦的计算机科学领域先驱彼得·诺尔提出,但是这门学科是新兴的、亟待探索的学科。
(一)数据科学
数据科学(data science)是一门通过系统性研究获取与数据相关的知识体系的学科。数据科学一方面研究数据本身的特性和变化规律,另一方面通过对数据的研究为自然科学和社会科学提供一种新的方法,从而揭示自然界和人类行为的现象和规律。
数据科学研究的是从“数据”整合成“信息”进而组织成“知识”的整个过程,包含对数据进行采集、存储、处理、分析、表现等一系列活动。
数据科学的研究对象是数据,研究目标是获得洞察力和理解力,通过对数据的分析,来解释、预测、洞见和决策,为现实世界服务。数据科学涉及的范围非常广泛,例如统计学、计算机
科学、可视化、人工智能、领域知识等。
(二)大数据
大数据(big data)指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要运用新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
大数据具有“5V”特性:
1. 数据量大(Volume):大数据的起始计量单位是 PB(1024 TB)、EB(1024 PB,约 100 万 TB)或 ZB(1024 EB,约 10 亿 TB),未来甚至会达到 YB(1024 ZB)或 BB(1024 YB)。
2. 数据多样性(Variety):大数据类型繁多,包括网络日志、音频、视频、图片、地理位置等各种结构化、半结构化和非结构化的数据。结构化数据是指存储在数据库里,可以用二维表结构实现表达的数据;非结构化数据是指数据结构不规则或不完整,没有预定义的数据,包括所有格式的办公文档、文本、图片、报表、图像、音频、视频等;半结构化数据是介于完全结构化数据和完全非结构化数据之间的数据,具有一定的结构性,例如员工简历,有的简历只有教育情况,有的简历包括教育、婚姻、户籍、出入境情况等很多信息。
3. 价值密度低(Value):大数据价值密度的高低与数据总量的大小成反比。以视频为例,在连续不间断的监控中,有用数据可能仅有一两秒。原始零散、复杂多样,甚至可能有数据噪声和污染的数据需要经历价值“提纯”才能得出信息、获取知识。
4. 数据的产生和处理速度快(Velocity):大数据的智能化和实时性要求越来越高,对处理速度也有极严格的要求,一般要在秒级时间范围内给出分析结果,超出这个时间数据就可能失去价值,即大数据的处理要符合“1 秒定律”。
5. 真实性(Veracity):大数据来源广泛,采集方式多样,数据中往往存在噪声、偏差、内容不一致、数据缺失或人为错误等各类问题。真实性是数据质量、可信度与准确性的核心要求,需通过数据清洗、数据治理、质量控制等一系列规范手段确保数据可靠,从而为科学决策与深度洞察提供有效支撑。
(三)数据挖掘
数据挖掘(data mining)就是从大量的不完全的、有噪声的、模糊的、随机的实际应用数据中,提取隐藏在其中但又有潜在价值的信息和知识的过程。该定义包含以下几层含义:①数据源必须是真实的、大量的、有噪声的;②发现的是用户感兴趣的知识;③发现的知识是可接受、可理解、可运用的;④并不要求发现放之四海而皆准的知识,仅支持特定的发现问题。
在大数据时代,要从海量、多样、价值密度低的大数据中快速发现隐含在其中的有价值的信息和知识,数据挖掘的方法研究至关重要。数据挖掘以解决实际问题为出发点,融合了多学科领域的知识,核心任务是对数据关系和特征进行探索。常见的数据挖掘方法可分为监督学习、无监督学习和半监督学习。
(1)监督学习的数据集中,每个观测单位既有自变量(特征 x_i),又有因变量(标签 y_i)。根据已有的数据集,训练出模型可以根据自变量数据得到因变量预测结果的过程称为监督学习。模型学习的好坏可以根据因变量的实际值和预测值之间的差异判断。监督学习中有两大类典型任务:分类和回归。分类是通过特征变量确定观测单位所属的类别,因变量是分类变量。例如,根据用户的满意度、财务信息判断用户合约到期后是否会续约,根据发件人、主题、内容等信息判断邮件是否为垃圾邮件。常用的分类方法有逻辑斯特回归、决策树、随机森林和支持向量机等。回归是通过特征变量确定观测单位因变量的取值,因变量是定量变量。例如,根据钻
石的克拉数、颜色、切割工艺等信息预测钻石的价格,根据房屋面积、位置、楼层等信息预测房价。常用的回归方法包括线性回归、非线性回归、分位数回归等传统模型。随着深度学习的发展,集成学习、神经网络等方法在复杂高维数据的分类和回归中也被广泛应用。
(2)无监督学习的数据集中,每个观测单位只有自变量(特征 x_i)没有因变量(标签 y_i)。无监督学习的主要任务是探索数据之间的内在联系和结构。无监督学习中有两大类典型任务:聚类和降维。聚类是指把一组数据按照差异性和相似性分为几个类别,使得同类的数据相似性尽可能大,不同类的数据相似性尽可能小,跨类的数据关联性尽可能低。聚类分析常用于客户细分、文本归类、结构分组、行为跟踪等。与分类不同,聚类要划分的类是未知的,聚类是根据观察学习来确定数据之间的关系,因此是一种无监督学习。常用的聚类方法包括基于划分的方法(例如 k 均值聚类算法)、基于分层的方法、基于密度的方法、基于网格的方法和基于模型的方法。降维是指在不损失过多信息的前提下将 N 个相关的特征降为 k 个不相关的特征(其中 k < N),使其具有更好的解释性,因此降维也称为特征提取。例如,根据客户的能力、品格、担保、资本、环境等特征评价客户的信用等级。常用的降维方法包括主成分分析法、因子分析法等。
(3)半监督学习是监督学习与无监督学习相结合的一种学习方法。半监督学习的数据集中,一部分观测单位既有自变量(特征 x_i)又有因变量(标签 y_i),另一部分观测单位只有自变量(特征 x_i)没有因变量(标签 y_i),而且没有标签的观测单位数量远大于有标签的观测单位数量。半监督学习的成本低于监督学习,准确性又高于无监督学习。因此,半监督学习越来越受到人们的重视。常见的半监督学习有半监督分类、半监督回归、半监督聚类。
3必背
这些是必须背下来的。先遮住右边一列,看左边考点名,自己说出内容,说不出来的做记号。
经济基础 第23章 统计与数据科学 必背
红 ★★★ 必考
| 考点 | 必背内容 |
|---|---|
| 统计调查的概念 | 按预定目的和任务,运用科学的统计调查方法,有计划、有组织地收集数据信息资料的过程 |
| 按调查对象范围分 | 全面调查(全面统计报表 + 普查,例:人口普查、经济普查);非全面调查(非全面统计报表 + 抽样调查 + 重点调查 + 典型调查) |
| 为什么常用非全面调查 | 全面调查单位多、工作量大、耗人力财力,所以在不影响研究目的的条件下常用非全面调查 |
| 按登记时间是否连续分 | 连续调查:一定时期内(通常一年内)连续登记,看发展过程,目的是一段时期的总量(例:产品生产、原材料投入、能源消耗、人口出生死亡);不连续调查:间隔相当长时间(通常一年以上),看某一时点的状态(例:生产设备拥有量、耕地面积) |
| 五种调查方式 | 统计报表、普查、抽样调查、重点调查、典型调查 |
| 统计报表 | 按国家法规,自上而下统一布置、自下而上逐级提供基本统计数据;分全面统计报表(每个单位都填报,目前大多数)和非全面统计报表(一部分单位填报) |
| 普查含义 | 为某一特定目的而专门组织的一次性全面调查(人口普查、经济普查、农业普查) |
| 普查四特点 | 一次性或周期性;规定统一的标准调查时间(防重复遗漏);数据准确、规范化程度高;适用范围窄,只能查最基本及特定的现象 |
| 普查年份 | 经济普查逢 3、8(每 10 年两次);人口普查逢 0;农业普查逢 6;均每 10 年一次 |
| 抽样调查含义 | 从总体中抽取一部分单位作为样本调查,根据样本结果推断总体数量特征的非全面调查;应用最广泛 |
| 抽样调查四特点 | 口诀「经时适准」:经济性(最显著优点)、时效性强、适应面广、准确性高 |
| 重点调查含义 | 非全面调查,选一部分重点单位,重点单位的标志值在总体中占绝大比重,能大致反映基本情况 |
| 重点调查特点 | 适用范围广、投入较少、速度较快(例:35 个大中城市零售物价、5000 家工业企业联网直报) |
| 典型调查含义 | 非全面调查,在全面分析基础上有意识地选择若干典型或有代表性的单位进行调查 |
| 典型调查特点 | 灵活机动、少数典型单位即可取得深入翔实资料;受主观认识影响,须结合其他调查使用,避免片面性 |
| 统计质量评价标准九条 | 口诀「真准全、及适经、比协获」:真实性、准确性、完整性、及时性、适用性、经济性、可比性、协调性、可获得性(《国家统计质量保证框架(2021)》) |
黄 ★★ 重点
| 考点 | 必背内容 |
|---|---|
| 变量定义 | 研究对象的属性或特征,相对于常数而言,可以有两个或更多个可能的取值 |
| 变量三分类 | 定量变量(数量变量):取值是数量,例销售额、员工数;分类变量:取值是类别,例所属行业;顺序变量:类别且有顺序,例受教育水平 |
| 数据含义 | 对变量进行测量、观测的结果,可以是数值、文字或图像等形式 |
| 数据三分类 | 分类数据(1 = 男、2 = 女);顺序数据(1 = 硕士及以上、2 = 本科、3 = 大专及以下);数值型数据(能做数学运算,算均值方差) |
| 按收集方法分 | 观测数据:直接调查或测量,无人为控制,社会经济数据几乎都是,例 GDP、CPI、房价;实验数据:控制实验对象和环境,例新产品寿命、新药疗效,自然科学数据大多是 |
| 按数据本身来源分 | 一手数据:直接的调查和科学实验;二手数据:别人的调查或实验的数据 |
绿 ★ 会考数字与分类
| 考点 | 必背内容 |
|---|---|
| 统计学定义 | 关于收集、整理、分析数据和从数据中得出结论的科学 |
| 统计学两分支 | 描述统计(收集、整理、描述数据);推断统计(用样本推断总体,分参数估计和假设检验两大类) |
| 参数估计 / 假设检验 | 参数估计:用样本信息推断总体特征;假设检验:用样本信息判断对总体的假设是否成立 |
| 数据科学 | 通过系统性研究获取与数据相关的知识体系的学科;研究对象是数据 |
| 大数据 | 无法在一定时间内用常规软件工具捕捉、管理和处理的数据集合 |
| 大数据 5V | 口诀「量多价低快又真」:数据量大(Volume)、数据多样性(Variety)、价值密度低(Value)、产生和处理速度快(Velocity)、真实性(Veracity) |
| 数据挖掘核心任务 | 对数据关系和特征进行探索 |
| 数据挖掘三方法 | 监督学习:有特征有标签(分类、回归);无监督学习:只有特征无标签(聚类、降维);半监督学习:部分有标签且无标签的远多于有标签的 |
数字与公式清单
- 统计学 2 个分支:描述统计、推断统计;推断统计 2 大类:参数估计、假设检验
- 变量 3 类:定量、分类、顺序;数据 3 类:数值型、分类、顺序
- 数据来源 2 组:观测 / 实验(按收集方法);一手 / 二手(按数据本身来源)
- 统计调查 5 种方式:统计报表、普查、抽样、重点、典型;全面调查包括全面统计报表和普查,非全面调查包括非全面统计报表、抽样、重点、典型
- 连续调查通常一年内;不连续调查通常一年以上
- 普查一般每隔 10 年或 5 年一次;经济普查逢 3、8,人口普查逢 0,农业普查逢 6
- 人口普查标准时间:前四次 7 月 1 日 0 时,第五至七次 11 月 1 日 0 时;农业普查、第四次经济普查 1 月 1 日 0 时
- 普查 4 特点;抽样调查 4 特点;典型调查 2 作用
- 重点调查例子:35 个大中城市零售物价;大中型工业企业数不到 5% 但增加值和资产总额占 60% 以上;5000 家工业企业联网直报
- 统计质量评价标准 9 条(《国家统计质量保证框架(2021)》)
- 「数据科学」一词近 60 年历史,丹麦彼得·诺尔提出
- 大数据 5V;计量单位 PB = 1024 TB,EB = 1024 PB,ZB = 1024 EB;「1 秒定律」指处理速度
- 数据挖掘定义 4 层含义;3 种方法;监督学习 2 任务(分类、回归),无监督学习 2 任务(聚类、降维)
4总结
一页纸看完整章。二轮快刷和考前只看这里和必背。
经济基础 第23章 统计与数据科学 一页纸总结
本章一句话
这章是统计部分的开场,讲三件事:数据是什么(变量和数据的分类、从哪来),数据怎么收(五种统计调查方式,这是全章的大头,★★★),以及数据多到常规工具处理不了时怎么办(数据科学、大数据 5V、数据挖掘三种学习方法)。考试基本都是概念辨析题,背清楚「谁属于谁」就能拿分。
章末总览表
| 考点 | 星级 | 一句话要点 | 考法 |
|---|---|---|---|
| 考点一 统计学 | ★ | 统计学 = 收集、整理、分析数据并得结论的科学;两分支:描述统计(收、理、描)和推断统计(用样本推总体,含参数估计和假设检验) | 单选(辨析描述统计 / 推断统计) |
| 考点二 变量和数据 | ★★ | 变量按取值分定量、分类、顺序三种,数据跟着变量分数值型、分类、顺序三种;来源按收集方法分观测 / 实验,按数据本身来源分一手 / 二手 | 单选、多选(给例子判类型) |
| 考点三 统计调查 | ★★★ | 全面调查包括全面统计报表和普查,非全面调查包括非全面统计报表、抽样、重点、典型;连续(一年内)/ 不连续(一年以上);五种方式各自的含义和特点;普查逢 3、8 / 0 / 6;抽样四特点「经时适准」;九条质量标准「真准全、及适经、比协获」 | 单选、多选(每年必考,给场景判断是哪种调查) |
| 考点四 数据科学与大数据 | ★ | 数据科学研究对象是数据;大数据 5V「量多价低快又真」;数据挖掘核心任务是探索数据关系和特征;监督(有标签)、无监督(无标签)、半监督(部分有标签且无标签占多) | 单选、多选(5V 和三种学习) |
易错坑
- 普查是全面调查,抽样、重点、典型都是非全面调查;统计报表大多数是全面的,但也有非全面统计报表。
- 重点调查 vs 典型调查:重点调查看「标志值占总体绝大比重」(挑大户),典型调查看「有意识地选有代表性的单位」(挑代表)。题干出现「有意识」就是典型调查。
- 连续调查通常「一年内」、看一段时期的总量;不连续调查通常「一年以上」、看某个时点的状态。生产设备拥有量、耕地面积属于不连续调查。
- 变量与数据对应别串:受教育水平是顺序变量(顺序数据),所属行业是分类变量(分类数据);用 1、2、3 编码的分类和顺序数据不能做加减乘除。
- 大数据的价值密度是「低」不是「高」,与数据总量成反比;分类属于监督学习,聚类属于无监督学习,看有没有标签就能分。
和前后章的关系
本章是第四部分「统计」的第一章,负责铺垫概念:什么是数据、数据怎么收。第 24 章描述统计接着讲拿到数据后怎么算均值、方差、偏态和相关系数,第 25 章抽样调查会把本章「抽样调查」这一种方式单独展开讲抽样方法和误差,第 26 章回归分析对应本章数据挖掘里「监督学习的回归任务」。本章的「参数估计 / 假设检验」在后面的章节还会再出现,先把名字记住。
5解读(读透版讲义)
哪里没看懂,来这里看大白话讲解。生活例子、考法、坑都在这。可以先读这个再回去读教材。
统计与数据科学(教材原文·OCR)
文字为主,公式/图表以教材扫描为准。配套精华看复习网页。
第二十三章 ”统计与数据科学
一`统 计 学
在工作和生活中,人们经常面对各种各样的数据,并希望从数据中得出某些结论以帮助决
策。统计学就是一门关于数据的学科,它提供了一系列用于收集处理、分析和解释数据的方
法。例如,根据人口普查数据和 1% 人口抽样调查数据推算我国总人口 ,根据公司的财务数据
和商业资料判断公司信用等级,根据电脑寿命的实验数据确定产品免费保修期的长短,根据寿
命记录数据确定人寿保险的定价等,这些都是统计学的范畴。概括来讲,统计学是关于收集、
整理、分析数据和从数据中得出结论的科学。
统计学有两个分支: 描述统计和推断统计。
描述统计是研究数据收集 ,整理和描述的统计学方法,其内容包括如何取得所需要的数
据,如何用图表或数学方法对数据进行整理和展示,如何描述数据的一般性特征。例如,为了
解与居民生活相关的商品及服务价格水平的变动情况,收集国家统计局发布的居民消费价格
指数( CPI)数据,利用统计图形展示 CPI 的变化,利用增长率计算 CPI 的基本走势。
推断统计是研究如何利用样本数据来推断总体特征的统计学方法,其内容包括参数估计
和假设检验两大类。参数估计是利用样本信息推断总体特征; 假设检验是利用样本信息判断
对总体的假设是否成立。例如,某公司要评测顾客满意度,由于时间.人力和财力等条件的限
制不可能对公司所有的顾客进行满意度调查,于是从中随机抽取一部分顾客,调查他们对该公
司的质量感知 满意状况和忠诚度等信息,再对公司顾客总体满意度情况进行估计,这就需要
用到参数估计方法; 然后验证满意度高的顾客更倾向于成为忠诚顾客,这就是假设检验要解决
的问题。
统计学是帮助我们认识周围世界的工具。描述统计和推断统计可以一起发挥作用,具体
使用哪种方法取决于要解决的问题。
汕
二\变量和数据
变量是研究对象的属性或特征,它是相对于常数而言的。常数只有一个固定取值,而变量
可以有两个或更多个可能的取值。研究对象从不同的角度考察,可以有许多不同的属性或特
征,也就有许多变量。比如,研究某个企业 ,我们可以研究其销售额 .注册员工数量`员工受教
育水平 .所属行业等。当变量的取值是数量时,该变量被称为定量变量或数量变量。例如,企
业销售额 .注册员工数量等。当变量的取值表现为类别时则被称为分类变量,比如企业所属行
业。当变量的取值表现为类别且具有一定顺序时被称为顺序变量,比如员工受教育水平。分
四部分 统计
' 208 经济基础知识 (中级)
数据是对变量进行测量,观测的结果。例如,对企业销售额的测量可以得到其销售金额
数据; 对员工受教育水平的观测可以得到员工受教育水平的数据。数据根据需要可以是数
值 文字或者图像等形式。分类变量的观测结果称为分类数据,表现为类别 ,一般用文字来
表述,也可用数值代码表示。比如用 1 表示“男性,用2 表示"女性"。顺序数据是对顺序
变量的观测结果,也表现为类别,一般用文字表述,也可用数值代码表示。比如用 1 表示“硕
士及以上",用2表示 "本科”,用3 表示 “大专及以下"。数值型数据是对定量变量的观测结
果,其取值表现为具体表示大小或多少的数值。对不同类型的数据,可采用不同的统计方法
来处理和分析。例如,对分类数据可以计算出各类别的频率,但对其进行加 ,减,乘或除等
数学运算是没有意义的。而数值型数据则可以进行数学运算, 比如计算均值和方差等统计
星。
( 一 )观测数据和实验数据
统计数据,按其收集方法,可以分为观测数据和实验数据。通过直接调查或测量而收集到
的数据 ,称为观测数据。观测数据是在没有对事物施加任何人为控制因素的条件下得到的,几
乎所有与社会经济现象有关的统计数据都是观测数据,如 GDP、CPI 房价等。通过在实验中
控制实验对象以及其所处的实验环境收集到的数据,称为实验数据。比如,一种新产品使用寿
命的数据,一种新药疗效的数据。自然科学领域的数据大多是实验数据。
( 二 )一手数据和二手数据
统计数据,就其本身的来源来看,最初都来源于调查或实验。但从使用者的角度看,数据
的来源主要有两种: 一是直接的调查和科学实验,对使用者来说,这是数据的直接来源,称为直
接数据或一手数据; 二是别人的调查或实验的数据,对使用者来说,这是数据的间接来源,称为
间接数据或二手数据。一手数据的来源主要有两个: 一是调查或观察,二是实验。在社会经济
领域,统计调查是获得数据的主要方法,也是获得一手数据的重要方式。
四\统 计 调查
( 一 )统计调查的概念与分类
统计调查是按照预定的目的和任务,运用科学的统计调查方法,有计划,有组织地收集数
据信息资料的过程。调查过程有两个重要特征:首先,调查是一种有计划 .有方法有程序的活
动; 其次,调查的结果表现为收集到的数据。
统计调查可以按不同标准分类:
- 按调查对象的范围不同,分为全面调查和非全面调查。全面调查是对构成调查对象的
所有单位进行逐一的、无一遗漏的调查,包括全面统计报表和普查。例如,人口普查就要对全
国人口无一例外地进行登记调查。又如,经济普查的对象是中华人民共和国境内从事第二 第
三产业活动的全部法人单位.产业活动单位和个体经营户。
全面调查由于调查的单位多组织工作量大,往往需要耗费大量的人力和财力。因此,在
影响实现统计研究目的的条件下 ,常常采用非全面调查。
非全面调查是对调查对象中的一部分单位进行调查,包括非全面统计报表抽样调查 .重
第二十三章” 统计与数据科学 “209,
点调查和典型调查等。例如 ,为了研究城市居民家庭的生活水平,可以只对一定数量的住户进
行调查; 为了掌握进出口商品的质量,抽取一部分商品做检验。又如,为了研究出生婴儿的性
别比,可以抽选一定数量的医院保健院,对其出生婴儿进行调查 ,而不必对全国每一个出生婴
儿都进行调查。
- 按调查登记的时间是否连续,分为连续调查和不连续调查。连续调查是为了观察总体
现象在一定时期内(通常是一年内 ) 的数量变化,它要求随着调查对象的发展变化,连续地进
行调查登记。例如,工厂的产品生产,原材料的投入,能源的消耗,人口的出生、死亡等,必须在
调查期内连续登记,然后再进行加总。可见,连续调查的资料可以说明现象的发展过程,目的
是了解现象在一段时期内的总量。
不连续调查是间隔一个相当长的时间 ( 通常是一年以上 )所作的调查,一般是为了对
总体现象在一定时点上的状态进行研究。例如,生产设备拥有量 .耕地面积等,这些指标的
数值在短期内变化不大,不需要连续登记,通常是隔一段时间登记其某时刻或某一天的数
里。
( 二 )统计调查的方式
在我国,常用的统计调查的方式有统计报表 .普查,抽样调查 .重点调查和典型调查。
- 统计报表。统计报表是目前我国收集统计数据的一种重要方式。统计报表是按照国家
有关法规的规定,自上而下地统一布置、自下而上地逐级提供基本统计数据的一种调查方式。
统计报表要以一定的原始数据为基础,按照统一的表式、统一的指标、统一的报送时间和报送
程序进行填报。
统计报表的类型多样,按调查对象范围的不同可分为全面统计报表和非全面统计报表。
全面统计报表要求调查对象中的每一个单位都填报,非全面统计报表只要求调查对象中的
一部分单位填报。目前的大多数统计报表都是全面统计报表,按报送周期长短不同可分为
日报月报.季报、年报等; 按报表内容和实施范围不同可分为国家的、部门的、地方的统计报
表。
- 普查。普查是为某一特定目的而专门组织的一次性全面调查,如人口普查经济普查、
农业普查等。世界各国一般都定期进行各种普查,以便掌握有关国情国力的基本统计数据。
普查是适合特定目的特定对象的一种调查方式,主要用于了解处于某一时点状态上的社会
经济现象的基本全貌,为国家制定有关政策提供依据。普查作为一种特殊的数据收集方式,具
有以下几个特点: GD普查通常是一次性的或周期性的。由于普查涉及面广调查单位多,需要
耗费大量的人力 .物力和财力,通常需要间隔较长的时间 ,一般每隔 10 年或 5 年进行一次。经
济普查每 10 年进行两次,分别在每逢年份的末尾数字为“3”和“8” 的年份实施。人口普查
逢“0" 的年份进行,农业普查逢“6" 的年份进行,均为每 10 年一次。@)普查一般需要规定统
一的标准调查时间,以避免调查数据的重复或遗漏,保证普查结果的准确性。例如,我国前四
次人口普查的标准时间定为普查年份的7月 1 日0时,第五次至第七次人口普查的标准时间
定为普查年份的11 月 1 日 0时,农业普查的标准时间定为普查年份的1月 1 日0时,第四次
全国经济普查的标准时间定为普查年份的 1 月 1 日 0 时。标准时间一般定为调查对象比较集
中 相对变动较小的时间。@@普查的数据一般比较准确,规范化程度也较高,因此,它可以为抽
样调查或其他调查提供基本依据。@普查的适用范围比较窄,只能调查一些最基本及特定的
现象。
- 抽样调查。抽样调查是从调查对象的总体中抽取一部分单位作为样本进行调查,并根
' 210 .经济基础知识 (中级)
据样本调查结果来推断总体数量特征的一种非全面调查。
抽样调查具有以下几个特点: 四经济性。这是抽样调查的一个最显著优点。由于调
查的样本单位通常是总体单位中的很小一部分,调查的工作量小,因而可以节省大量的人
力、物力.财力和时间。@时效性强。抽样调查可以迅速.及时地获得所需要的信息。由于
工作量小,调查的准备时间、调查时间 .数据处理时间等都可以大大缩短,从而提高数据的
时效性。与普查等全面调查相比,抽样调查可以频繁地进行,随着事物的发生和发展及时
取得有关信息,以弥补普查等全面调查的不足。例如,在两次人口普查之间各年份的人口
数据都是通过抽样调查取得的。图适应面广。抽样调查可以获得更广泛的信息,它适用于
对各个领域.各种问题的调查。从适用的范围和问题来看,抽样调查可用于调查全面调查
能够调查的现象,也能调查全面调查所不能调查的现象,特别适合对一些特殊现象的调查,
如产品质量检验农产品实验、医药的临床试验等。从调查的项目和指标来看,抽样调查的
内容和指标可以更详细,更深入,能获得更全面`更广泛和更深入的数据。@轩准确性高。抽
样调查的数据质量有时比全面调查更高,因为全面调查的工作量大,环节多,登记性(或调
查 ) 误差往往很大, 而抽样调查由于工作量小,可使各环节的工作做得更细致,误差往往
很小。
抽样调查是应用最广泛的一种调查方式和方法 ,后面将对其进行更为详细的介绍。
- 重点调查。重点调查是一种非全面调查,它是在所要调查的总体中选择一部分重点单
位进行的调查。所选择的重点单位虽然只是全部单位中的一部分,但就调查的标志值来说在
总体中占绝大部分比重,调查这一部分单位的情况,能够大致反映被调查对象的基本情况。
重点调查的适用范围很广。当调查目的只要求了解基本状况和发展趋势,不要求掌握全
面数据,而调查少数重点单位就能满足需要时,采用重点调查就比较适宜。
例如,为了及时了解全国城市零售物价的变动趋势,就可以对全国 35 个大中型城市的零
售物价的变化进行调查,这种调查就是重点调查。
又如,要及时了解全国工业企业的增加值和资产总额情况,只需对全国大中型工业企业进
行重点调查即可。因为虽然大中型工业企业数占全国工业企业数不到 5%,但是这些大中型企
业的增加值和资产总额却均占全国工业的 60% 以上。
重点调查能以较少的投入、较快的速度取得某些现象主要标志的基本情况或变动趋势。
我国有一些重点调查已列人定期报表制度,以便及时取得必要的资料。例如,国家统计局的全
国 5000 家工业企业联网直报制度。
- 典型调查。典型调查是一种非全面调查,它是根据调查的目的与要求,在对被调查对
象进行全面分析的基础上,有意识地选择若干具有典型意义的或有代表性的单位进行的调
查。
典型调查的主要作用有: @通过对典型单位深入细致的调查,可以及时发现新情况 .新问
题; @)在一定条件下可以验证全面调查数据的真实性。例如,在一次重大普查之后,可以选择
若干个典型单位,检查统计数据的准确程度。
典型调查与其他调查方法比较,具有灵活机动 .通过少数典型单位即可取得深入翔实的统
计资料的优点。典型调查虽然不是统计活动所特有的方法,但从统计活动的全过程来说,它是
一种必不可少的方法。在统计活动中运用典型调查的方法,一般来说主要不在于反映现象的
总体数量特征,而在于了解与统计数字有关的生动的具体情况,即与现象数量有关的社会条件
及其相互联系,以便进行深入的统计分析,做到定性分析与定量分析相结合。
第二十三章* 统计与数据科学 ,2171,
但是,这种调查由于受“有意识地选出若干有代表性单位”的限制 ,在很大程度上受到人
们主观认识的影响。如果调查者对情况相当熟悉,研究问题的态度比较客观,深入调查研究的
作风比较好,便可以使典型调查运用得当,取得好的效果; 反之,可能会产生较大偏差。因此,
必须同其他调查结合起来使用,才能避免出现片面性。
( 三 )统计质量评价标准
国家统计局制定的《国家统计质量保证框架( 2021 )》针对统计数据生产全过程,从真实
性、准确性、完整性.及时性.适用性、经济性可比性,协调性和可获得性九个方面,确定了统计
数据的质量评价标准。
- 真实性,要求统计源头数据必须符合统计调查对象的实际情况,确保统计数据有依据、
可溯源。侧重于对基础数据质量的评价。
- 准确性 ,要求统计数据的误差必须控制在允许范围内,能够为形势判断 .政策制定 宏观
调控等提供可靠依据。侧重于对统计数据生产科学性的评价。
- 完整性,要求统计数据应当全面完整,统计范围不重不漏,统计口径完备无缺。侧重于
对统计数据全面系统反映客观实际程度的评价。
- 及时性,要求统计数据生产应当在符合统计科学规律的前提下 ,尽可能缩短从调查到公
布的时间间隔。侧重于对统计数据生产效率的评价。
- 适用性,要求统计数据能够最大限度为用户所用,统计指标要紧跟时代发展,切合统计
需求。侧重于对统计用户满意度的评价。
- 经济性,要求统计数据生产应当尽可能降低成本,统计调查,行政记录 大数据等数据资
源得到充分利用。侧重于对统计数据成本效益的评价。
- 可比性,要求统计数据应当连续、可比,不同时间 空间数据生产使用规范统一的统计标
准和统计原则。侧重于对统计工作标准化 ,规范化程度的评价。
8.协调性,要求统计数据结构严谨、.刘辑合理,各总量数据、结构数据相互之间高度匹配。
侧重于对统计数据间逻辑关系的评价。
- 可获得性,要求多渠道 .多方式公布统计数据,同时公布相应的统计制度方法,加强数据
解读,满足社会需求。侧重于对统计服务质量的评价。
五,数据科学与大数据
在大数据爆发式增长的时代,数据科学这门学科受到越来越多的关注。 "数据科学”这个
词已有近 60 年历史,最早由丹麦的计算机科学领域先驱彼得诺尔提出,但是这门学科是新
兴的、亚待探索的学科。
( 一 )数据科学
数据科学 (data seience ) 是一门通过系统性研究获取与数据相关的知识体系的学科。数
据科学一方面研究数据本身的特性和变化规律,另一方面通过对数据的研究为自然科学和社
会科学提供一种新的方法,从而揭示自然春和人类行为的现象和规律。
数据科学研究的是从“数据” 整合成“信息”进而组织成“知识”的整个过程,包含对数据
进行采集 存储、处理、分析、表现等一系列活动。
数据科学的研究对象是数据,研究目标是获得洞察力和理解力,通过对数据的分析 ,来解
释 ,预测`.洞见和决策,为现实世界服务。数据科学涉及的范围非常广泛,例如统计学`计算机
“212 经济基础知误 (中级)
科学 可视化.人工智能 、领域知识等。
( 二 )大数据
大数据(big data ) 指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据
合,是需要运用新处理模式才能具有更强的决策力 .洞察发现力和流程优化能力的海量 高
增长率和多样化的信息资产。
大数据具有“5V”特性:
1.数据量大(Volume ) : 大数据的起始计量单位是PB(1024 TB ).EB(1024 PB,约 100
万TB )或ZB(1024EB,约 10亿TB ),未来甚至会达到YB(1024ZB )或BB(1024YB)
- 数据多样性(Variety ) : 大数据类型繁多,包括网络日志 .音频视频.图片.地理位置等
各种结构化`半结构化和非结构化的数据。结构化数据是指存储在数据库里,可以用二维表结
构实现表达的数据; 非结构化数据是指数据结构不规则或不完整,没有预定义的数据,包括所
有格式的办公文档\文本,图片报表、图像 音频、视频等; 半结构化数据是介于完全结构化数
据和完全非结构化数据之间的数据,具有一定的结构性,例如员工简历,有的简历只有教育情
况,有的简历包括教育.婚姻 户籍.出人境情况等很多信息。
- 价值密度低( Value ) : 大数据价值密度的高低与数据总量的大小成反比。以视频为例,
在连续不间断的监控中,有用数据可能仅有一两秒。原始零散 .复杂多样,甚至可能有数据品
声和污染的数据需要经历价值“提纯”才能得出信息 .获取知识。
- 数据的产生和处理速度快( Velocity ) : 大数据的智能化和实时性要求越来越高,对处理
速度也有极严格的要求 ,一般要在秒级时间范围内给出分析结果,超出这个时间数据就可能失
去价值,即大数据的处理要符合“1 秒定律”。
- 真实性( Veracity ) : 大数据来源广泛,采集方式多样,数据中往往存在噪声 .偏差.内容
不一致 ,数据缺失或人为错误等各类问题。真实性是数据质量.可信度与准确性的核心要求,
需通过数据清洗数据治理,质量控制等一系列规范手段确保数据可靠,从而为科学决策与深
( 三 )数据挖掘
数据挖掘( data mining ) 就是从大量的不完全的,有噪声的、模糊的.随机的实际应用数据
中,提取隐藏在其中但又有潜在价值的信息和知识的过程。该定义包含以下几层含义:GD数据
源必须是真实的,大量的有噪声的; @发现的是用户感兴趣的知识; 国发现的知识是可接受、
可理解.可运用的; 图并不要求发现放之四海而皆准的知识,仅支持特定的发现问题。
在大数据时代,要从海量多样.价值密度低的大数据中快速发现隐含在其中的有价值的
信息和知识,数据挖掘的方法研究至关重要。数据挖据以解决实际问题为出发点 ,融合了多学
科领域的知识,核心任务是对数据关系和特征进行探索。常见的数据挖掘方法可分为监督学
(1 )监督学习的数据集中,每个观测单位既有自变量( 特征* ),又有因变量( 标签 %) 根
据已有的数据集 ,训练出模型可以根据自变量数据得到因变量预测结果的过程称为监督学习。
模型学习的好坏可以根据因变量的实际值和预测值之间的差异判断。监督学习中有两大类典
型任务: 分类和回归。分类是通过特征变量确定观测单位所属的类别,因变量是分类变量。例
如,根据用户的满意度 ,财务信息判断用户合约到期后是否会续约,根据发件人 .主题,内容等
言息判断邮件是否为垃圾邮件。常用的分类方法有逻辑斯特回归 决策树 .随机森林和支持向
量机等。回归是通过特征变量确定观测单位因变量的取值,因变量是定量变量。例如,根据钻
第二十三章” 统计与数据科学 213
石的克拉数 .颜色 .切割工艺等信息预测钻石的价格,根据房屋面积位置楼层等信息预测房
价。常用的回归方法包括线性回归 ,非线性回归、分位数回归等传统模型。随着深度学习的发
展,集成学习 .神经网络等方法在复杂高维数据的分类和回归中也被广泛应用。
(2 )无监督学习的数据集中,每个观测单位只有自变量( 特征世)没有因变量( 标签六)
无监督学习的主要任务是探索数据之间的内在联系和结构。无监督学习中有两大类典型任
务: 聚类和降维。聚类是指把一组数据按照差异性和相似性分为几个类别,使得同类的数据
相似性尽可能大,不同类的数据相似性尽可能小,跨类的数据关联性尽可能低。聚类分析常用
于客户细分 文本归类结构分组,行为跟踪等。与分类不同,聚类要划分的类是未知的,聚类
是根据观察学习来确定数据之间的关系,因此是一种无监督学习。常用的聚类方法包括基于
划分的方法( 例如大均值聚类算法 )基于分层的方法.基于密度的方法、基于网格的方法和基
于模型的方法。降维是指在不损失过多信息的前提下将 个相关的特征降为上个不相关的
特征(其中大< N),使其具有更好的解释性,因此降维也称为特征提取。例如,根据客户的能
力\唱格 .担保资本、环境等特征评价客户的信用等级。常用的降维方法包括主成分分析法、
因子分析法等。
(3 )半监督学习是监督学习与无监督学习相结合的一种学习方法。半监督学习的数据集
中,一部分观测单位既有自变量( 特征思)又有因变量( 标签思),另一部分观测单位只有自变
量( 特征x )没有因变量(标签思),而且没有标签的观测单位数量远大于有标签的观测单位数
量。半监督学习的成本低于监督学习,准确性又高于无监督学习。因此,半监督学习越来越受
到人们的重视。常见的半监督学习有半监督分类 ,半监督回归 、半监督聚类。
零基础复习卡(两版教材核验)
来源核验:主教材《2026经济基础知识中级原书有色差(371)》PDF 第218-224页;《经济基础知识(中级)-292》PDF 第174-179页(书内第166-171页)。以下为理解性改写,定义与分类以教材为准。
一句话先懂
统计就是把杂乱数据变成可以决策的信息;描述统计回答“样本长什么样”,推断统计回答“能否由样本推总体”。
零基础解释
- 统计学两条主线:描述统计负责收集、整理、制图和概括;推断统计利用样本做参数估计或假设检验。
- 变量和数据:变量是要观察的特征,数据是观察变量得到的结果。定量变量产生数值型数据;分类变量产生分类数据;有次序的分类变量产生顺序数据。
- 数据来源:没有人为控制的是观测数据,有控制实验条件的是实验数据;自己调查或实验得到的是一手数据,使用别人已有资料的是二手数据。
- 调查的两组分类:按调查范围分全面调查和非全面调查;按登记时间是否连续分连续调查和不连续调查。普查是一次性全面调查,抽样、重点、典型调查通常是非全面调查。
- 数据科学:统计学偏重从数据得出可靠结论;数据科学还综合计算机科学、数学和领域知识,处理规模更大、类型更复杂的数据。
- 机器学习:有标签是监督学习,无标签是无监督学习,少量有标签加大量无标签是半监督学习。分类、回归常属监督学习;聚类、降维常属无监督学习。
必背清单
- 描述统计:取得、整理、展示、概括数据。
- 推断统计:参数估计、假设检验。
- 统计数据质量九项:真实性、准确性、完整性、及时性、适用性、经济性、可比性、协调性、可获得性。
- 大数据“五V”:Volume(量大)、Variety(多样)、Value(价值密度低)、Velocity(速度快)、Veracity(真实性)。
- 普查:特定目的、一次性、全面;重点调查:重点单位总量占比大;典型调查:有意识选择有代表性的单位。
易混点
- 分类数据不等于顺序数据:顺序数据能排先后,但类别代码之间不能做有意义的加减乘除。
- 一手/二手看使用者:同一份原始调查资料,对调查者是一手,对后来引用者是二手。
- 重点调查不推总体数量,主要掌握基本情况;抽样调查可依据随机原则推断总体。
- 分类与聚类:分类的类别事先已知,聚类的类别由算法从数据中发现。
记忆口诀
- 两类统计:“描述看现在,推断猜总体”。
- 九项质量:“真准全时,适经比协得”。
- 五V:“量多值低、速度真实”。
自测题(先答后看)
- 判断:用1表示男性、2表示女性后,性别就成为数值型数据。
答案:错。 数字只是类别代码,不能进行有意义的数值运算。
- 单选:某药企控制剂量和环境观察药效,取得的数据属于( )。A观测数据 B实验数据 C二手数据 D顺序数据
答案:B。 关键是人为控制实验对象或环境。
- 单选:为掌握全国人口总量和结构而逐户登记,最典型的方式是( )。A重点调查 B典型调查 C普查 D抽样调查
答案:C。 普查是一次性全面调查。
- 判断:没有标签的数据最适合直接做监督分类。
答案:错。 监督学习需要标签;无标签数据常用于聚类、降维等无监督学习。
- 多选:大数据“五V”包括( )。A数据量大 B数据类型多 C处理速度快 D价值密度低 E绝对无误差
答案:ABCD。 第五个V是真实性,不是“绝对无误差”。
- 简答:抽样调查和重点调查最核心的区别是什么?
答案: 抽样调查强调按抽样原则抽取样本并据此推断总体;重点调查选择在总体总量中占较大比重的重点单位,主要了解基本情况。
6刷题(章节配套练习,含校订与教学改编)
先做后看答案。单选点一下就判,多选选完点「核对答案」。错题自动进错题本,二轮会回来重做。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
校勘说明:为使抽样设计、数据来源或实验条件明确而作的校订后教学题设,不冒充原题原文。
7本章打卡
做完一项勾一项,当天页会自动更新整体进度。
学完这章就是往前走了一步。记不住的,明天再来看必背,不用今天全记住。
