← 每日首页
2026-09-24 · 第1轮

一轮精读 · 经济基础 第25—27章

55 天冲刺计划
3章26页教材120道题分段完成,不要求一小时学完全部章节
今日进度0 / 0 项已完
先完成眼前这一小段。 中午留一小时给精读和配套题,其余用5/12分钟碎片做回忆;不用一次做完整天。

1重点一览

先花 2 分钟看清这章有几个考点、哪几个是必考,心里有数再读书。

8页教材2个 ★★★0个 ★★1个 ★53道章节题约 64 分钟教材印刷页 221-228
考点一 抽样调查基本概念★★★
考点二 基本概率抽样方法★★★
考点三 估计量和样本量★

2教材标色 + 三色笔记

左边是教材原文,彩色句子就是《考点速记》收了的内容,颜色是星级。右边是速记的考点表,和左边的小节对齐。读一节,看一眼右边的表,再往下走。

一、抽样调查基本概念

教材 P221

(一)基本概念

抽样调查是使用频率最高的一种调查方式。它是指按照某种原则和程序,从总体中抽取一部分单位,通过对这一部分单位进行调查得到信息,以达到对总体情况的了解,或者对总体的有关参数进行估计。下面先介绍几个基本概念。

1. 总体与样本。总体即调查对象的全体。例如,欲对北京市的个体商业进行抽样调查,则北京市所有的个体商业单位就构成一个总体。如果要研究某公司所有注册在职人员的工资状况,总体就是该公司所有注册在职员工。在一项具体的调查项目中,调查总体必须是明确的而不能是模糊的。

样本是总体的一部分,它由从总体中按一定原则或程序抽出的部分个体所组成。因此,与总体一样,样本也是一个集合。每个被抽中进入样本的单位称为入样单位。样本中包含的入样单位的个数称为样本量。抽样调查中调查的具体实施是针对样本而言的。

2. 总体参数与样本统计量。总体参数是我们所关心变量的数字特征,它是根据总体中所有单位的数值计算的。例如,在对北京市个体商业进行的调查中,北京市个体商业的年零售总额就是一个总体参数。也可以说总体参数就是总体指标值,它是未知的常数,是我们通过调查想要了解的,不受样本的抽选结果影响。常用的总体参数有总体总量、总体均值、总体比例、总体方差等。例如,某公司所有注册在职人员的平均工资,某城市拥有两套以上住房的人口比例等。

样本统计量是根据样本中各单位的数值计算的,是对总体参数的估计,因此也称为估计量。样本统计量是一个随机变量,它取决于样本设计和正好被选入样本的单元特定组合。例如,用样本中员工的平均工资来估计该公司所有注册在职人员的平均工资,这里,样本中员工的平均工资是该公司所有员工平均工资的一个估计量。常用的样本统计量有样本均值、样本比例、样本方差等。

3. 抽样框。抽样框是供抽样所用的所有抽样单元的名单,是抽样总体的具体表现。在抽样框中,可以对每个单位编上一个号码,由此可以按一定随机化程序进行抽样。在抽样后,调查人员也可以根据抽样框上所提供的信息找到被选中的入样单位,从而实施调查。

抽样框可以有多种形式,常用的有名录框,如企业名录、电话号码簿、人员名册等。抽样框也可以是一张地图或其他适当形式。但不管什么形式,抽样框中的单位必须是有序的,便于编号。高质量的抽样框应当提供被调查单位更多的信息,并且没有重复和遗漏。

(二)概率抽样与非概率抽样

根据抽取样本方法的不同,可以将抽样分为概率抽样和非概率抽样两类。

概率抽样也称随机抽样,是指依据随机原则,按照某种事先设计的程序,从总体中抽取部分单元的方法。概率抽样具有以下特点:①按一定的概率以随机原则抽取样本。所谓随机原则,就是在抽取样本时排除主观上有意识地抽取调查单元的情况,使每个单元都有一定的机会

教材 P222

被抽中。②总体中每个单元被抽中的概率是已知的,或者是可以计算出来的。③当采用样本对总体参数进行估计时,要考虑到每个样本单元被抽中的概率。也就是说,估计量不仅与对样本单元的观测有关,也与样本单元被选入样本的概率有关。概率抽样中,如果每个单位被抽入样本的概率相等,则称这种抽样方法为等概率抽样;如果每个单位被抽入样本的概率不同,则称为不等概率抽样。无论等概率或不等概率抽样,抽取时都要通过一定的随机化程序来实现。

非概率抽样又称为非随机抽样,是调查者根据自己的方便或主观判断抽取样本的方法,其最主要的特征是抽取样本时并不是依据随机原则。这类抽样有许多不同的具体抽取样本的方法,下面列举一些主要的方法:①判断抽样。这是指在抽取样本时,调查人员依据调查目的和对调查对象情况的了解,人为确定样本单元。例如,选择“平均型”单元作为样本,选定的样本可以代表所研究变量的平均水平。②方便抽样。这是指在抽取样本时,依据方便原则,以达到最大限度降低调查成本的目的。比如“拦截式”调查,在街边或居民小区拦住行人进行调查。③自愿样本。这是指不是经过抽取,而是由自愿接受调查的单元所组成的样本。比较典型的是网上调查。④配额抽样。这是指将总体中的各单元按一定标准划分为若干类型,将样本数额分配到各类型中,从各类型中抽取样本的方法则没有严格限制,一般采用方便抽样的方法抽取样本单元。

(三)抽样调查的一般步骤

一般而言,一个完整的抽样调查过程需要以下几个步骤。

1. 确定调查问题。确定调查问题所要回答的是“要做什么样的调查研究”和“为什么要做这项调查研究”。在这个过程中需要明确地定义问题,包括对整个问题的叙述以及确定研究问题的具体组成部分。

2. 调查方案设计。这一阶段,要明确如何实施调查,主要包括抽样方案的设计和问卷设计。抽样方案描述如何抽取样本,问卷设计则将比较抽象的调研问题逐步细化,演变为现场调查中采访者询问的、比较具体的问题的工作过程。

3. 实施调查过程。在这个过程中要获得样本单元的调查数据,关键的问题是要保证原始数据的质量,这就需要对调查过程进行有效的管理和监控。在调查过程中,要有管理制度和措施,使得从事具体调查的人员有章可循,按章操作。

4. 数据处理分析。这个过程包括对调查获得的原始数据进行检查、核对,对验收合格的数据进行编码和录入,对录入的数据进行预处理,对数据进行统计分析,对总体参数进行估计等。

5. 撰写调查报告。调查报告是调查活动的最终成果,是前面劳动成果的展现。

(四)抽样调查中的误差

样本估计值和总体参数真值之间的差异称为误差。凡调查就一定有误差,误差或大或小总会存在,不可能完全避免。一般来说,调查中的误差可以分为抽样误差和非抽样误差两大类。

抽样误差是由于抽样的随机性造成的,用样本统计量估计总体参数时出现的误差。对任何抽样方案,都会存在许多待选样本,实际中抽到的只是其中一个样本。抽到哪一个样本完全是随机的,而抽到不同的样本,对总体的估计就会不同,这就是抽样误差产生的根本原因。

非抽样误差是指除抽样误差以外,由其他原因引起的样本统计量与总体真值之间的差异。非抽样误差产生的原因主要有以下三种。

1. 抽样框误差。例如,用市场监督管理局签发的营业执照作为个体商业的抽样框,对个体商业实施抽样调查,以掌握个体商业零售额的情况。但有些个体商贩是无照经营,这部分零售

教材 P223

额就会漏掉。有些人虽有营业执照,但已经转行,不再经商。用抽样框中的单位数对总体零售额进行推估,也会造成误差。有些人虽然只有一个摊点,却办理了多个营业执照,他入选样本的概率就是其他人的数倍,使得在设计入样概率基础上的估计结果失真。凡此种种都是由于抽样框不完善造成的,故称其为抽样框误差。

2. 无回答误差。现场调查中由于各种原因,调查人员没能从被调查者那里得到所需要的数据。例如,被调查者不在家,因病无法接受调查,拒绝接受调查等。可以把无回答分为两类:一类是由于随机因素造成的,如调查时被调查者恰巧不在家,这种无回答减少了有效样本量,会造成估计量方差增大;另一类无回答是非随机因素的影响,如被调查者不愿告诉实情而拒绝回答。第二类情况下,回答者与不回答者在调查指标上存在数量的差异,调查的结果中只有回答者的信息,却没有无回答者的信息。这类无回答不仅造成估计量方差增大,还会带来估计偏差。

3. 计量误差。计量误差是指由于调查所获得的数据与其真值之间不一致造成的误差。这种误差可能是由调查人员、问卷设计、受访者等原因造成的。例如,调查员在调查中有意无意地诱导被调查者,调查中的提问错误或记录答案错误,调查人员有意作弊,由于问卷的原因受访者对调查问题的理解上有偏误,受访者记忆不清,受访者提供虚假数字等。

二、几种基本概率抽样方法

概率抽样中有不同的抽样方法,下面简要介绍几种最基本的方法。

(一)简单随机抽样

简单随机抽样分为有放回简单随机抽样和不放回简单随机抽样两种方法。有放回简单随机抽样是指从总体中随机抽出一个样本单位,记录观测结果后,将其放回总体中去,再抽取第二个,以此类推,直到抽满 n 个单位为止。采用这种方法,单位有被重复抽中的可能。这种抽样方法容易造成信息重复而影响估计的效率,所以较少采用。不放回简单随机抽样是指从包含 N 个单元的总体中逐个随机地抽取单元并不放回,每次都在所有尚未被抽入样本的单元中等概率地抽取下一个单元,直到抽取 n 个单元为止。采用这种方法,每个单元最多只能被抽中一次,故不会由于样本单位被重复抽中而提供重复信息,所以比有放回抽样的抽样误差低。

简单随机抽样是最基本的随机抽样方法,操作简单,且每个单位的入样概率相同,因而样本估计量形式也比较简单。但是,简单随机抽样没有利用抽样框中更多的辅助信息,所以用样本统计量估计总体参数的效率受到影响。同时,在简单随机抽样条件下,样本的分布可能十分分散,这就增加了调查过程中的费用和时间。这种抽样方法的适用条件是:①抽样框中没有更多可以利用的辅助信息;②调查对象分布的范围不广阔;③个体之间的差异不是很大。

(二)分层抽样

分层抽样是指先按照某种规则把总体分为不同的层,然后在不同的层内独立、随机地抽取样本,这样所得到的样本称为分层样本。如果每层中的抽样都是简单随机抽样,则称为分层随机抽样。分层抽样的优点如下。①分层抽样不仅可以估计总体参数,同时也可以估计各层的参数。例如,按照行业将某市所有中小企业进行分层,进行就业人口的抽样调查,最终不仅能估计全市中小企业就业的相关指标,还可以在各行业进行推算。②便于抽样工作的组织。例如,某项全国范围的大型抽样调查,要编制全国范围的抽样框往往是一件非常困难的事,但如果按行政区划或行业分层后,可以调动各级主管部门的积极性,分头编制抽样框并实施抽样的组织和调查工作。此外,为了组织调查的方便,各层还可以根据层内的特点,分别采用不同的

教材 P224

抽样方法。③每层都要抽取一定的样本单位,这样样本在总体中分布比较均匀,可以降低抽样误差。例如,某部门共有 6 名员工,其中 3 名经理、3 名普通职员,现要估计该部门的平均工资。他们的年薪见表 25-1。

表 25-1 某部门员工年薪

编号经理层(万元)普通职员层(万元)
1126
2146
3148
合计4020

虽然很容易算出总体均值 Ȳ = (40 + 20) ÷ 6 = 10(万元),仍用概率抽样方法随机抽取 2 人为样本,并用样本数据对总体均值进行估计。在简单随机抽样下,抽中年薪最少的 2 个人的样本均值为 ȳ1 = (6 + 6) ÷ 2 = 6(万元),年薪最多的 2 个人的样本均值为 ȳ2 = (14 + 14) ÷ 2 = 14(万元),显然与总体均值 10 万元相比误差都比较大。如果抽样前已经知道所有员工的职位信息,且知道不同职位的员工年薪有较大差异,则可以采用分层抽样,在经理层中抽一人,在普通职员层中抽一人,共同组成样本,这时样本最小的可能值为 ȳ1 = (12 + 6) ÷ 2 = 9(万元),最大的可能值为 ȳ2 = (14 + 8) ÷ 2 = 11(万元),显然分层抽样的估计值更集中在总体均值周围。

分层抽样中,样本量在各层中分配的方法可以归为两类:等比例分配和不等比例分配。等比例分配是指层中单位数越多,在该层中抽取的样本单位就越多,该层的样本单位比例与该层中的总体单位比例相一致,即 nh ÷ n = Nh ÷ N。这里,n 为样本量,nh 为第 h 层的样本量,N 为总体单位数,Nh 为第 h 层的总体单位数。等比例分配操作比较容易,也易于理解,在实践中被广泛使用。但在有些情况下需要使用不等比例分配方法。比如各层单位数相差悬殊,如果按等比例抽样,总体单位数少的层所分到的样本量过小,代表性不足,就需要在该层适当增大样本量;或者有些层内的方差过大,为了降低抽样误差,在方差大的层中多抽,在方差小的层中少抽,这些都属于不等比例抽样。显然,在条件具备时,如果各层的总体方差已知,不等比例抽样的抽样误差可能比等比例抽样更小。

分层抽样的应用条件是:抽样框中有足够的辅助信息,能够将总体单位按某种标准划分到各层之中,实现在同一层内各单位之间的差异尽可能地小,不同层之间各单位的差异尽可能地大。

(三)系统抽样

系统抽样是指先将总体中的所有单元按一定顺序排列,在规定范围内随机抽取一个初始单元,然后按事先规定的规则抽取其他样本单元。最简单的系统抽样是等距抽样,即将总体 N 个单位按直线排列,根据样本量 n 确定抽样间隔,即抽样间隔为 N ÷ n ≈ k,k 为最接近 N ÷ n 的一个整数。在 1 ~ k 范围内随机抽取一个整数 i,令位于 i 位置上的单位为起始单位,往后每间隔 k 抽取一个单位,直至抽满 n。

系统抽样的优点是:①操作简便。它只需要随机确定起始单位,整个样本就自然确定了。

教材 P225

②对抽样框的要求也比较简单。它只要求总体单位按一定顺序排列,而不一定是一份具体的名录清单。例如,欲对某城市汽车尾气排放情况进行调查,抽样比为 1%,即平均每 100 辆车中抽 1 辆,采用系统抽样,可以将汽车牌号作为一种排列,在 1 ~ 100 中随机抽取一个号,如 53,结果凡牌号末两位为 53 的车辆均作为样本单位。

系统抽样的缺点是方差估计比较复杂,这就会给计算抽样误差带来一定困难。

系统抽样的估计效果与总体单位排列顺序有关。如果排列顺序与调查内容没有联系,称为按无关标识排列,这时系统抽样估计与简单随机抽样估计效率相仿。如果排列顺序与调查内容有关,称为按有关标识排列。按有关标识排列的系统抽样精度一般比简单随机抽样的精度高。上例对汽车尾气排放情况的调查中,是按汽车牌号排列,牌号与尾气排放没有关系,属于按无关标识排列。如果是按汽车价格排列,价格与尾气排放量有相关性,则属于按有关标识排列。在后一种情况下的系统样本中,既有高档汽车,也有低价位的汽车,样本的结构与总体的结构十分相似,因而可以有效降低抽样误差。

(四)整群抽样

整群抽样是将总体中所有的基本单位按照一定规则划分为互不重叠的群,抽样时直接抽取群,对抽中的群调查其全部基本单位,对没有抽中的群则不进行调查。例如,欲调查某市在职的房地产行业人员工资水平,将房地产行业所有在职人员按照所属企业分群,直接抽取企业单位,入样的企业单位内所有职工均接受调查,没有入样的企业单位员工都不调查。相对于简单随机抽样,整群抽样的优点有:①实施调查方便,可以节省费用和时间。在总体单位分布很广的条件下,如采用简单随机抽样,样本的分布十分分散,调查实施有一定难度,费时费力。而群中各单位的分布非常集中,抽中一个群以后,在一个点上可以调查多个单位,调查效率较高。②抽样框编制得以简化,抽样时只需要群的抽样框,而不要求全部基本单位的抽样框。例如,调查房地产行业在职人员工资水平时,没有所有员工名单的抽样框,但是有当地房地产企业的抽样框,所以可以依据该抽样框抽取单位,然后对抽中的企事业单位,调查其所有在职人员的工资水平。

整群抽样的主要缺点是:由于抽取的样本单位比较集中,群内各单位之间存在相似性,差异比较小,而群与群之间的差别往往比较大,使得整群抽样的抽样误差比较大。为了达到一定的误差要求,就有必要增大样本量,如多抽取一些群进行调查。但是,如果群的构造是相反的情况,即群内各单位之间存在较大的差异,而群与群的结构相似,整群抽样反而会降低估计误差。例如,以家庭为群,采用整群抽样估计某地区的男女比例,家庭内成员之间存在很大差异(有男有女),而家庭与家庭之间的性别结构却十分相似(同样也是有男有女),在这个背景下整群抽样估计男女比例的误差就低于简单随机抽样。所以,整群抽样特别适合于对某些特殊群结构进行调查。

(五)多阶段抽样

在大规模抽样调查中,一次抽取到最终样本单位是很难实现的,往往需要经过两个或两个以上阶段才能抽到最终样本单位,这就是多阶段抽样方法。首先从总体中采用随机方法抽取若干个小总体,称为初级单元;再在这些选中的初级单元中随机抽取若干个单位。如果经过两个阶段抽样,抽取到接受调查的最终单位,称为二阶段抽样;如果经过三个阶段才抽取到接受调查的最终单位,称为三阶段抽样,以此类推。所以,多阶段抽样是对经过两个及两个以上抽样阶段的抽样方法的统称。

在大范围的抽样调查中,采用多阶段抽样是必要的。首先,在大范围抽样调查中,往往没

教材 P226

有包括所有总体单位的抽样框,或者编制这样的抽样框十分困难。多阶段抽样是分阶段进行的,抽样框也可以分级进行准备。在第一阶段抽样中,只需准备总体中关于初级单元的抽样框;在第二阶段抽样中,仅在那些被抽中的初级单元中准备第二阶段抽样所需的抽样框。其次,因为多阶段抽样是在选中的单位中进行再抽选,这样就使样本的分布相对集中,从而可以节省调查中的人力和财力。例如,全国性的居民入户调查,首先抽区县,然后在选中的区县中抽居委会(村委会),最后在选中的居委会(村委会)中抽取居民户。如果构造下一级抽样框的工作和抽取样本的工作能得到各级行政单位的配合,则为多阶段抽样的实施创造了十分有利的条件。

多阶段的抽样设计比较复杂,这里不仅涉及如何划分阶段,还包括在每个阶段上应当抽取多大样本量,以及每个阶段的抽样方法。此外,多阶段的抽样误差计算也比较复杂。

现实中的抽样设计经常是多种抽样方法的组合。比如两阶段抽样中,第一阶段采用分层随机抽样,第二阶段采用系统抽样。又如采用分层抽样时,不同层内可以采用不同抽样方法,某些层内采用简单随机抽样,某些层内采用系统抽样。不同的抽样方法下,估计量会呈现不同的性质。因此,抽样设计中除了设计样本单位的选择之外,还需要选择适用的样本估计量。

三、估计量和样本量

(一)估计量的性质

在不同的抽样方法下,同一估计量也会有不同的估计效果。在同一抽样方法下,也会有不同的估计量可供选择,什么样的估计量是好估计量,下面以不放回简单随机抽样下的总体均值估计为例,介绍几个常用的选择标准。

1. 估计量的无偏性。假设一个总体包含 6,7,8,9,10 这 5 个数字。虽然很容易计算出总体均值为 8,但为说明估计量的性质,仍采用不放回简单随机抽样的方法,从中抽取 2 个数字作为样本,并选用样本均值作为估计量。由于总体比较小,可以列出所有可能的样本及相应样本均值,见表 25-2。

表 25-2 可能的样本组合及样本均值

样本样本均值
6,76.5
6,87
6,97.5
6,108
7,87.5
7,98
7,108.5
8,98.5
8,109
9,109.5
教材 P227

一共有 10 种不同的样本,显然用样本均值估计总体均值时,对于不同的样本可以得到不同的估计值,这些估计值的均值为:

(1 ÷ 10) × (6.5 + 7 + 7.5 + 8 + 7.5 + 8 + 8.5 + 8.5 + 9 + 9.5) = 8

与总体均值 8 相等。实际上,对于不放回简单随机抽样,所有可能的样本均值取值的平均值总是等于总体均值,这就是样本均值估计量的无偏性。

2. 估计量的有效性。在同一抽样方案下,对某一总体参数 θ,如果有两个无偏估计量 θ̂1 和 θ̂2,由于样本的随机性,θ̂1 的可能样本取值较 θ̂2 更密集在总体参数真值 θ 附近,人们会认为 θ̂1 比 θ̂2 更有效。

由于方差是度量分布密集或离散状况的重要指标,估计量方差常用于描述抽样误差。估计量方差越大,说明用可能的样本估计值之间的差异越大,用样本统计量估计总体参数的效率就越低,抽样误差越大。因此,θ̂1 比 θ̂2 更有效,必然有 Var(θ̂1) < Var(θ̂2),即 θ̂1 的方差小于 θ̂2 的方差。

3. 估计量的一致性。随着样本量的增大,估计量的值如果稳定于总体参数的真值,这个估计量就有一致性,可称为一致估计量。

(二)抽样误差的估计

抽样误差虽然无法避免,但它是可计算的。调查人员可以计算抽样误差有多大,并采用适当的方式(如增大样本量)对其进行控制。下面以不放回简单随机抽样下均值估计量为例,简要介绍估计量方差的估计方法。

假设从总体的 N 个单元中按照不放回简单随机抽样方法抽取 n 个单元作为样本,用 Y1,Y2,…,YN 表示总体关于变量 Y 的 N 个观测值,用 y1,y2,…,yn 表示样本中的 n 个观测值。把样本均值 ȳ = (1 ÷ n) × Σyi 作为总体均值 Ȳ = (1 ÷ N) × ΣYi 的估计量,则估计量 ȳ 的方差为:

V(ȳ) = (1 − n ÷ N) × S² ÷ n

式中,S² = [1 ÷ (N − 1)] × Σ(Yi − Ȳ)²,为总体方差。

由上面的估计量方差可以看出:①抽样误差与总体分布有关,总体单位值之间差异越大,即总体方差 S² 越大,抽样误差就越大;②抽样误差与样本量 n 有关,在其他条件相同的情况下,样本量越大,抽样误差就越小。此外,抽样误差与抽样方式和估计量的选择也有关系。例如,分层抽样的估计量方差一般小于简单随机抽样。利用有效辅助信息也可以有效地减小抽样误差。

(三)样本量的计算

通常情况下,样本中所包含的样本单位数量(样本量,n)增大,相应样本估计量的抽样误差会减小;反之,样本中所包含的样本单位数量(样本量,n)减少,相应样本估计量的抽样误差会增大。在实际应用中,样本量的确定主要应考虑以下几方面因素。

1. 调查的精度。调查的精度是指用样本数据对总体进行估计时可以接受的误差水平。要求的调查精度越高(误差水平越小),所需要的样本量就越大。

2. 总体的离散程度。在其他条件相同的情况下,总体方差越大,所需要的样本量也越大。

教材 P228

3. 总体的规模。对于大规模的总体,总体规模对样本量的需求几乎没有影响。但是对小规模的总体,总体规模越大,为保证相同估计精度,样本量也要随之增大(但不是同比例的)。

4. 无回答情况。无回答减少了有效样本量。在无回答率较高的调查项目中,样本量要大一些,以减少无回答带来的影响。

5. 经费的制约。调查经费是影响样本量的一个十分重要的因素。事实上,样本量是调查经费与调查精度之间的某种折中和平衡。

此外,调查的限定时间、实施调查的人力资源也是影响样本量的客观因素。

不考虑费用限制、无回答情况及其他影响因素时,简单随机抽样的样本量计算公式为:

n0 = uα² × S² ÷ d²,n = n0 ÷ (1 + n0 ÷ N)

其中,N 为总体规模,当总体规模很大(N 大于 10000)时,总体规模 N 对样本量 n 的影响较小,样本量 n 接近于 n0。uα 为标准正态分布的双侧 α 分位数,在置信度(1 − α)为 95% 时 uα 值为 1.96。d 为绝对允许误差,用于表示一定的置信度(1 − α)下样本估计值 θ̂ 与总体参数 θ 之间的误差不超过某一给定的最大可能范围 Pr(|θ̂ − θ| ≤ d) = 1 − α,允许误差越小,表明人们就越相信抽样结果接近于“真实”。S² 为总体方差,总体方差 S² 未知时,一般用样本方差 s² 替代。在比例估计中,若 P 为总体比例,则总体方差 S² 计算公式为 P(1 − P)。

假定待估计的总体比例在 0.5 附近,总体规模(N)为 1000 万,当绝对允许误差分别为 0.01、0.03、0.05 时,简单随机抽样所需要的样本量分别为 9604、1068、385。随着样本量的增大,增加同等样本量所增加的精度幅度呈下降趋势。

3必背

这些是必须背下来的。先遮住右边一列,看左边考点名,自己说出内容,说不出来的做记号。

经济基础 第25章 抽样调查 必背

红 ★★★ 必考

考点必背内容
总体调查对象的全体;具体调查中总体必须明确,不能模糊
样本总体的一部分,也是一个集合;抽中进入样本的单位叫入样单位,入样单位的个数叫样本量;调查的具体实施针对样本
抽样框供抽样用的所有抽样单元的名单,是抽样总体的具体表现;单位必须有序、便于编号;高质量抽样框要信息多、无重复无遗漏
总体参数按总体中所有单位数值算出来的总体指标值;是未知的常数,不受样本抽选结果影响;常见:总体总量、总体均值、总体比例、总体方差
样本统计量按样本中各单位数值算的,是对总体参数的估计,又叫估计量;是随机变量;常见:样本均值、样本比例、样本方差
概率抽样又叫随机抽样,依据随机原则按事先设计的程序抽;三特点:随机原则抽、每个单元被抽中概率已知或可算、估计时要考虑各单元被抽中的概率
非概率抽样又叫非随机抽样,靠方便或主观判断抽,最主要特征是不依据随机原则;四种「判方愿配」:判断抽样(人为定样本)、方便抽样(拦截式调查)、自愿样本(网上调查)、配额抽样(先分类型,再分配样本数额)
抽样误差由抽样的随机性造成;根本原因:抽到不同的样本,对总体的估计就不同;不可避免但可计算、可控制
非抽样误差除抽样误差以外的其他原因造成的差异;三种来源「框、答、量」:抽样框误差(重复、遗漏)、无回答误差(随机不在家 + 主观不愿答)、计量误差(诱导、提问错、作弊、理解偏、记忆不清、弄虚作假)
简单随机抽样分有放回和不放回两种;不放回误差更低,有放回较少用;适用条件三条:没有更多辅助信息、对象分布范围不广、个体差异不大
分层抽样先分层,再各层内独立随机抽;每层都简单随机抽叫分层随机抽样;优点三条:能估各层参数、便于组织、每层都抽从而降低抽样误差;应用条件:有足够辅助信息,层内差异小、层间差异大
系统抽样排好顺序,随机定起点,按规则往后抽;优点:操作简便、对抽样框要求低(只要有序不必有名单);缺点:方差估计复杂,算抽样误差难
整群抽样分成互不重叠的群,直接抽群,抽中的群全查、没抽中的不查;优点:省费用时间、只需群的抽样框;缺点:群内相似群间差异大,抽样误差大,要增大样本量(多抽几个群)
多阶段抽样经过两个及两个以上抽样阶段的抽样方法的统称

黄 ★★ 重点

本章速记里没有 ★★ 考点,只有两个 ★★★ 和一个 ★。

绿 ★ 里会考的点

考点必背内容
好估计量三性质无偏性(所有可能样本均值的平均值 = 总体均值)、有效性(取值越密集在真值附近越有效,方差小)、一致性(样本量越大越稳定于真值)
抽样误差影响因素总体方差越大误差越大;样本量越大误差越小;和抽样方式、估计量选择有关(分层抽样方差一般小于简单随机抽样);利用辅助信息可减小误差
样本量影响因素「精、散、模、答、钱」:精度越高样本越大;总体越离散样本越大;大总体几乎不影响、小总体越大样本要随之增大(非同比例);无回答率高要多抽;经费是精度和经费的折中;另有时间和人力

数字与公式清单

  • 分层抽样等比例分配:nh ÷ n = Nh ÷ N(该层样本比例 = 该层在总体中的比例)
  • 系统抽样抽样间隔:N ÷ n ≈ k(k 取最接近的整数),在 1 ~ k 里随机选起点 i,以后每隔 k 抽一个
  • 不放回简单随机抽样均值估计量方差:V(ȳ) = (1 − n ÷ N) × S² ÷ n,S² 为总体方差
  • 简单随机抽样样本量:n0 = uα² × S² ÷ d²,n = n0 ÷ (1 + n0 ÷ N);N 大于 10000 时 n 接近 n0
  • 95% 置信度对应 uα = 1.96;比例估计的总体方差 S² = P(1 − P)
  • 总体比例 0.5 附近、N 为 1000 万时,允许误差 0.01、0.03、0.05 对应样本量 9604、1068、385
  • 教材例子:6 名员工年薪,简单随机抽 2 人均值范围 6 到 14 万元,分层抽样范围 9 到 11 万元,总体均值 10 万元
  • 教材例子:总体 6、7、8、9、10,抽 2 个共 10 种样本,样本均值的平均值 = 8 = 总体均值(无偏性)

4总结

一页纸看完整章。二轮快刷和考前只看这里和必背。

经济基础 第25章 抽样调查 一页纸总结

本章一句话

不可能把所有人都问一遍,所以从总体里抽一部分(样本)来推全体。这章讲三件事:抽样要用哪些词(总体、样本、抽样框、参数、统计量)、误差从哪来、五种抽法怎么抽(简单随机、分层、系统、整群、多阶段),最后附带讲什么叫好的估计量、样本要抽多少。

章末总览表

考点星级一句话要点考法
考点一 抽样调查基本概念★★★总体参数是未知常数、样本统计量是随机变量;概率抽样三特点、非概率抽样四种「判方愿配」;抽样误差由随机性造成,非抽样误差三来源「框、答、量」单选(概念辨析)、多选(概率抽样特点、非概率抽样方法、非抽样误差来源)
考点二 基本概率抽样方法★★★五种方法「简分系群多」各自的含义、优缺点、适用条件;分层要层内像层间不像,整群误差大要多抽群,系统抽样简便但方差难算单选(给场景判断是哪种抽样)、多选(某种方法的优点或适用条件)
考点三 估计量和样本量★好估计量三性:无偏、有效、一致;抽样误差随总体方差增大、随样本量减小;样本量五因素「精、散、模、答、钱」单选、多选(影响因素方向题)

易错坑

  1. 总体参数不受样本影响,它是固定的真值;会随样本变的是样本统计量(估计量)。
  2. 配额抽样也「分类」,但它是非概率抽样;分层抽样才是概率抽样。题目里出现「按方便原则」「人为确定」「自愿」就是非概率。
  3. 分层抽样和整群抽样的区别:分层是每层都抽一部分,整群是抽几个群、抽中的群全查。分层要层内差异小,整群最怕群内差异小(会让误差变大)。
  4. 系统抽样的缺点是「方差估计复杂」,整群抽样的缺点才是「抽样误差大」,别互换。
  5. 总体规模对样本量的影响:大总体(大于 10000)几乎没影响,小总体才随之增大且不是同比例;不是「总体越大样本一定按比例越大」。

和前后章的关系

第 24 章描述统计讲的均值、方差是本章估计量和总体方差的基础,本章把「拿样本推总体」的过程讲清楚,抽样误差的公式里就用到了总体方差。后面第 26 章回归分析、第 27 章时间序列都是在拿到样本数据之后做分析,本章是数据从哪来的那一步。

5解读(读透版讲义)

哪里没看懂,来这里看大白话讲解。生活例子、考法、坑都在这。可以先读这个再回去读教材。

抽样调查(教材原文·OCR)

文字为主,公式/图表以教材扫描为准。配套精华看复习网页。

第二十五章 抽样调碍

一\抽样调查基本概念

( 一 )基本概念

抽样调查是使用频率最高的一种调查方式。它是指按照某种原则和程序,从总体中抽取
一部分单位,通过对这一部分单位进行调查得到信息,以达到对总体情况的了解 ,或者对总体
的有关参数进行估计。下面先介绍几个基本概念。

  1. 总体与样本。总体即调查对象的全体。例如 ,欲对北京市的个体商业进行抽样调查,则

北京市所有的个体商业单位就构成一个总体。如果要研究某公司所有注册在职人员的工资状
况,总体就是该公司所有注册在职员工。在一项具体的调查项目中,调查总体必须是明确的而
不能是模糊的。

样本是总体的一部分,它由从总体中按一定原则或程序抽出的部分个体所组成。因此,与
总体一样,样本也是一个集合。每个被抽中进入样本的单位称为人样单位。样本中包含的人
样单位的个数称为样本量。抽样调查中调查的具体实施是针对样本而言的。

  1. 总体参数与样本统计量。总体参数是我们所关心变量的数字特征,它是根据总体中所

有单位的数值计算的。例如,在对北京市个体商业进行的调查中 ,北京市个体商业的年零售总
额就是一个总体参数。也可以说总体参数就是总体指标值,它是未知的常数,是我们通过调查
想要了解的,不受样本的抽选结果影响。常用的总体参数有总体总量 ,总体均值 ,总体比例 总
体方差等。例如,某公司所有注册在职人员的平均工资,某城市拥有两套以上住房的人口比例
等。

样本统计量是根据样本中各单位的数值计算的,是对总体参数的估计,因此也称为估计
量。样本统计量是一个随机变量,它取决于样本设计和正好被选和人样本的单元特定组合。例
如,用样本中员工的平均工资来估计该公司所有注册在职人员的平均工资,这里,样本中员工
的平均工资是该公司所有员工平均工资的一个估计量。常用的样本统计量有样本均值.样本
比例,样本方差等。

  1. 抽样框。抽样框是供抽样所用的所有抽样单元的名单 ,是抽样总体的具体表现。在抽

样框中,可以对每个单位编上一个号码,由此可以按一定随机化程序进行抽样。在抽样后,调
查人员也可以根据抽样框上所提供的信息找到被选中的人样单位,从而实施调查。

抽样框可以有多种形式,常用的有名录框,如企业名录 .电话每人员名册等。抽样框也可
以是一张地图或其他适当形式。但不管什么形式,抽样框中的单位必须是有序的,便于编号。
高质量的抽样框应当提供被调查单位更多的信息,并且没有重复和遗漏。

( 二 )概率抽样与非概率抽样

根据抽取样本方法的不同,可以将抽样分为概率抽样和非概率抽样两类。

概率抽样也称随机抽样,是指依据随机原则 ,按照某种事先设计的程序,从总体中抽取部
分单元的方法。概率抽样具有以下特点: 四按一定的概率以随机原则抽取样本。所谓随机原
则 ,就是在抽取样本时排除主观上有意识地抽取调查单元的情况,使每个单元都有一定的机会

"222 .经济基础知识 (中级)

被抽中。@)总体中每个单元被抽中的概率是已知的,或者是可以计算出来的。图当采用样本
对总体参数进行估计时,要考虑到每个样本单元被抽中的概率。也就是说,估计量不仅与对样
本单元的观测有关,也与样本单元被选人样本的概率有关。概率抽样中,如果每个单位被抽
入样本的概率相等,则称这种抽样方法为等概率抽样; 如果每个单位被抽入样本的概率不同,
则称为不等概率抽样。无论等概率或不等概率抽样 ,抽取时都要通过一定的随机化程序来实
现。

非概率抽样又称为非随机抽样,是调查者根据自己的方便或主观判断抽取样本的方法,其
最主要的特征是抽取样本时并不是依据随机原则。这类抽样有许多不同的具体抽取样本的方
法,下面列举一些主要的方法: 四判断抽样。这是指在抽取样本时,调查人员依据调查目的和
对调查对象情况的了解,人为确定样本单元。例如 ,选择“平均型 单元作为样本 ,选定的样本
可以代表所研究变量的平均水平。@)方便抽样。这是指在抽取样本时 ,依据方便原则 ,以达到
最大限度降低调查成本的目的。比如“拦截式" 调查,在街边或居民小区拦住行人进行调查。
图自愿样本。这是指不是经过抽取,而是由自愿接受调查的单元所组成的样本。比较典型的
是网上调查。色配额抽样。这是指将总体中的各单元按一定标准划分为若干类型,将样本数
额分配到各类型中,从各类型中抽取样本的方法则没有严格限制 ,一般采用方便抽样的方法抽
取样本单元。

( 三 )抽样调查的一般步又

一般而言 ,一个完整的抽样调查过程需要以下几个步骤。

  1. 确定调查问题。确定调查问题所要回答的是“要做什么样的调查研究”和“为什么要

做这项调查研究”。在这个过程中需要明确地定义问题,包括对整个问题的叙述以及确定研究
问题的具体组成部分。

  1. 调查方案设计。这一阶段,要明确如何实施调查, 主要包括抽样方案的设计和问卷设

计。抽样方案描述如何抽取样本,问卷设计则将比较抽象的调研问题逐步细化,演变为现场调
查中采访者询问的.比较具体的问题的工作过程。

  1. 实施调查过程。在这个过程中要获得样本单元的调查数据,关键的问题是要保证原始

数据的质量,这就需要对调查过程进行有效的管理和监控。在调查过程中,要有管理制度和措
施,使得从事具体调查的人员有章可循,按章操作。

  1. 数据处理分析。这个过程包括对调查获得的原始数据进行检查 ,核对,对验收合格的数

据进行编码和录入,对录入的数据进行预处理,对数据进行统计分析,对总体参数进行估计等。

  1. 撰写调查报告。调查报告是调查活动的最终成果,是前面劳动成果的展现。

(四 )抽样调查中的误差

样本估计值和总体参数真值之问的差异称为误差。凡调查就一定有误差,误差或大或小
总会存在,不可能完全避免。一般来说,调查中的误差可以分为抽样误差和非抽样误差两大类。

抽样误差是由于抽样的随机性造成的,用样本统计量估计总体参数时出现的误差。对任
何抽样方案,都会存在许多待选样本,实际中抽到的只是其中一个样本。抽到哪一个样本完全
是随机的,而抽到不同的样本,对总体的估计就会不同,这就是抽样误差产生的根本原因。

非抽样误差是指除抽样误差以外,由其他原因引起的样本统计量与总体真值之间的差异。
非抽样误差产生的原因主要有以下三种。

  1. 抽样框误差。例如,用市场监督管理局签发的营业执照作为个体商业的抽样框,对个体

商业实施抽样调查,以掌握个体商业零售额的情况。但有些个体商贩是无照经营,这部分零售

第二让五章,抽“*样"调查 '223,

额就会漏掉。有些人虽有营业执照,但已经转行,不再经商。用抽样框中的单位数对总体零售
额进行推估,也会造成误差。有些人虽然只有一个摊点,却办理了多个营业执照,他人选样本
的概率就是其他人的数倍,使得在设计人样概率基础上的估计结果失真。凡此种种都是由于

  1. 无回答误差。现场调查中由于各种原因,调查人员没能从被调查者那里得到所需要的

数据。例如,被调查者不在家,因病无法接受调查,拒绝接受调查等。可以把无回答分为两类:
一类是由于随机因素造成的,如调查时被调查者恰巧不在家,这种无回答减少了有效样本量,会
造成估计量方差增大; 另一类无回答是非随机因素的影响,如被调查者不愿告诉实情而拒绝回
答。第二类情况下 ,回答者与不回答者在调查指标上存在数量的差异 ,调查的结果中只有回答
者的信息,却没有无回答者的信息。这类无回答不仅造成估计量方差增大,还会带来估计偏差。

  1. 计量误差。计量误差是指由于调查所获得的数据与其真值之间不一致造成的误差。这

种误差可能是由调查人员 ,问卷设计 `受访者等原因造成的。例如,调查员在调查中有意无意
地诱导被调查者,调查中的提问错误或记录答案错误,调查人员有意作弊,由于问卷的原因受
访者对调查问题的理解上有偏误,受访者记忆不清,受访者提供虚假数字等。

二\几种基本概率抽样方法

概率抽样中有不同的抽样方法,下面简要介绍几种最基本的方法。

( 一)简单随机抽样

简单随机抽样分为有放回简单随机抽样和不放回简单随机抽样两种方法。有放回简单随
机抽样是指从总体中随机抽出一个样本单位,记录观测结果后,将其放回总体中去,再抽取第
二个,以此类推,直到抽满个单位为止。采用这种方法,单位有被重复抽中的可能。这种抽
样方法容易造成信息重到而影响估计的效率,所以较少采用。不放回简单随机抽样是指从包
含 个单元的总体中逐个随机地抽取单元并不放回 ,每次都在所有尚未被抽和样本的单元中
等概率地抽取下一个单元,直到抽取半个单元为止。采用这种方法,每个单元最多只能被抽中
一次,故不会由于样本单位被重复抽中而提供重琶信息,所以比有放回抽样的抽样误差低。

简单随机抽样是最基本的随机抽样方法,操作简单 ,且每个单位的入样概率相同,因而样
本估计量形式也比较简单。但是,简单随机抽样没有利用抽样框中更多的辅助信息,所以用样
本统计量估计总体参数的效率受到影响。同时,在简单随机抽样条件下 ,样本的分布可能十分
分散,这就增加了调查过程中的费用和时间。这种抽样方法的适用条件是: 中抽样框中没有更
多可以利用的辅助信息; @)调查对象分布的范围不广阔; @个体之间的差异不是很大。

( 二 )分层抽样

分层抽样是指先按照某种规则把总体分为不同的层,然后在不同的层内独立 .随机地抽取
样本,这样所得到的样本称为分层样本。如果每层中的抽样都是简单随机抽样 ,则称为分层随
机抽样。分层抽样的优点如下。钙分层抽样不仅可以估计总体参数,同时也可以估计各层的
参数。例如,按照行业将某市所有中小企业进行分层,进行就业人口的抽样调查,最终不仅能
估计全市中小企业就业的相关指标,还可以在各行业进行推算。@便于抽样工作的组织。例
如,某项全国范围的大型抽样调查,要编制全国范围的抽样框往往是一件非常困难的事,但如
果按行政区划或行业分层后,可以调动各级主管部门的积极性,分头编制抽样框并实施抽样的
组织和调查工作。此外,为了组织调查的方便,各层还可以根据层内的特点,分别采用不同的

. 224 ”经济基础知识 (中级)

抽样方法。@)每层都要抽取一定的样本单位,这样样本在总体中分布比较均匀,可以降低抽
样误差。例如,某部门共有6 名员工,其中3 名经理.3 名普通职员 ,现要估计该部门的平均工
资。他们的年薪见表 25-1。

表 25-1 某部门员工年薪
编号 经理层( 万元 ) 普通职员层( 万元 )
1 12 6
2 14 6
3 14 8
合计 40 20
虽然很容易算出总体均值子=各二2 -10( 万元),仍用概率抽样方法随机抽取 2 人为样

本,并用样本数据对总体均值进行估计。在简单随机抽样下 ,抽中年薪最少的 2 个人的样本

均值为 放 =@ 二6 =6( 万元 ),年薪最多的 2 个人的样本均值为元 = 地半地 = 14(万元)显然
与总体均值 10 万元相比误差都比较大。如果抽样前已经知道所有员工的职位信息,且知着
不同职位的员工年薪有较大差异,则可以采用分层抽样,在经理层中抽一人,在普通职员层

中抽一人,共同组成样本,这时样本最小的可能值为 亢 = 也:*6 =9( 万元),最大的可能值为
元=革汪= 11(万元)显然分层抽样的估计值更集中在总体均值周轩。

分层抽样中,样本量在各层中分配的方法可以归为两类: 等比例分配和不等比例分配。
等比例分配是指层中单位数越多,在该层中抽取的样本单位就越多,该层的样本单位比例与该
层中的总体单位比例相一致,即 六 = 让。 这里 , 为样本量,mw 为第大层的样本量, N 为总体音
位数,N 为第坟层的总体单位数。等比例分配操作比较容易,也易于理解,在实践中被广泛使
用。但在有些情况下需要使用不等比例分配方法。比如各层单位数相差悬殊,如果按等比例
抽样,总体单位数少的层所分到的样本量过小,代表性不足,就需要在该层适当增大样本量;或
者有些层内的方差过大,为了降低抽样误差,在方差大的层中多抽,在方差小的层中少抽,这些
都属于不等比例抽样。显然,在条件具备时,如果各层的总体方差已知,不等比例抽样的抽样
误差可能比等比例抽样更小。

分层抽样的应用条件是: 抽样框中有是够的辅助信息,能够将总体单位按某种标准划分
到各层之中,实现在同一层内各单位之间的差异尽可能地小,不同层之间各单位的差异尽可能
地大。

( 三 )系统抽样

系统抽样是指先将总体中的所有单元按一定顺闯排列,在规定范围内随机抽取一个初始
单元,然后按事先规定的规则抽取其他样本单元。最简单的系统抽样是等距抽样,即将总体
W 个单位按直线排列,根据样本量 ”确定抽样间隔,即抽样间隔为 定~刀上为最接近六 的一
个整数。在 1趟范围内随机抽取一个整数.令位于;i 位置上的单位为起始单位,往后每间隔
抽取一个单位,直至抽满/。

系统抽样的优点是: 四操作简便。它只需要随机确定起始单位,整个样本就自然确定了。

第二让亚章”,抽*样"调查 225,

@)对抽样框的要求也比较简单。它只要求总体单位按一定顺序排列,而不一定是一份具体的
名录清单。例如 ,欲对某城市汽车尾气排放情况进行调查,抽样比为 1%,即平均每 100 辆车中
抽 1 辆,采用系统抽样,可以将汽车牌号作为一种排列,在 1~100 中随机抽取一个号,如 53 ,结
果凡牌号末两位为 53 的车辆均作为样本单位。

系统抽样的缺点是方差估计比较复杂,这就会给计算抽样误差带来一定困难。

系统抽样的估计效果与总体单位排列顺序有关。如果排列顺序与调查内容没有联系 ,称
为按无关标识排列,这时系统抽样估计与简单随机抽样估计效率相仿。如果排列顺序与调查
内容有关,称为按有关标识排列。按有关标识排列的系统抽样精度一般比简单随机抽样的精
度高。上例对汽车尾气排放情况的调查中,是按汽车牌号排列 ,牌号与尾气排放没有关系,属
于按无关标识排列。如果是按汽车价格排列,价格与尾气排放量有相关性,则属于按有关标识
排列。在后一种情况下的系统样本中,既有高档汽车,也有低价位的汽车,样本的结构与总体
的结构十分相似,因而可以有效降低抽样误差。

(四 )整群抽样

整群抽样是将总体中所有的基本单位按照一定规则划分为互不重到的群,抽样时直接抽
取群,对抽中的群调查其全部基本单位,对没有抽中的群则不进行调查。例如,和欲调查某市在
职的房地产行业人员工资水平,将房地产行业所有在职人员按照所属企业分群,直接抽取企业
单位,和人样的企业单位内所有职工均接受调查,没有入样的企业单位员工都不调查。相对于简
单随机抽样,整群抽样的优点有: @实施调查方便,可以节省费用和时间。在总体单位分布很
广的条件下 ,阁采用简单随机抽样 ,样本的分布十分分散,调查实施有一定难度,费时费力。而
群中各单位的分布非常集中 ,抽中一个群以后,在一个点上可以调查多个单位,调查效率较高。
@抽样框编制得以简化,抽样时只需要群的抽样框,而不要求全部基本单位的抽样框。例如,
调查房地产行业在职人员工资水平时,没有所有员工名单的抽样框,但是有当地房地产企业的
抽样框,所以可以依据该抽样框抽取单位,然后对抽中的企事业单位 ,调查其所有在职人员的
工资水平。

整群抽样的主要缺点是: 由于抽取的样本单位比较集中,群内各单位之间存在相似性,差
异比较小 ,而群与群之间的差别往往比较大,使得整群抽样的抽样误差比较大。为了达到一定
的误差要求,就有必要增大样本量,如多抽取一些群进行调查。但是,如果群的构造是相反的
情况,即群内各单位之间存在较大的差异 ,而群与群的结构相似,整群抽样反而会降低估计误
差。例如,以家庭为群,采用整群抽样估计某地区的男女比例,家庭内成员之间存在很大差异
(有男有女 ),而家庭与家庭之间的性别结构却十分相似( 同样也是有男有女 ),在这个背景
整群抽样估计男女比例的误差就低于简单随机抽样。所以,整群抽样特别适合于对某些特殊
群结构进行调查。

(五 )多阶段抽样

在大规模抽样调查中 ,一次抽取到最终样本单位是很难实现的,往往需要经过两个或两个
以上阶段才能抽到最终样本单位,这就是多阶段抽样方法。首先从总体中采用随机方法抽取
若干个小总体,称为初级单元; 再在这些选中的初级单元中随机抽取若干个单位。如果经过两
个阶段抽样,抽取到接受调查的最终单位 ,称为二阶段抽样; 如果经过三个阶段才抽取到接受
调查的最终单位,称为三阶段抽样,以此类推。所以,多阶段抽样是对经过两个及两个以上抽
样阶段的抽样方法的统称。

在大范围的抽样调查中,采用多阶段抽样是必要的。首先,在大范围抽样调查中 ,往往没

“ 226 ”经济基础知误 (中级)

有包括所有总体单位的抽样框,或者编制这样的抽样框十分困难。多阶段抽样是分阶段进行
的,抽样框也可以分级进行准备。在第一阶段抽样中,只需准备总体中关于初级单元的抽样
框; 在第二阶段抽样中,仅在那些被抽中的初级单元中准备第二阶段抽样所需的抽样框。其
次,因为多阶段抽样是在选中的单位中进行再抽选,这样就使样本的分布相对集中,从而可以
节省调查中的人力和财力。例如,全国性的居民入户调查,首先抽区县,然后在选中的区县中
抽居委会( 村委会 ),最后在选中的居委会( 村委会 )中抽取居民户。如果构造下一级抽样杠
的工作和抽取样本的工作能得到各级行政单位的配合,则为多阶段抽样的实施创造了十分有
利的条件。

多阶段的抽样设计比较复杂,这里不仅涉及如何划分阶段,还包括在每个阶段上应当抽取
多大样本量,以及每个阶段的抽样方法。此外,多阶段的抽样误差计算也比较复杂。

现实中的抽样设计经常是多种抽样方法的组合。比如两阶段抽样中,第一阶段采用分层
随机抽样,第二阶段采用系统抽样。又如采用分层抽样时,不同层内可以采用不同抽样方法,
某些层内采用简单随机抽样 ,某些层内采用系统抽样。不同的抽样方法下 ,估计量会呈现不同
的性质。因此 ,抽样设计中除了设计样本单位的选择之外,还需要选择适用的样本估计量。

三\估计量和样本量

(一)估计量的性质

在不同的抽样方法下 ,同一估计量也会有不同的估计效果。在同一抽样方法下 ,也会有不
同的估计量可供选择,什么样的估计量是好估计量, 下面以不放回简单随机抽样下的总体均值
估计为例 ,介绍几个常用的选择标准。

  1. 估计量的无偏性。假设一个总体包含 6,7, 8, 9, 10 这 5 个数字。虽然很容易计算出总

体均值为8,但为说明估计量的性质,仍采用不放回简单随机抽样的方法,从中抽取 2 个数字
作为样本 ,并选用样本均值作为估计量。由于总体比较小,可以列出所有可能的样本及相应样
本均值,见表 25-2。

表 25-2 可能的样本组合及样本均值
样本 样本均值
6,7 6.5
6,8 7
6,9 7.5
6, 10 8
7,8 7.5
7,9 8
7,10 8.5
8,9 8.5
8,10 9
9, 10 9.5

第二让五章”,抽“*样"调`查 227,

一共有 10 种不同的样本,显然用样本均值估计总体均值时,对于不同的样本可以得到不
同的估计值,这些估计值的均值为:
疝x(6.5 +7+7.5+8+7.5+8+8.5+8.5+9+9.5) =8

与总体均值 8 相等。实际上,对于不放回简单随机抽样,所有可能的样本均值取值的平均
值总是等于总体均值,这就是样本均值估计量的无偏性。

  1. 估计量的有效性。在同一抽样方案下,对某一总体参数 b ,如果有两个无偏估计量 b

和 饭 ,由于样本的随机性,b 的可能样本取值较 b. 更密集在总体参数真值 6 附近,人们会认
为 比 负 更有效。

由于方差是度量分布密集或离散状况的重要指标,估计量方差常用于描述抽样误差。估
计量方差越大,说明用可能的样本估计值之间的差异越大,用样本统计量估计总体参数的效率
就越低 ,抽样误差越大。因此,6 比 岂 更有效,必然有 Var(b ) 一 Var(外),即 b 的方差小于
6 的方差。

  1. 估计量的一致性。随着样本量的增大,估计量的值如果稳定于总体参数的真值 ,这个估

计量就有一致性,可称为一致估计量。

( 二 )抽样误差的估计

抽样误差虽然无法避免,但它是可计算的。调查人员可以计算抽样误差有多大,并采用适
当的方式( 如增大样本量 ) 对其进行控制。下面以不放回简单随机抽样下均值估计量为例 ,简

要介绍估计量方差的估计方法。

假设从 生体间上个旦于中入时不放四午间请机销杰方法掉取"人于下作为本,

用妃,克,: 天起休关于灾昌了的个再测全 用入, 力,…,六表示样本中的个

观测值。把样本均值 了=圭 二> 作为总体均值了=二 攻之 的估计量,则估计量了的方差

K刀=(1 -二上

式中,= 六> (也 - 芒? ,为总体方差。

由上面的估计量方差可以看出: 中抽样误差与总体分布有关,总体单位值之间差异越大,
即总体方差 $ 越大,抽样误差就越大; @抽样误差与样本量z 有关,在其他条件相同的情况
下 ,样本量越大,抽样误差就越小。此外,抽样误差与抽样方式和估计量的选择也有关系。例
如,分层抽样的估计量方差一般小于简单随机抽样。利用有效辅助信息也可以有效地减小抽

( 三 )样本量的计算

通常情况下 ,样本中所包含的样本单位数量(样本量,m )增大,相应样本佑计量的抽样误
差会减小; 反之,样本中所包含的样本单位数量( 样本量,m ) 减少,相应样本估计量的抽样误
差会增大。在实际应用中 ,样本量的确定主要应考虑以下几方面因素。

  1. 调查的精度。调查的精度是指用样本数据对总体进行估计时可以接受的误差水平。要

求的调查精度越高( 误差水平越小 ) 所需要的样本量就越大。

  1. 总体的离散程度。在其他条件相同的情况下 ,总体方差越大,所需要的样本量也越大。

' 228 经济基础知识 (中级)

3.总体的规模。对于大规模的总体,总体规模对样本量的需求几乎没有影响。但是对
小规模的总体,总体规模越大,为保证相同估计精度,样本量也要随之增大( 但不是同比例
的)。

  1. 无回答情况。无回答减少了有效样本量。在无回答率较高的调查项目中,样本量要大

一些,以减少无回答带来的影响。

  1. 经费的制约。调查经费是影响样本量的一个十分重要的因素。事实上,样本量是调查

经费与调查精度之间的某种折中和平衡。

此外,调查的限定时间 ,实施调查的人力资源也是影响样本量的客观因素。

不考虑费用限制,无回答情况及其他影响因素时 ,简单随机抽样的样本量计算公式为:

其中, N 为总体规模, 当总体规模很大(大于 10000 )时,总体规模N对样本量” 的
影响较小,样本量 接近于 m。us 为标准正态分布的双侧 a 分位数,在置信度(1-a )为
95% 时 us 值为1.96。d 为绝对允许误差,用于表示一定的置信度(1-a )下样本估计值 6
与总体参数 0 之间的误差不超过某一给定的最大可能范围户(|6 -6|和4)=1-a ,多
许误差越小,表明人们就越相信抽样结果接近于“真实*。$S 为总体方差,总体方差 ?未知
时,一般用样本方差 替代。在比例估计中,若己为总体比例,则总体方差$ 计算公式为
P(1-P)。

假定待估计的总体比例在 0.5 附近,总体规模(N ) 为 1000 万,当绝对允许误差分别为
0.01.0.03 .0.05 时,简单随机抽样所需要的样本量分别为 9604、1068、385。随着样本量的增
大,增加同等样本量所增加的精度幅度呈下降趋势。


零基础复习卡(两版教材核验)

来源核验:主教材《2026经济基础知识中级原书有色差(371)》PDF 第232-239页;《经济基础知识(中级)-292》PDF 第186-191页(书内第178-183页)。

一句话先懂

抽样调查不是“随便找几个人问”,而是用可说明的抽样程序取得样本,再用样本统计量估计总体参数。

零基础解释

  1. 四个基本名词:总体是全部研究对象,样本是被抽中的部分;总体参数是未知但固定的总体数字特征,样本统计量随抽到谁而变化。
  2. 抽样框:实际供抽样使用的全部抽样单元名单。名单漏人、重复或含不属于总体的单位,会产生抽样框误差。
  3. 概率抽样:每个单位被抽中的概率已知或可计算,因而能估计抽样误差。常见有简单随机、分层、系统、整群和多阶段抽样。
  4. 非概率抽样:被抽中概率未知,如判断、方便、自愿、配额、滚雪球抽样,速度快但总体推断能力弱。
  5. 误差:抽样误差来自只调查部分单位;非抽样误差包括抽样框、无回答、计量等误差,普查也会有非抽样误差。
  6. 好估计量:无偏性看长期平均是否等于真值;有效性看同为无偏时谁方差更小;一致性看样本量增大后是否趋近真值。

必背清单

  • 简单随机:每个单位等概率,分有放回和不放回。
  • 分层抽样:“层内相似、层间差异”,每层都抽,适合总体差异明显且有分层信息。
  • 系统抽样:先随机起点,再按固定间隔抽取;总体名单不能有与间隔重合的周期性。
  • 整群抽样:抽中群后调查群内全部单位;“群内尽量杂、群间尽量像”。
  • 多阶段抽样:分阶段逐级抽,例如省-市-县-家庭。
  • 样本量通常随精度要求提高、总体离散程度增大、预计无回答率上升而增大;对很大总体,总体规模继续增大影响很小。

易混点

  • 分层和整群正相反:分层每层抽一部分;整群抽若干群并调查群内全部单位。
  • 抽样误差不是调查错误,是概率抽样只观察部分总体产生的随机差异。
  • 普查没有抽样误差,但有非抽样误差。
  • 样本统计量是随机变量,总体参数是未知常数。

记忆口诀

  • “层内同、层间异;群内杂、群间似”。
  • 估计量三性:“均值对真叫无偏,方差更小叫有效,样本越大越靠近叫一致”。

自测题

  1. 判断:总体均值会随本次抽到的样本不同而变化。

答案:错。 总体参数是未知常数,变化的是样本统计量。

  1. 单选:先把学生按年级分组,再从每个年级随机抽人,属于( )。A整群 B分层 C系统 D判断

答案:B。 每一层都抽取部分单位。

  1. 单选:随机抽取若干班级,调查被抽班级的全部学生,属于( )。A整群 B分层 C配额 D方便

答案:A。 抽中的是群,群内全部调查。

  1. 判断:普查不会产生任何调查误差。

答案:错。 普查没有抽样误差,但仍可能有无回答、计量等非抽样误差。

  1. 单选:两个无偏估计量中,方差较小者具有更好的( )。A一致性 B有效性 C代表性 D完整性

答案:B。 有效性用估计量方差比较。

  1. 多选:其他条件不变,会使所需样本量增加的有( )。A允许误差缩小 B总体离散程度增大 C预计无回答率上升 D精度要求降低

答案:ABC。 精度要求降低通常可减少样本量。

6刷题(章节配套练习,含校订与教学改编)

先做后看答案。单选点一下就判,多选选完点「核对答案」。错题自动进错题本,二轮会回来重做。

1. 单项选择题
某市旅游管理部门要调查了解2025年本市常住居民出境旅游总消费金 额,随机抽取3000位常住居民进行调查,该抽样调查的样本统计量为()。
A. 随机抽取3000位常住居民出境旅游总消费金额B. 所有常住居民出境旅游总消费金额C. 被调查的3000位常住居民D. 被调查的每一位常住居民出境旅游消费金额
答案 A A由样本内3000人的消费额计算,属于样本统计量;B是总体参数,C是样本集合,D是单个观测值。若用样本估计全市消费总额,还须结合总体人数和抽样权重,不能直接用3000人的合计替代全市总额。
2. 单项选择题
某公司从所有在职员工中随机抽取200人,通过对这200人的调查估计 所有在职员工的平均薪酬满意度,该抽样调查的总体是()。
A. 该公司所有在职员工B. 随机抽取的这200名员工C. 该公司所有在职员工的平均薪酬满意度D. 随机抽取的这200名员工的平均薪酬满意度
答案 A 总体即调查对象的全体,可参考上题解答。
3. 单项选择题
在研究某城市居民的家庭消费结构时,从全部50万户家庭中随机抽取 3000户进行入户调查,这项抽样调查中的样本是()。
A. 抽取出来的3000户家庭B. 50万户家庭C. 每一户家庭D. 抽取出来的每一户家庭
答案 A 本题考查抽样调查的基本概念。样本是总体的一部分,由从总体中按一定原则或 程序抽出的部分个体所组成。
4. 单项选择题
国家统计局通过对住户的抽样调查估计我国常住居民的平均收入和消 费结构,该调查中的样本是( )。
A. 我国境内所有常住住户B. 被抽中调查的所有住户C. 我国境内每一个住户的收支数据D. 采集到的住户收支数据
答案 B 样本由总体中按规定程序抽中的部分个体构成。本调查样本是被抽中调查的所有住户,选B。
5. 单项选择题
( )是供抽样所用的所有抽样单元的名单,是抽样总体的具体表现。
A. 样本B. 总体C. 抽样框D. 入样单位
答案 C 抽样框是供抽样所用的所有抽样单元的名单,是抽样总体的具体表现。
6. 单项选择题
在进行概率抽样调查时,应选择的调查单位是()。
A. 就调查标志值来说在总体中占绝大比重的单位B. 有典型意义的单位C. 主动参与调查的单位D. 依据随机原则抽取的单位
答案 D 概率抽样的特点之一是按一定的概率以随机原则抽取样本。所谓随机原则,就是 在抽取样本时排除主观上有意识地抽取调查单元的情况,使每个单元都有一定的机会被抽中。
7. 单项选择题
在街区或居民小区拦住行人进行调查的抽样方法属于()。
A. 判断抽样B. 方便抽样C. 自愿抽样D. 配额抽样
答案 B 根据抽取样本的方法不同,抽样分为概率抽样和非概率抽样。非概率抽样包括:判 断抽样、方便抽样、自愿抽样、配额抽样。其中,方便抽样是指在抽取样本时,依据方便原则,以 达到最大限度降低调查成本的目的,如“拦截式”调查。
8. 单项选择题
在抽取样本时,调查人员依据调查目的和对调查对象的了解,人为确定 样本单元,这种方法称为( )。
A. 判断抽样B. 方便抽样C. 自愿抽样D. 配额抽样
答案 A 本题考查非概率抽样的方法。判断抽样是指调查者依据调查目的和对调查对象的 了解,人为确定样本单元。
9. 单项选择题
下列抽样方法中,属于非概率抽样的是()。
A. 分层抽样B. 整群抽样C. 自愿抽样D. 等距抽样
答案 C 非概率抽样包括判断抽样、方便抽样、自愿抽样和配额抽样,故选C。
10. 单项选择题
下列抽样方法中,属于概率抽样的是()。
A. 方便抽样B. 系统抽样C. 判断抽样D. 配额抽样
答案 B 概率抽样的抽样方法包括简单随机抽样、分层抽样、系统抽样、整群抽样、多阶段 抽样等。
11. 单项选择题
在某企业网站上发布调查问卷,开展该企业员工满意度调查,采用有奖 答卷的形式吸引该企业员工接受调查。这种抽样方法是()。
A. 配额抽样B. 分层抽样C. 自愿抽样D. 判断抽样
答案 C 自愿样本是指不是经过抽取而是由自愿接受调查的单元所组成的样本。比较典型 的是网上调查。
12. 单项选择题
某公司有100名男员工和100名女员工,为了解员工对改革的态度,计划调查20人并限定男女各10人,调查员按就近方便原则自行选择各性别受访者。该方法称为()。
A. 分层抽样B. 配额抽样C. 系统抽样D. 整群抽样
答案 B 配额抽样是指将总体中的各单元按一定标准划分为若干类型,将样本数额分配到 各类型中,从各类型中抽取样本的方法则没有严格限制,一般采用方便抽样的方法抽取样本 单元。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

13. 单项选择题
在抽样调查一般步骤中,需要回答“要做什么样的调查研究”,是在 ()阶段。
A. 确定调查问题B. 调查方案设计C. 实施调查过程D. 撰写调查报告
答案 A 本题考查抽样调查的步骤。第一步确定调查问题是回答“要做什么样的调查研究” 和“为什么要做这项调查研究”。
14. 多项选择题
以下属于概率抽样特点的有()。
A. 按一定的概率以随机原则抽取样本B. 抽取样本并不是依据随机原则C. 总体中每个单元被抽中的概率是未知的D. 总体中每个单元被抽中的概率是可以计算出来的E. 当采用样本对总体参数进行估计时,要考虑到每个样本单元被抽中的概率
答案 ADE 概率抽样的特点之一是按一定概率以随机原则抽取样本,选项B错误。另一个 特点是,总体中每个单元被抽中的概率是已知的或者可以计算出来,选项C错误。
15. 多项选择题
关于概率抽样的说法,正确的有()。
A. 每个单元都有一定的机会被抽中B. 总体中每个单元被抽中的概率是已知的或可计算的C. 每个总体单元被抽入样本的概率都相等D. 调查人员可以根据方便原则抽取样本E. 调查人员可以根据主观判断抽取样本
答案 AB 概率抽样具有以下特点:①按一定的概率以随机原则抽取样本。所谓随机原则, 就是在抽取样本时排除主观上有意识地抽取调查单元的情况,使每个单元都有一定的机会被 抽中。②总体中每个单元被抽中的概率是已知的,或者是可以计算出来的。③当采用样本对 总体参数进行估计时,要考虑到每个样本单元被抽中的概率。
16. 多项选择题
下列抽样方法中,属于概率抽样的有()。
A. 判断抽样B. 配额抽样C. 分层抽样D. 整群抽样E. 系统抽样
答案 CDE 本题考查概率抽样的方法类型。选项A、B属于非概率抽样的方法。
17. 多项选择题
下列统计活动中,一般在抽样调查方案设计阶段完成的有()。
A. 数据预处理B. 确定抽样方法C. 将调研问题细化为问卷中的具体问题D. 数据录入E. 撰写报告
答案 BC 调查方案设计包括抽样方案和问卷设计,B及修订后的C属于该阶段;A、D为数据处理,E为成果报告。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

18. 单项选择题
下列误差来源中,会导致抽样误差的是()。
A. 调查人员作弊B. 受访者拒绝接受调查C. 抽样框遗漏部分总体单元D. 抽样的随机性
答案 D 本题考查抽样误差。抽样误差是由抽样的随机性造成的,是用样本统计量估计总 体参数时出现的误差。
19. 单项选择题
下列误差中,属于抽样误差的是()。
A. 抽样随机性造成的用样本统计量估计总体参数时出现的误差B. 抽样框误差C. 无回答误差D. 计量误差
答案 A 抽样误差是由抽样的随机性造成的,是用样本统计量估计总体参数时出现的误 差。
20. 单项选择题
在调查时,被调查者恰巧不在家,这种调查减少了有效样本量,会造成估 计量方差增大,这种情况属于()。
A. 抽样框误差B. 计量误差C. 系统误差D. 无回答误差
答案 D 本题考查抽样调查中的误差。被调查者恰巧不在家,属于无回答误差。
21. 单项选择题
以下情况中,不属于计量误差的是()。
A. 调查员在调查中有意无意地诱导被调查者B. 被调查者不愿意告诉实情而拒绝回答C. 调查人员有意作弊D. 受访者提供虚假信息
答案 B 选项B属于无回答误差。
22. 单项选择题
由于受访者记忆模糊,导致调查数据与其真值之间不一致,这种误差属 于()。
A. 抽样误差B. 抽样框误差C. 无回答误差D. 计量误差
答案 D 本题考查计量误差。抽样误差是由抽样的随机性造成的,是用样本统计量估计总 体参数时出现的误差。选项B、C、D三项均属于非抽样误差,是指由其他原因引起的样本统 计量与总体真值之间的差异。其中,计量误差是由于调查所获得的数据与其真值之间不一致 造成的误差,包括调查人员有意作弊、记录答案错误、受访者提供虚假数字及受访者记忆模 糊等。
23. 多项选择题
下列关于抽样误差的表述,正确的有()。
A. 抽样误差无法避免,但可计算B. 抽样误差与总体分布有关,总体方差越大,抽样误差越大C. 其他条件相同,样本量越大,抽样误差越小D. 抽样误差与抽样方式和估计量的选择也有关E. 分层抽样的估计量方差一般大于简单随机抽样
答案 ABCD 分层抽样的估计量方差一般小于简单随机抽样,即分层抽样的误差小于简单随 机抽样,选项E错误。
24. 多项选择题
非抽样误差产生的原因主要有()。
A. 抽样框误差B. 参数误差C. 无回答误差D. 系统误差E. 计量误差
答案 ACE 非抽样误差产生的原因包括:①抽样框误差;②无回答误差;③计量误差。
25. 多项选择题
在城乡住户收支调查中,非抽样误差的可能来源有()。
A. 抽样框遗漏掉部分城乡住户B. 部分高收入住户拒绝接受调查C. 调查人员有意作弊D. 被调查住户提供虚假数据E. 抽样的随机性
答案 ABCD 由抽样的随机性造成的是抽样误差,选项E不符合题意。选项A属于抽样框 误差,选项B属于无回答误差,选项C、D属于计量误差。
26. 多项选择题
下列误差来源中,可能导致计量误差的有()。
A. 抽样框不完善B. 调查中的提问错误C. 调查中记录答案错误D. 被调查者记忆不清E. 被调查者提供虚假数据
答案 BCDE 计量误差是指由于调查所获得的数据与其真值之间不一致造成的误差。例如, 调查员在调查中有意无意地诱导被调查者,调查中的提问错误或记录答案错误,调查人员有意 作弊,由于问卷的原因导致受访者对调查问题的理解上有偏误,受访者记忆不清,受访者提供 虚假数据等。
27. 多项选择题
下列关于简单随机抽样的表述,错误的有()。
A. 有放回抽样具有更低的抽样误差B. 是最基本的随机抽样方法C. 总体的每个单位入样概率不同D. 抽样框没有更多可利用的辅助信息E. 适用个体之间差异较大的调查
答案 ACE 不放回简单随机抽样,每个单位最多只能被抽中一次,所以比有放回随机抽样 具有更低的抽样误差,选项A符合题意。简单随机抽样是最基本的随机抽样方法,操作简单, 且每个单位的入样率相同,选项C符合题意。简单随机抽样适用于个体间差异不是很大的情 况,选项E符合题意。
28. 单项选择题
某研究机构通过抽样调查了解某市餐饮行业的营业收入情况,将该市所 有餐饮企业按照经营规模分为10层,在每个层内随机抽取样本企业,对所有样本企业进行调 查。该调查采用的抽样方法是()。
A. 简单随机抽样B. 分层抽样C. 整群抽样D. 系统抽样
答案 B 分层抽样是指先按照某种规则把总体分为不同的层,然后在不同的层内独立、随机 地抽取样本。
29. 单项选择题
某单位有1500名职工,其中管理人员300人,其余为普通员工。按各层人数比例进行分层随机抽样,抽取200人,则管理人员和普通员工应各抽取()。
A. 50人,150人B. 40人,160人C. 100人,100人D. 60人,140人
答案 B 按比例分配:管理人员200×300÷1500=40人;普通员工200×1200÷1500=160人,选B。分层抽样也可采取其他分配方式,本题特指比例分配。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

30. 单项选择题
在分层抽样中,层的划分原则是()。
A. 层内单位差异小,层间单位差异大B. 层内单位差异大,层间单位差异小C. 层内单位差异小,层间单位差异小D. 层内单位差异大,层间单位差异大
答案 A 分层抽样的应用条件是:抽样框中有足够的辅助信息,能够将总体单位按某种标准 划分到各层之中,实现在同一层内各单位之间的差异尽可能地小,不同层之间各单位的差异尽 可能地大。
31. 单项选择题
某工厂连续生产产品,随机确定首个抽检时刻后,每隔1小时抽取一个产品检验。这种抽样方法是()。
A. 简单随机抽样B. 系统抽样C. 分层抽样D. 整群抽样
答案 B 系统抽样指先将总体中的所有单元按一定顺序排列,在规定范围内随机抽取一个初 始单元,然后按事先规定的规则抽取其他样本单元。最简单的系统抽样是等距抽样。题目描 述的情况为等距抽样。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

32. 单项选择题
系统抽样的缺点是()。
A. 操作复杂B. 对抽样框要求较高C. 方差估计比较复杂D. 需要增大样本量
答案 C 系统抽样的缺点是方差估计比较复杂,这就给计算抽样误差带来一定困难。
33. 多项选择题
以下关于概率抽样方法的说法,正确的有()
A. 简单随机抽样中每个单位的入样概率相同B. 分层抽样适用于层内差异小、层间差异大的情形C. 整群抽样调查抽中群的全部基本单位D. 系统抽样对抽样框的要求比较复杂E. 大范围调查中缺乏完整最终单位抽样框时,采用多阶段抽样通常更可行
答案 ABCE 本题考查几种基本概率抽样方法的特点,比较综合。系统抽样的优点之一是对 抽样框的要求比较简单,选项D错误。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

34. 单项选择题
在调查某城市小学教师亚健康状况时,从该城市的200所小学中随机抽 取40所,每个被抽取小学中的所有教师都参与调查,这样的抽样方法属于()。
A. 简单随机抽样B. 整群抽样C. 分层抽样D. 等距抽样
答案 B 整群抽样是将总体中所有的基本单位按照一定规则划分为互不重叠的群,抽样时直 接抽取群,对抽中的群调查其全部的基本单位,对没有抽中的群则不进行调查。题目中,每所 小学就是一个群。
35. 单项选择题
组间差异较小,组内差异较大,适用于()方法。
A. 简单随机抽样B. 整群抽样C. 系统抽样D. 分层抽样
答案 B 整群抽样适用情况是,如果群内各单位之间存在较大差异,群与群的结果相似,整群 抽样会降低估计误差。
36. 单项选择题
某企业部门内员工对工作环境的评价较相似、部门间差异较大,员工编号不存在与调查指标一致的周期。在最终员工样本量相同且其他设计合理的情况下,通常抽样误差较大的是()。
A. 以企业部门为群的整群抽样B. 按员工岗位分层的分层抽样C. 简单随机抽样D. 按照员工编号等距抽样
答案 A 同部门员工较同质、部门间差异较大时,按部门整群抽样的信息重复较多,通常比合理分层或简单随机抽样误差大,故选A。这一判断依赖给定的群内相似性,不能适用于所有总体结构。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

37. 单项选择题
整群抽样的主要缺点是()。
A. 调查实施效率低B. 抽样框编制复杂C. 群内样本单位可能同质性高,从而导致抽样误差比较大D. 调查成本高
答案 C 整群抽样的主要缺点是:由于抽取的样本单位比较集中,群内各单位之间存在相似 性,差异比较小,而群与群之间的差别往往比较大,使得整群抽样的抽样误差比较大。
38. 单项选择题
某市为调查居民对市政建设的满意度,先从该市所有居委会中随机抽取 20个居委会,再从每个被抽中的居委会中随机抽取30个居民家庭进行入户调查。该项调查 采用的抽样方法是()。
A. 分层抽样B. 整群抽样C. 系统抽样D. 多阶段抽样
答案 D 多阶段抽样是对经过两个及两个以上抽样阶段抽样方法的统称。
39. 单项选择题
某省先随机抽取n个县,再从每个样本县随机抽取m个村,最后从每个样本村随机抽取k户农户。该调查采用()。
A. 多阶段抽样B. 分层抽样C. 系统抽样D. 整群抽样
答案 A 县、村、农户依次构成三个抽样阶段,属于多阶段抽样,选A。

校勘说明:为明确统计定义、经验标准或教学条件所作的校订后教学题设,不冒充原题原文。

40. 单项选择题
某全国性的居民入户抽样调查中,首先把所有区县按照东、中、西部分 层,然后在各层内分别按照简单随机原则抽选区县,再在选中的区县中抽选居委会(村委会), 最后在选中的居委会(村委会)中按照简单随机原则抽选居民户。该抽样调查的多阶段抽样 设计的阶段数量是( )。
A. 1B. 2C. 3D. 4
答案 C 先按东、中、西部分层是第一阶段抽样前的分层设计,不增加抽样阶段。实际随机抽选依次为区县、居委会或村委会、居民户,共3个阶段,选C。
41. 多项选择题
为调查某城市小学教师的身体健康状况,分别从该城市所有区县中随机 抽取8个区县,然后在被抽中的每个区县随机抽取5所小学,对被抽中小学的所有在职教师发 放问卷进行调查。该调查中,用到的抽样方法有()。
A. 分层抽样B. 配额抽样C. 整群抽样D. 多阶段抽样E. 系统抽样
答案 CD 先抽区县,再抽小学,属于多阶段抽样;对入选小学全部教师调查体现整群抽样。题干没有将总体分层后从每一层分别抽样,因此不含分层抽样,选CD。
42. 多项选择题
某省将调查小区分为城镇和农村两层,各层独立随机抽取100个小区;再在每个样本小区内将住户排序,随机确定起点后按固定间隔抽取20户。该调查采用的抽样方法有()。
A. 判断抽样B. 多阶段抽样C. 系统抽样D. 分层抽样E. 整群抽样
答案 BCD 分层抽样是指先按照某种规则把总体分为不同的层,然后在不同的层内独立随 机地抽取样本。系统抽样是指先将总体中的所有单元按一定顺序排列,在规定范围内随机抽 取一个初始单元,然后按事先规定的规则抽取其他样本单元,最简单的系统抽样是等距抽样。 在大规模抽样调查中,很难一次抽取到最终样本单位,往往需要经过两个或两个以上阶段才能 抽到最终样本单位,这就是多阶段抽样方法。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

43. 多项选择题
某医药企业为评估新药疗效,从全球随机抽取15个国家,每个国家随机 抽取10家医院,每家医院随机抽取10名轻度患者和10名重度患者,每名患者记录用药后的 疗效数据。该研究使用的抽样方法有()。
A. 多阶段抽样B. 配额抽样C. 滚雪球抽样D. 分层抽样E. 判断抽样
答案 AD 抽样依次在国家、医院和患者三个层级进行,属于多阶段抽样;患者按轻度、重度分层,各层随机抽取10人,属于分层抽样,故选AD。全程采用随机程序,不属于配额、判断或滚雪球抽样。
44. 单项选择题
对于不放回简单随机抽样,所有可能的样本均值取值的平均值总是等于 总体均值,这就是样本估计量的( )。
A. 无偏性B. 有效性C. 一致性D. 渐进性
答案 A 对于不放回简单随机抽样,所有可能的样本均值取值的平均值总是等于总体均值, 这就是样本均值估计量的无偏性。
45. 单项选择题
在不放回简单随机抽样中,估计量的无偏性是指()。
A. 所有可能的样本均值取值的平均值等于总体均值B. 所有可能的样本估计值都等于总体参数的真值C. 随着样本量的增大,样本估计值趋向总体参数的真值D. 所有可能的样本取值集中在总体参数真值附近
答案 A 对于不放回简单随机抽样,所有可能的样本均值取值的平均值总是等于总体均值, 这就是样本均值估计量的无偏性。
46. 单项选择题
在抽样估计中,用方差大小比较同一参数的无偏估计量优劣,所考察的性质是()。
A. 一致性B. 无偏性C. 有效性D. 确定性
答案 C 同一参数的无偏估计量中,方差越小,有效性越高;方差越大,有效性越低。因此考察的是有效性,选C。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

47. 单项选择题
假设对某总体参数θ有两个无偏估计量θ̂₁和θ̂₂,θ̂₁比θ̂₂更有效,则这两个估计量的关系是( )。
A. V(θ̂₁)>V(θ̂₂)B. V(θ̂₁)<V(θ̂₂)C. θ̂₁>θ̂₂D. θ̂₁<θ̂₂
答案 B 本题考查估计量的有效性。θ̂₁比θ̂₂更有效,必然有V(θ̂₁)<V(θ̂₂),即θ̂₁的方差小于θ̂₂的方差,所以选B。

校勘说明:按《经济基础知识(中级)章节同步习题集-304.pdf》原PDF第201页题面、第205页答案复核修正;保留原题答案。

48. 单项选择题
假设某总体参数θ有两个无偏估计量θ̂₁和θ̂₂,已知V(θ̂₁)>V(θ̂₂),则这两个估计量的关系是( )。
A. θ̂₁比θ̂₂更有效B. θ̂₂比θ̂₁更有效C. θ̂₁比θ̂₂更一致D. θ̂₂比θ̂₁更一致
答案 B 方差是度量分布密集或离散状况的重要指标,估计量方差常用于描述抽样误差。在无偏估计量之间,方差越小,有效性越高。本题V(θ̂₁)>V(θ̂₂),所以θ̂₂比θ̂₁更有效,选B。

校勘说明:按《经济基础知识(中级)章节同步习题集-304.pdf》原PDF第201页题面、第205页答案复核修正;保留原题答案。

49. 多项选择题
抽样统计中,估计量的性质包括()。
A. 一致性B. 相关性C. 无偏性D. 有效性E. 密集性
答案 ACD 估计量的性质包括:无偏性、一致性、有效性。
50. 多项选择题
下列影响因素中,属于抽样误差来源的有()。
A. 总体单位值之间的差异大小B. 样本量大小C. 访问人员的选择D. 抽样方式的选择E. 估计量的选择
答案 ABDE 抽样误差大小与以下因素有关:①抽样误差与总体分布有关,总体单位值之间 差异越大,即总体方差越大,抽样误差越大。②抽样误差与样本量n有关,其他条件相同,样本 量越大,抽样误差越小。③抽样误差与抽样方式和估计量的选择也有关。例如,分层抽样的 估计量方差一般小于简单随机抽样。④利用有效辅助信息的估计量也可以有效地减小抽样 误差。
51. 单项选择题
关于样本量的影响因素,下列说法正确的是()。
A. 其他条件相同,调查精度要求越高,所需样本量越小B. 其他条件相同,总体离散程度越大,所需样本量也越大C. 其他条件相同,所需样本量必定随总体规模成正比例增加D. 其他条件相同,无回答率越高,所需样本量越小
答案 B 精度更高、总体差异更大、无回答率更高通常要求更多初始样本。总体规模的影响有有限总体校正,且大总体时趋弱,并非成比例增长;修订后只有B正确。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

52. 多项选择题
确定抽样调查样本量时,应考虑的因素包括()。
A. 调查的精度要求B. 总体的离散程度C. 所研究变量的总体分布特征D. 经费的制约E. 调查覆盖范围及需分别满足精度的分析子群
答案 ABCDE 样本量取决于精度、总体差异、预算等,也需结合研究变量的分布及需单独发布可靠结果的分析子群。分布特征与离散程度可能重叠,但重叠不使选项错误;调查范围扩大不意味着样本量必按总体人数同比例增长。选ABCDE。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

53. 多项选择题
抽样调查中,确定样本量应考虑的因素主要有()。
A. 调查的限定时间B. 总体的离散程度C. 无回答情况D. 调查经费E. 需要同时满足精度要求的调查指标及其数量
答案 ABCDE 限定时间、总体差异、无回答和经费会影响样本量。多指标调查还要确定各关键指标及同时满足的精度约束;增加指标不必然增加样本量,但新增更严格约束时可能需要增样,因此E也是应考虑的因素,选ABCDE。

校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。

7本章打卡

做完一项勾一项,当天页会自动更新整体进度。

学完这章就是往前走了一步。记不住的,明天再来看必背,不用今天全记住。

↑ 回到今日顶部

1重点一览

先花 2 分钟看清这章有几个考点、哪几个是必考,心里有数再读书。

6页教材0个 ★★★0个 ★★1个 ★26道章节题约 48 分钟教材印刷页 229-234
考点 回归分析★

2教材标色 + 三色笔记

左边是教材原文,彩色句子就是《考点速记》收了的内容,颜色是星级。右边是速记的考点表,和左边的小节对齐。读一节,看一眼右边的表,再往下走。

一、回归模型

教材 P229

(一)回归分析的概念

回归分析是指根据相关关系的具体形态,选择一个合适的数学模型,来近似地表达变量间的依赖关系。

回归分析和相关分析有着密切的联系,它们不仅具有共同的研究对象,而且在具体应用时,常常必须互相补充。相关分析需要依靠回归分析来表明现象数量相关的具体形式,而回归分析则需要依靠相关分析来表明现象数量变化的相关程度。只有当变量之间存在着高度相关时,进行回归分析寻求其相关的具体形式才有意义。

应当指出,相关分析与回归分析之间在研究目的和方法上是有明显区别的。相关分析研究变量之间相关的方向和相关的程度,但是相关分析不能指出变量间相互关系的具体形式,也无法从一个变量的变化来推测另一个变量的变化情况。回归分析则是研究变量之间相互关系的具体形式,它对具有相关关系的变量之间的数量联系进行测定,确定一个相关的数学方程式,根据这个数学方程式可以从已知量来推测未知量,从而为估算和预测提供了一个重要的方法。

进行回归分析时,首先需要确定因变量和自变量。在回归分析中,被预测或被解释的变量称为因变量,一般用 Y 表示;用来预测或解释因变量的变量称为自变量,一般用 X 表示。例如,在研究边际消费倾向时,目的是预测一定人均收入条件下的人均消费金额。因此,人均消费金额是被预测的变量,称为因变量,而用来预测人均消费金额的人均收入就是自变量。

(二)一元线性回归模型

根据自变量的多少,回归模型可以分为一元回归模型和多元回归模型。根据是否是线性,回归模型可以分为线性回归模型和非线性回归模型。一元线性回归模型是描述两个变量之间相关关系的最简单的回归模型。回归模型可以用描述因变量 Y 如何依赖自变量 X 和误差项 ε 的方程来表示。只涉及一个自变量的一元线性回归模型可以表示为:

Y = β0 + β1X + ε

式中,β0 和 β1 为模型的参数。

模型中,因变量 Y 是自变量 X 的线性函数(β0 + β1X)加上误差项 ε。β0 + β1X 反映了由于自变量 X 的变化而引起的因变量 Y 的线性变化。误差项 ε 是个随机变量,表示除 X 和 Y 的线性关系之外的随机因素对 Y 的影响,是不能由 X 和 Y 的线性关系所解释的 Y 的变异性。

描述因变量 Y 的期望 E(Y) 如何依赖自变量 X 的方程称为回归方程。一元线性回归方程的形式为:

E(Y) = β0 + β1X

一元线性回归方程的图示是一条直线,β0 是回归直线的截距,β1 是回归直线的斜率,表示 X 每变动一个单位时,E(Y) 的变动量。

二、最小二乘法

教材 P230

现实中,模型的参数 β0 和 β1 都是未知的,必须利用样本数据去估计。假设可得到 X 和 Y 的 n 组观测值,即 (xi, yi),i = 1, 2, …, n,根据样本统计量 β̂0 和 β̂1 估计模型中的参数 β0 和 β1 之后,就得到了估计的回归方程:

ŷi = β̂0 + β̂1 xi(i = 1, 2, …, n)

式中,β̂0 表示估计的回归直线在 Y 轴上的截距;β̂1 为估计的回归直线的斜率,它表示自变量 X 每变动一个单位时,因变量 Y 的平均变动量。

上式中的 β̂0 和 β̂1 确定了回归直线的位置,β̂0 和 β̂1 一旦确定,这条直线也就唯一确定了。但对于给定的 n 组观测值,可用于描述数据的直线有很多条,究竟用哪条直线来代表两个变量之间的关系,需要有一个明确的原则。我们自然会想到距离各观测点最近的一条直线,即实际观测点和直线间的距离最小。根据这一思想对回归模型进行估计的方法称为最小二乘法。最小二乘法就是使因变量的观测值 yi 与估计值 ŷi 之间的离差(又称残差)平方和最小来估计参数 β0 和 β1 的方法,如图 26-1 所示。

(图 26-1 最小二乘法示意图:散点图上画一条「估计的回归线」,各观测点到直线的竖直距离就是残差,见教材扫描件)

根据最小二乘法,使得 Σ(yi − ŷi)² = Σ(yi − β̂0 − β̂1 xi)² 最小。

设 Q = Σ(yi − ŷi)²,在给定了样本数据后,Q 是 β̂0 和 β̂1 的函数,且最小值总是存在。根据微积分的极值定理,对 Q 求相应于 β̂0 和 β̂1 的偏导数,并令其等于 0,即可求出 β̂0 和 β̂1 的估计量:

β̂1 = Σ(xi − x̄)(yi − ȳ) ÷ Σ(xi − x̄)²

β̂0 = Σyi ÷ n − β̂1 × Σxi ÷ n = ȳ − β̂1 x̄

教材 P231

根据表 26-1 中的数据,拟合城镇居民人均可支配收入和人均消费支出的直线回归方程。根据上面的公式可得:

β̂1 = Σ(xi − x̄)(yi − ȳ) ÷ Σ(xi − x̄)² = 0.546

β̂0 = ȳ − β̂1 x̄ = 4276.984

估计的城镇居民人均可支配收入和人均消费支出的一元线性直线回归方程为:

ŷ = 4276.984 + 0.546X

估计的回归系数显示,城镇居民家庭人均可支配收入每增加 1 元,城镇居民人均消费支出将增加 0.546 元。

表 26-1 预测值和预测残差

年份城镇居民人均可支配收入 xi(元)城镇居民人均消费支出 yi(元)城镇居民人均消费预测值 ŷi(元)预测值与观测值之间的残差 yi − ŷi
2012241271710717440.5-333.5
2013264671848818717.2-229.2
2014288441996820014.1-46.1
2015311952139221296.795.3
2016336162307922617.6461.4
2017363962444524134.4310.6
2018392512611225692.0420.0
2019423592806327387.7675.3
2020438342700728192.5-1185.5
2021474123030730144.6162.4
2022492833039131165.4-774.4
2023518213299432550.1443.9

三、模型的检验和预测

(一)回归模型的拟合效果分析

一般情况下,在使用估计的回归方程之前,需要对模型进行检验:①结合经济理论和经验分析回归系数的经济含义是否合理;②分析估计的模型对数据的拟合效果如何;③对模型进

教材 P232

行假设检验。

1. 决定系数 R²。决定系数 R²,也称为拟合优度或判定系数,可以测度回归模型对样本数据的拟合程度,其计算公式如下:

R² = Σ(ŷi − ȳ)² ÷ Σ(yi − ȳ)² = 1 − Σ(yi − ŷi)² ÷ Σ(yi − ȳ)²

决定系数是回归模型所能解释的因变量变化占因变量总变化的比例,取值范围在 0 到 1 之间。决定系数越高,模型的拟合效果就越好,即模型解释因变量的能力越强。如果所有观测点都落在回归直线上,R² = 1,说明回归直线可以解释因变量的所有变化。R² = 0,说明回归直线无法解释因变量的变化,因变量的变化与自变量无关。现实应用中 R² 大多落在 0 和 1 之间,R² 越接近于 1,回归模型的拟合效果越好;R² 越接近于 0,回归模型的拟合效果越差。

根据上面估计的回归方程,利用表 26-1 的计算结果,计算决定系数:

R² = 1 − Σ(yi − ŷi)² ÷ Σ(yi − ȳ)² ≈ 0.988

R² 为 0.988,说明回归模型的拟合效果很好,即城镇居民人均可支配收入可以很好地解释城镇居民人均消费支出的变化,从图 26-2 中可以看出模型预测值和观测值非常接近。

(图 26-2 城镇居民人均消费性支出及其预测值:横轴为城镇居民人均可支配收入(元),纵轴为人均消费性支出(元),实际值与预测值两条线几乎重合,见教材扫描件)

2. 回归系数的显著性检验。在大样本假定的条件下,回归系数的最小二乘估计量 β̂0 和 β̂1 渐进服从正态分布,可以用 t 检验方法验证自变量 X 对因变量 Y 是否有显著影响。t 检验的原理是反证法,在原假设 β1 = 0(自变量 X 对因变量 Y 没有影响)正确的假定下,基于 β̂1 的抽样分布计算一次抽样情况下得到该样本或更极端样本的概率(P 值),如果 P < 0.05,则可以在 0.05 的显著性水平下拒绝原假设,认为自变量 X 对因变量 Y 有显著影响,即 β1 ≠ 0。常见的统计分析软件拟合回归模型时都会给出 t 检验的 P 值,可直接比较 P 值和显著性水平(经常取 0.05),来判断回归模型的自变量对因变量是否有显著影响。

根据表 26-1 中的城镇居民人均可支配收入和人均消费性支出数据,Excel 软件的回归

教材 P233

函数给出线性回归模型拟合结果见表 26-2,“系数”列给出 β̂0 和 β̂1 的最小二乘估计值分别为 4276.984 和 0.546,“P 值”列给出自变量城镇居民人均可支配收入的 t 检验 P 值 = 5.728 × 10⁻¹¹,因此可以在 0.05 的显著性水平下拒绝 β1 = 0 的原假设,认为城镇居民人均可支配收入对城镇居民人均消费性支出有显著影响。

表 26-2 线性回归模型拟合结果

项目系数标准误差tP 值
截距4276.984734.360215.82411.674 × 10⁻⁴
城镇居民人均可支配收入0.5460.0188828.90265.728 × 10⁻¹¹

(二)模型预测

回归分析的一个重要应用就是预测,即利用估计的回归模型预估因变量数值。例如,根据上面估计的回归方程,当城镇居民家庭人均可支配收入 X = 40000 元时,人均消费性支出是多少?

将 X = 40000 代入回归方程,得:

ŷ = 4276.984 + 0.546X = 4276.984 + 0.546 × 40000 = 26116.984(元)

(三)二元回归模型案例

利用某公司的 30 位员工数据,以年薪为因变量 Y,以受教育年限(edu)和职位(position)为自变量,用 Excel 拟合二元线性回归模型,年薪回归估计结果见表 26-3。其中,年薪(元)和受教育年限(年)为定量变量;职位为定性变量,0 表示一般职员,1 表示管理者。

表 26-3 年薪回归估计结果

回归统计数值
R Square0.632538
Adjusted R Square0.605318
观测值30
项目系数标准误差tP 值
截距-18716.216600.7096-1.127430.26948
受教育年限(edu)3669.0021209.4214473.0336840.00529
职位(position)27144.478197.9765383.3111180.00265

由表 26-3 可以得到估计的二元线性回归方程:

ŷ = −18716.2 + 3669edu + 27144.47position

多元回归模型在实际应用中,随着自变量个数的增加,即使在有些自变量与因变量完全不相关的情况下,决定系数 R² 也会增大。为避免因增加自变量个数而高估拟合效果的情况,多元回归模型一般使用修正了自由度的调整后 R²(Adjusted R Square)。调整后 R² 考虑了自变量个数增加带来的影响,在数值上小于 R²。表 26-3 中二元线性回归模型的调整后 R²(Adjusted R Square)= 0.605,表示受教育年限和职位的二元回归模型对年薪的变化可解释程

教材 P234

度为 60.5%。自变量受教育年限和职位的 t 检验 P 值 0.00529 和 0.00265 都小于 0.05,表明 2 个自变量都通过了 t 检验,对年薪有显著的线性影响。在多元线性回归方程中,偏回归系数可以衡量在其他自变量保持不变的情况下,某一个自变量变化一个单位时,因变量的平均变化量。本例中,受教育年限(edu)的偏回归系数为 3669,即在相同职位上,受教育年限每增长 1 年,年薪平均增加 3669 元;管理者职位(position)的偏回归系数为 27144.47,即在相同受教育年限的条件下,管理者(position = 1)的年薪比一般职员(position = 0)的年薪平均高 27144.47 元。

已知员工甲受教育年限为 10 年,在该公司为一般职员,可利用该模型预测其年薪大约为 ŷ = −18716.2 + 3669 × 10 = 17973.8(元)。

3必背

这些是必须背下来的。先遮住右边一列,看左边考点名,自己说出内容,说不出来的做记号。

经济基础 第26章 回归分析 必背

红 ★★★ 必考

本章速记没有 ★★★ 考点。

黄 ★★ 重点

本章速记没有 ★★ 考点。

绿 ★ 中会考数字、公式、分类的点

考点必背内容
回归分析含义根据相关关系的具体形态,选一个合适的数学模型,近似表达变量间的依赖关系
回归与相关的区别相关分析看「方向和程度」,回归分析看「具体形式」并能用已知量推未知量(预测)
因变量 / 自变量被预测、被解释的叫因变量 Y;用来预测、解释的叫自变量 X
回归模型分类按自变量个数:一元 / 多元;按是否线性:线性 / 非线性;一元线性回归是最简单的回归模型
一元线性回归模型Y = β0 + β1X + ε;β0、β1 是参数,ε 是误差项(随机变量,X 与 Y 线性关系解释不了的那部分)
一元线性回归方程E(Y) = β0 + β1X;图形是一条直线,β0 = 截距,β1 = 斜率(X 每变 1 单位,E(Y) 变 β1)
最小二乘法思想让观测值 yi 与估计值 ŷi 的离差(残差)平方和最小,来估计 β0、β1
最小二乘估计公式β̂1 = Σ(xi − x̄)(yi − ȳ) ÷ Σ(xi − x̄)²;β̂0 = ȳ − β̂1 x̄
决定系数 R² 名字又叫拟合优度、判定系数,测度回归模型对样本数据的拟合程度
决定系数 R² 公式R² = Σ(ŷi − ȳ)² ÷ Σ(yi − ȳ)² = 1 − Σ(ŷi − yi)² ÷ Σ(yi − ȳ)²(能解释的变化 ÷ 总变化)
R² 取值与判断取值 0 到 1;越接近 1 拟合越好;R² = 1 所有点都在直线上;R² = 0 因变量变化与自变量无关
回归系数显著性检验用 t 检验,原理是反证法;原假设 β1 = 0(X 对 Y 没影响);P < 0.05 就拒绝原假设,认为 X 对 Y 有显著影响
调整后 R²自变量越多 R² 会虚高,多元回归用调整后 R²(Adjusted R Square),数值上小于 R²
偏回归系数其他自变量不变时,某一自变量变 1 单位,因变量的平均变化量

数字与公式清单

  • 一元线性回归模型:Y = β0 + β1X + ε(带 ε)
  • 一元线性回归方程:E(Y) = β0 + β1X(不带 ε)
  • 估计的回归方程:ŷi = β̂0 + β̂1 xi
  • 斜率估计:β̂1 = Σ(xi − x̄)(yi − ȳ) ÷ Σ(xi − x̄)²
  • 截距估计:β̂0 = ȳ − β̂1 x̄
  • 决定系数:R² = 1 − 残差平方和 ÷ 总离差平方和,取值 0 到 1
  • 显著性水平常取 0.05,P < 0.05 拒绝原假设 β1 = 0
  • 教材例题:ŷ = 4276.984 + 0.546X,收入每增 1 元消费增 0.546 元;R² = 0.988;X = 40000 时 ŷ = 26116.984 元
  • 二元例题:ŷ = −18716.2 + 3669edu + 27144.47position,调整后 R² = 0.605(可解释 60.5%)
  • 检验模型三步:①回归系数经济含义合不合理 ②拟合效果如何 ③假设检验

4总结

一页纸看完整章。二轮快刷和考前只看这里和必背。

经济基础 第26章 回归分析 一页纸总结

本章一句话

第 24 章的相关分析只告诉你「两个变量有没有关系、关系多强」,这一章回归分析往前走一步:给这个关系配一条直线 Y = β0 + β1X,用最小二乘法把直线画出来,用 R² 看直线画得准不准,用 t 检验看 X 到底管不管用,最后拿这条直线做预测。

章末总览表

考点星级一句话要点考法
考点 回归分析★含义:按相关关系形态选数学模型表达依赖关系;模型 Y = β0 + β1X + ε,方程 E(Y) = β0 + β1X,β0 截距 β1 斜率;最小二乘估计 β̂1 = Σ(xi − x̄)(yi − ȳ) ÷ Σ(xi − x̄)²,β̂0 = ȳ − β̂1 x̄;决定系数 R² 在 0 到 1 之间,越接近 1 拟合越好单选(概念辨析、β1 含义、R² 取值判断)、多选(回归与相关的区别、模型的组成)、偶有代数据算 ŷ 的简单计算

易错坑

  1. 「模型」带误差项 ε,「方程」不带 ε(方程是期望 E(Y))。题目问一元线性回归方程,答 E(Y) = β0 + β1X。
  2. β1 是斜率,说的是 X 每变 1 单位时 Y 的「平均」变动量,不是每个观测值都刚好变这么多。
  3. R² 取值 0 到 1,没有负数;越接近 1 越好。相关系数 r 才有正负,别混。
  4. 最小二乘法的「最小」指的是残差「平方和」最小,不是残差之和最小,也不是距离之和最小。
  5. 回归系数显著性用 t 检验,原假设是 β1 = 0;P 值小于 0.05 才「拒绝原假设」,说明 X 有显著影响。方向别反。

和前后章的关系

第 24 章相关分析算相关系数 r 看关系强弱,本章在它基础上给出具体方程,两章是一套:先相关后回归,相关程度高才值得做回归。第 25 章说明样本数据如何取得及抽样误差如何控制;第 27 章时间序列分析换一个角度,看同一个指标随时间怎么变,也会用到「拟合直线、做预测」的思路。

5解读(读透版讲义)

哪里没看懂,来这里看大白话讲解。生活例子、考法、坑都在这。可以先读这个再回去读教材。

回归分析(教材原文·OCR)

文字为主,公式/图表以教材扫描为准。配套精华看复习网页。

第二十六章 回归分本

( 一)回归分析的概念

回归分析是指根据相关关系的具体形态,选择一个合适的数学模型 ,来近似地表达变量间

回归分析和相关分析有着密切的联系,它们不仅具有共同的研究对象,而且在具体应用
时,常常必须互相补充。相关分析需要依靠回归分析来表明现象数量相关的具体形式,而回归
分析则需要依靠相关分析来表明现象数量变化的相关程度。只有当变量之间存在着高度相关
时,进行回归分析寻求其相关的具体形式才有意义。

应当指出,相关分析与回归分析之间在研究目的和方法上是有明显区别的。相关分析研
究变量之间相关的方向和相关的程度,但是相关分析不能指出变量间相互关系的具体形式,也
无法从一个变量的变化来推测另一个变量的变化情况。回归分析则是研究变量之间相互关系
的具体形式,它对具有相关关系的变量之间的数量联系进行测定,确定一个相关的数学方程
式,根据这个数学方程式可以从已知量来推测未知量,从而为估算和预测提供了一个重要的方

进行回归分析时,首先需要确定因变量和自变量。在回归分析中,被预测或被解释的变
量称为因变量,一般用了表示; 用来预测或解释因变量的变量称为自变量 ,一般用不表示。例
如,在研究边际消费倾向时,目的是预测一定人均收入条件下的人均消费金额。因此,人均消
费金额是被预测的变量,称为因变量,而用来预测人均消费金额的人均收入就是自变量。

( 二 )一元线性回归模型

根据自变量的多少,回归模型可以分为一元回归模型和多元回归模型。根据是否是线性,
回归模型可以分为线性回归模型和非线性回归模型。一元线性回归模型是描述两个变量之间
相关关系的最简单的回归模型。回归模型可以用描述因变量了如何依赖自变量和和误差项
s 的方程来表示。只涉及一个自变量的一元线性回归模型可以表示为:

了Y=BuHBX+s

式中,B。和局 为模型的参数。

模型中,因变量了Y是自变量X的线性函数(Br8X)加上误差项 s 。Bu+r8工反映了由
于自变量已的变化而引起的因变量了的线性变化。误差项 s 是个随机变量,表示除式和
了的线性关系之外的随机因素对了的影响,是不能由式和了的线性关系所解释的了的变异

描述因变量了的期望天(了) 如何依赖自变量蕊的方程称为回归方程。一元线性回归方
程的形式为:

玖(了)=BoHBX

一元线性回归方程的图示是一条直线,6B。 是回归直线的截距,B, 是回归直线的斜率,表示

和每变动一个单位时,已(了) 的变动量。

230 ”经济基础知识(中级)

二最小二乘法

现实中,模型的参数B 和 都是未知的,必须利用样本数据去估计。假设可得到和和了
的于组观测值,即 ,yz=1,2,…,m,根据样本统计量 B, 和 局 估计模型中的参数B, 和局 之
后,就得到了估计的回归方程:

六=BrBin (i=1,2,.…,m)

式中,有,表示估计的回归直线在了轴上的截距;局, 为估计的回归直线的斜率,它表示自变量式
每变动一个单位时,因变量了的平均变动量。

上式中的语 和局, 确定了回归直线的位置,B, 和局, 一旦确定,这条直线也就唯一确定了。
但对于给定的m”组观测值,可用于描述数据的直线有很多条 ,究竟用哪条直线来代表两个变量
之间的关系,需要有一个明确的原则。我们自然会想到距离各观测点最近的一条直线,即实际
观测点和直线间的距离最小。根据这一思想对回归模型进行估计的方法称为最小二乘法。最
小二乘法就是使因变量的观测值 x 与估计值?, 之间的离差( 又称残差 )平方和最小来估计参
数Bu 和 的方法,如图 26-1 所示。

估计的回归线

26-1 最小二乘法示意图
根据最小二乘法,使得 (7 -)2 = > (7 -房-所x) ?最小。
ie=1

设0= > (一疙) ,在给定了样本数据后, O 是 B, 和 局, 的函数,且最小值总是存在。根
据微积 ,分的极值定理, 对0求相应于语, 和房, 的偏导数,并令其等于0 即可求出 ,和局, 的估
计量:

六人-0

第二让六章,回“归*分"析 .231,

根据表 26-1 中的数据,拟合城镇居民人均可支配收入和人均消费支出的直线回归方程。
根据上面的公式可得:

袜(s-习(人
, 上EE 回
站 (和一无)
忆,=了-局元一4276.984
估计的城镇居民人均可支配收入和人均消费支出的一元线性直线回归方程为;
售=4276.98440.546X

估计的回归系数显示 ,城镇居民家庭人均可支配收入每增加 1 元,城镇居民人均消费支出
将增加 0.546 元。

二0.546

表 26-1 预测值和预测残差

年份 城镇居民人均可 城镇居民人均消费 城镇居 民人均消费 预测值与观测值之间的
支配收入xi(元) 支出%(元) 预测值六(元 ) 残差记-广

2012 24127 17107 17440.5 -333.5
2013 26467 18488 18717.2 -229.2
2014 28844 19968 20014.1 -46.1
2015 31195 21392 21296.7 95.3
2016 33616 23079 22617.6 461.4
2017 36396 24445 24134.4 310.6
2018 39251 26112 25692.0 420.0
2019 42359 28063 27387.7 675.3
2020 43834 27007 28192.5 -1185.5
2021 47412 30307 30144.6 162.4
2022 49283 30391 31165.4 -774.4
2023 51821 32994 32550.1 443.9

三\模型的检验和预测

( 一)回归模型的拟合效果分析
一般情况下 ,在使用估计的回归方程之前,需要对模型进行检验: @D结合经济理论和经验
分析回归系数的经济含义是否合理; @分析估计的模型对数据的拟合效果如何; @对模型进

232,经济基础知识(中级)

行假设检验。
1.决定系数尼。决定系数下,也称为拟合优度或判定系数,可以测度回归模型对样本数
据的拟合程度,其计算公式如下:

(六-帮” (7人)
到= 他 二 1 和
立 57) 密0

决定系数是回归模型所能解释的因变量变化占因变量总变化的比例,取值范围在 0到
1之间。决定系数越高,模型的拟合效果就越好,即模型解释因变量的能力越强。如果所有
观测点都落在回归直线上, 已=1,说明回归直线可以解释因变量的所有变化。尼=0,说明回
归直线无法解释因变量的变化,因变量的变化与自变量无关。现实应用中六 大多落在 0 和
1之间,尼越接近于1,回归模型的拟合效果越好; 尼越接近于0,回归模型的拟合效果越

差。
根据上面估计的回归方程,利用表 26-1 的计算结果 ,计算决定系数:

(7 一7

尼=1 - 一一一~0.988
立 0站

尼为 0.988,说明回归模型的拟合效果很好,即城镇居民人均可支配收入可以很好地解释
城镇居民人均消费支出的变化,从图 26-2 中可以看出模型预测值和观测值非常接近。

一35000

人

一30000

25000

和 20000

壮 15000

< 1000t

或 -全 城什居民人均消费性支出

熏 S000 -量-预测城镇居民人均消费性支出

餐 ” 0 10000 20000 30000 40000 5S0000, 60000
城镇居民人均可支配收入(元)

图 26-2 城镇居民人均消费性支出及其预测值

  1. 回归系数的显著性检验。在大样本假定的条件下,回归系数的最小二乘估计量记和局

渐进服从正态分布,可以用:检验方法验证自变量X对因变量了是否有显著影响。: 检验的原
理是反证法,在原假设B,=0( 自变量X对因变量了没有影响 ) 正确的假定下,基于 记, 的抽样
分布计算一次抽样情况下得到该样本或更极端样本的概率(P值),如果P < 0.05,则可以在
0.05 的显著性水平下拒绝原假设,认为自变量届对因变量了上有显著影响,即 Bi,关0。常见的统
计分析软件拟合回归模型时都会给出;检验的P值,可直接比较P值和显著性水平( 经常取
0.05 ),来判断回归模型的自变量对因变量是否有显著影响。

根据表 26-1 中的城镇居民人均可支配收入和人均消费性支出数据,Excel 软件的回归

第二让六章…,回“明*分"析 237,

函数给出线性回归模型拟合结果见表 26-2,“系数" 列给出 6, 和局, 的最小二乘估计值分别为
4276.984 和0546,'"值” 列给出自变量城镇居民人均可支配收入的:检验P值 =5.728 x 107,
因此可以在 0.05 的显著性水平下拒绝 B,=0 的原假设,认为城镇居民人均可支配收入对城镇
居民人均消费性支出有显著影响。

表 26-2 线性回归模型拟合结果
系数 标准误差 P值
截距 4276.984 734.36021 5.8241 1.674x 107
城镇居民人均可支配收入 0.546 0.01888 28.9026 5.728 x 10

( 二 )模型预测

回归分析的一个重要应用就是预测,即利用估计的回归模型预估因变量数值。例如,根
据上面估计的回归方程, 当城镇居民家庭人均可支配收入 和=40000 元时,人均消费性支出是
多少?

将X=40000 代入回归方程,得:

站 =4276.984+0.546X= 4276.984+0.546 x 40000=26116.984(元)

( 三)二元回归模型案例

利用某公司的 30 位员工数据,以年薪为因变量 了, 以受教育年限(edu ) 和职位(posizion )
为自变量,用 Excel 拟合二元线性回归模型,年薪回归估计结果见表 26-3。其中,年薪(元 )和
受教育年限( 年 )为定量变量; 职位为定性变量, 0 表示一般职员, 1 表示管理者。

表 26-3 年薪回归估计结果
回归统计
R Square 0.632538
AdjustedR Square 和富、,“守 0.605318
观测值 30
系数 标准误差 1 P值
截距 -18716.2 16600.7096 -1.12743 0.26948
受教育年限(edu ) 3669.002 1209.421447 3.033684 0.00529
职位(Position ) 27144.47 8197.976538 3.311118 0.00265

由表 26-3 可以得到估计的二元线性回归方程;
放= -18716.2+3669eduw+27144.47positiom
多元回归模型在实际应用中,随着自变量个数的增加,即使在有些自变量与因变量完
全不相关的情况下 ,决定系数尼 也会增大。为避免因增加自变量个数而高估拟合效果的情
况,多元回归模型一般使用修正了自由度的调整后 庆( Adjusted R Square )。调整后 尼 考虑
了自变量个数增加带来的影响,在数值上小于 尼。表 26-3 中二元线性回归模型的调整后
尼(Adjusted R Square )=0.605 ,表示受教育年限和职位的二元回归模型对年薪的变化可解释程

.234 .经济基础知识(中级)

度为 60.5%。自变量受教育年限和职位的:检验P值 0.00529 和 0.00265 都小于 0.05 ,表明
2个自变量都通过了/+ 检验,对年薪有显著的线性影响。在多元线性回归方程中,偏回归系数
可以衡量在其他自变量保持不变的情况下 ,某一个自变量变化一个单位时,因变量的平均变
化量。本例中,受教育年限( edu ) 的偏回归系数为 3669,即在相同职位上,受教育年限每增长
1年,年薪平均增加 3669 元; 管理者职位 (position ) 的偏回归系数为 27144.47,即在相同受教
育年限的条件下 ,管理者(position=1l ) 的年薪比一般职员 ( position=0 ) 的年薪平均高 27144.47
元。

已知员工甲受教育年限为 10 年,在该公司为一般职员 ,可利用该模型预测其年薪大约为
立=-18716.24+3669 x 10=17973.8(元 )。


零基础复习卡(两版教材核验)

来源核验:主教材《2026经济基础知识中级原书有色差(371)》PDF 第240-245页;《经济基础知识(中级)-292》PDF 第192-193页(书内第184-185页)。

一句话先懂

相关分析告诉你“两者一起变化得多紧”,回归分析进一步写出方程,用已知的自变量去解释或预测因变量。

零基础解释

  1. 角色分工:被解释、被预测的是因变量 `Y`;用于解释、预测的是自变量 `X`。
  2. 总体模型:`Y=β0+β1X+ε`。`β0`是截距,`β1`表示X每增加1单位,Y的条件均值平均变化多少,`ε`装入未被X解释的随机因素。
  3. 样本回归线:`Ŷ=b0+b1X`。最小二乘法选择 `b0、b1`,使残差平方和最小。
  4. 拟合优度:决定系数 `R²` 表示模型解释的总变差比例,范围通常在0到1之间;越接近1,样本拟合越好,但不自动证明因果或模型一定正确。
  5. 显著性检验:常检验 `H0:β1=0`。若P值小于显著性水平(如0.05),拒绝原假设,认为X对Y的线性影响显著。

必背清单

  • 相关分析不区分自变量、因变量;回归分析必须区分。
  • 回归分析研究具体数量关系并可预测;相关分析研究方向和程度。
  • `SST=SSR+SSE`:总变差=回归解释变差+残差变差。
  • `R²=SSR/SST=1-SSE/SST`。
  • 一元线性回归中,斜率 `b1` 与相关系数 `r` 符号相同。
  • P值小于显著性水平:拒绝 `β1=0`;P值大:证据不足,不是“证明β1一定等于0”。

易混点

  • 相关不等于因果:共同趋势、遗漏变量或反向作用都可能造成相关。
  • 残差不是误差项本身:误差项是总体模型中不可观测的随机项,残差是样本中 `e=Y-Ŷ`。
  • R²高不等于预测必准,也不说明变量选择合理。
  • 截距若不在样本X的合理范围内,机械解释可能没有经济意义。

记忆口诀

  • “相关看方向强弱,回归定角色写方程”。
  • “P小拒零,R方看解释”。

自测题

  1. 单选:研究收入对消费的影响,消费应作为( )。A自变量 B因变量 C误差项 D常数

答案:B。 消费是被解释、被预测的变量。

  1. 判断:相关分析必须先指定自变量和因变量。

答案:错。 相关分析对两个变量地位对称,回归分析才区分角色。

  1. 计算:`Ŷ=100+3X`,当X增加2单位时,预测Y平均增加多少?

答案:6。 斜率3乘以2。

  1. 单选:某模型 `R²=0.72`,正确解释是( )。A模型必然正确 B72%的Y总变差被模型解释 C相关系数为0.72 D存在因果

答案:B。 R²衡量样本拟合优度。

  1. 判断:P值0.01,小于0.05,通常拒绝“回归系数等于0”的原假设。

答案:对。 说明样本证据支持线性影响显著。

  1. 判断:残差平方和越小,R²通常越小。

答案:错。 在总变差不变时,SSE越小,`R²=1-SSE/SST`越大。

6刷题(章节配套练习,含校订与教学改编)

先做后看答案。单选点一下就判,多选选完点「核对答案」。错题自动进错题本,二轮会回来重做。

1. 单项选择题
根据相关关系的具体形态,选择一个合适的数学模型,来近似地表达变 量间的平均变化关系,这指的是()。
A. 相关分析B. 回归分析C. 定量分析D. 定性分析
答案 B 回归分析就是根据相关关系的具体形态,选择一个合适的数学模型,来近似地表达 变量间的平均变化关系。回归分析研究变量之间相互关系的具体形式。
2. 单项选择题
研究变量之间相互关系的具体形式,应采用的统计方法是()。
A. 回归分析B. 相关分析C. 集中趋势分析D. 分布形态测度
答案 A 回归分析通过数学模型描述变量之间的平均变化关系及其具体形式,选A。
3. 单项选择题
下列关于回归分析和相关分析之间关系的说法,正确的是()。
A. 具有共同的研究方法B. 具有共同的研究对象C. 相关分析需要依靠回归分析来表明现象数量变化的相关程度D. 回归分析需要依靠相关分析来表明现象数量相关的具体形式
答案 B 本题考查回归分析和相关分析的联系和区别。相关分析和回归分析在研究目的和 方法上是有明显区别的,选项A错误。回归分析需要依靠相关分析来表明现象数量变化的相 关程度,选项C错误。相关分析需要依靠回归分析来表明现象数量相关的具体形式,选项D 错误。
4. 单项选择题
进行回归分析时,首先需要确定()。
A. 函数形式B. 变量之间的表达式C. 因变量和自变量D. 研究范围
答案 C 进行回归分析时,首先需要确定因变量和自变量。回归分析中,被预测或被解释的 变量称为因变量,一般用Y表示;用来预测或解释因变量的变量称为自变量,一般用X表示。
5. 单项选择题
在回归分析中,被预测或被解释的变量称为()。
A. 因变量B. 自变量C. 控制变量D. 调节变量
答案 A 回归分析中,被预测或被解释的变量称为因变量。
6. 单项选择题
在进行回归分析时,用来预测和解释因变量的变量称为()。
A. 随机变量B. 自变量C. 误差项D. 模型参数
答案 B 在回归分析中,用来预测或解释因变量的变量称为自变量。
7. 多项选择题
关于相关分析和回归分析的说法,正确的有()。
A. 相关分析研究变量间相关的方向和相关程度B. 相关分析可以从一个变量的变化来推测另一个变量的变化C. 回归分析研究变量间相互关系的具体形式D. 相关分析和回归分析在研究方法和研究目的上有明显区别E. 相关分析中需要明确自变量和因变量
答案 ACD 回归分析与相关分析的联系:①它们具有共同的研究对象;②在具体应用时,常 常必须互相补充。相关分析与回归分析在研究目的和方法上具有明显的区别:①相关分析研 究变量之间相关的方向和相关的程度;②回归分析是研究变量之间相关关系的具体形式,它对 具有相关关系的变量之间的数量联系进行测定,确定相关的数学方程式,根据这个数学方程式 可以从已知量来推测未知量,从而为估算和预测提供了一个重要方法。
8. 单项选择题
一元线性回归模型的数学表达式是()。
A. Y=β+β₁B. Y=β+β₁XC. Y=β₀+β₁X+εD. Y=β₀+β₁X
答案 C 理论一元线性回归模型为Y=β₀+β₁X+ε,含随机误差项,故选C。其条件期望方程和样本估计方程应分别与理论模型区分。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

9. 单项选择题
在一元线性回归模型Y=β₀+β₁X+ε且E(ε|X)=0的条件下,β₀表示()。
A. X每增加1个单位时Y的平均增加量B. 回归直线的斜率C. X=0时Y的条件期望值D. 随机误差项的方差
答案 C β₀是截距,E(Y|X=0)=β₀;β₁为斜率。故选C。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

10. 单项选择题
一元线性回归模型Y=β₀+β₁X+ε中,误差项ε表示()。
A. 回归直线的截距B. 除X 和Y线性关系外的随机因素对Y的影响C. 回归直线的斜率D. 观测值和估计值之间的残差
答案 B ε是随机变量,表示未由模型中X与Y的线性关系解释的Y的变异。样本残差是观测值与拟合值之差,与理论误差项不同。
11. 单项选择题
在一元线性回归模型中,回归系数β₁的实际意义是()。
A. 当自变量X=0时,因变量Y的期望值B. 当自变量X变动1个单位时,因变量Y的平均变动量C. 当自变量X=0时,自变量X的期望值D. 当因变量Y变动1个单位时,自变量X的平均变动量
答案 B β₁是回归直线斜率,表示X每变动1个单位时Y的平均变动量,选B。
12. 单项选择题
从估计的回归方程ŷ=6.2−0.8X可以得出()。
A. X 每增加1个单位,Y增加0.8个单位B. X 每增加1个单位,Y减少0.8个单位C. X 每增加1个单位,Y平均增加0.8个单位D. X 每增加1个单位,Y平均减少0.8个单位
答案 D 斜率为−0.8,表示X每增加1个单位,Y的预测平均值减少0.8个单位,选D。

校勘说明:为明确统计定义、经验标准或教学条件所作的校订后教学题设,不冒充原题原文。

13. 多项选择题
对商品价格X和销售收入Y进行回归分析,得到估计方程ŷ=1200−10X(X、Y单位均为元)。下列说法正确的有()。
A. 商品价格每减少1元,模型预测的销售收入平均增加10元B. 商品价格每增加1元,销售收入平均增加10元C. 商品价格每增加1%,销售收入平均增加10%D. 当商品价格为20元时,销售收入的模型预测值为1000元E. 商品价格每减少1%,销售收入平均减少10%
答案 AD 斜率−10表示X减少1元时预测均值增加10元;X=20时ŷ=1200−10×20=1000元。百分比变化不能由线性斜率直接推出,故修订后选AD。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

14. 多项选择题
关于估计的回归方程ŷ=6000+0.7X,下列说法正确的有()。
A. X每增加1个单位,Y的预测均值增长0.7个单位B. X每减少1个单位,Y的预测均值增长0.7个单位C. X每增加1%,Y平均增长7%D. X每减少1%,Y平均增长7%E. 当X为20000时,Y的预测值为20000
答案 AE 斜率为0.7,X增加1单位对应预测均值增加0.7单位;X=20000时ŷ=6000+0.7×20000=20000,选AE。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

15. 多项选择题
在一元线性回归模型Y=β₀+β₁X+ε且E(ε|X)=0时,下列说法正确的有()。
A. β₀+β₁X描述给定X时Y的线性条件均值B. ε表示除X和Y的线性关系之外的随机因素对X的影响C. ε表示除X和Y的线性关系之外的随机因素对Y的影响D. ε可以由X和Y的线性关系解释E. 误差项ε是一个确定变量
答案 AC 在给定模型假设下,β₀+β₁X描述Y随X变化的线性均值关系;ε表示未被该线性关系解释的Y的随机变异,故AC正确。这里的解释是模型中的统计解释,不能单凭回归式认定因果。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

16. 单项选择题
用样本估计一元线性回归模型参数β₀、β₁的常用方法是()。
A. 二次平均B. 加权平均C. 斯特基方法D. 最小二乘法
答案 D 最小二乘法选择使因变量观测值与拟合值之差的平方和最小的参数估计,故选D。

校勘说明:为明确统计定义、经验标准或教学条件所作的校订后教学题设,不冒充原题原文。

17. 单项选择题
在回归分析中,估计回归系数的最小二乘法的原理是使得()之间 的离差平方和最小。
A. 自变量观测值与均值B. 因变量估计值与均值C. 自变量观测值与估计值D. 因变量观测值与估计值
答案 D 最小二乘法以残差平方和Σ(yi−ŷi)²最小为准则,即因变量观测值与拟合值之间的离差平方和最小,选D。
18. 单项选择题
线性回归模型常用的参数估计方法是()。
A. 最大二乘法B. 最小二乘法C. 最小残差和法D. 最大残差和法
答案 B 线性回归模型常用的估计方法是最小二乘法。
19. 单项选择题
在含截距的普通最小二乘线性回归中,因变量有非零样本方差时,关于样本内普通决定系数R²的说法,正确的是()。
A. 可以为负数B. 可以为正数C. 可以大于1D. 可以等于-1
答案 B 该条件下普通R²=1−SSE/SST,取值在0到1之间,可以为正数,选B。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

20. 单项选择题
测度回归直线对样本数据拟合程度的是()。
A. 相关系数B. 样本估计量C. 决定系数D. 回归系数
答案 C 决定系数记为R²,用于衡量回归模型对样本数据的拟合程度,选C。
21. 单项选择题
下列统计量中,可以测度回归模型对样本数据拟合程度的是()。
A. 决定系数B. 回归截距C. 回归斜率D. 预测值
答案 A 决定系数R²用于衡量模型对样本数据的拟合程度。含截距普通最小二乘回归且因变量样本方差非零时,它等于模型解释平方和占总平方和的比例,选A。
22. 单项选择题
在含截距的普通最小二乘线性回归中,因变量样本方差非零时,样本内普通决定系数R²是指()的比例。
A. 模型能解释的因变量变化占因变量总变化B. 因变量总变化占模型能解释的因变量变化C. 模型能解释的因变量变化占自变量总变化D. 自变量的变化占因变量变化
答案 A 含截距普通最小二乘回归中,R²=解释平方和/总平方和=1−残差平方和/总平方和,表示模型解释的因变量变异占其总变异的比例。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

23. 单项选择题
某机构拟合康复率与药物剂量的回归模型,剂量系数双侧t检验(H₀:β₁=0)的P值为0.08。在0.05显著性水平下,下列说法正确的是()。
A. 可以认为药物剂量的回归系数显著不为0B. 药物剂量每增加1个单位,康复率提高8%C. 尚无足够统计证据认为药物剂量的回归系数不为0D. 已证明药物剂量与康复率没有任何关系
答案 C P=0.08>0.05,不能拒绝H₀:β₁=0,选C。不拒绝不等于证明原假设为真,P值也不是效应大小或因果关系的证明。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

24. 多项选择题
在含截距的普通最小二乘线性回归中,因变量样本方差非零,且各模型使用相同因变量和相同样本。关于样本内普通决定系数R²,下列说法正确的有()。
A. R²是回归模型所能解释的因变量变化占因变量总变化的比例B. R²的取值范围是大于0C. R²数值越大,回归模型的拟合效果越好D. R²越接近于0,回归模型的拟合效果越差E. 自变量个数对未经调整的R²没有影响
答案 ACD 决定系数是回归模型所能解释的因变量变化占因变量总变化的比例,R²的取值范围为0到1。R²越大,模型的拟合效果越好;越接近于0,拟合效果越差,所以A、C、D正确。B错误,因为R²可以等于0。在含截距的普通最小二乘回归中,增加自变量不会使未经调整的R²减小,并可能使其增大,因此E所说“没有影响”错误。E项为网站针对原书未定义符号S作出的明确化改编,原答案A、C、D不变。

校勘说明:《经济基础知识(中级)章节同步习题集-304.pdf》原PDF第209页题面、第211页答案。原书E项写“自变量个数对S没有影响”,但S未在本题定义。网站透明校订为“自变量个数对未经调整的R²没有影响”,这是网站明确化改编的选项,不声称是原书原文;保留原答案。本次另补含截距、非零方差及相同样本等适用条件,属于校订后的教学题设,不冒充原题原文。

25. 多项选择题
一般情况下,使用估计的回归方程之前,需要对模型进行的检验有 ()。
A. 分析回归系数的经济含义是否合理B. 分析变量之间相关的方向C. 分析估计的模型对数据的拟合效果如何D. 分析变量之间相关的程度E. 对模型进行假设检验
答案 ACE 一般情况下,使用估计的回归方程之前,需要对模型进行的检验有:①结合经济 理论和经验分析回归系数的经济含义是否合理;②分析估计的模型对数据的拟合效果如何; ③对模型进行假设检验。
26. 多项选择题
在含截距的普通最小二乘线性回归中,因变量样本方差非零时,下列关于样本内普通决定系数R²的说法正确的有()。
A. 决定系数可以测度回归直线对样本数据的拟合程度B. 决定系数可以取负值C. 决定系数等于1,说明回归直线可以解释样本中因变量的所有变异D. 决定系数等于0,说明该线性回归无法解释因变量的样本变异,但不能排除非线性关系E. 决定系数越接近0,回归直线的拟合效果越好
答案 ACD 普通样本内R²在0到1之间;1表示样本点完全落在拟合线上,0表示该线性模型没有解释样本变异,但不能证明变量毫无关系。修订后ACD正确。

校勘说明:为区分理论模型与拟合方程、消除残缺选项或明确统计条件所作的校订后教学题设,不冒充原题原文。

7本章打卡

做完一项勾一项,当天页会自动更新整体进度。

学完这章就是往前走了一步。记不住的,明天再来看必背,不用今天全记住。

↑ 回到今日顶部

1重点一览

先花 2 分钟看清这章有几个考点、哪几个是必考,心里有数再读书。

12页教材0个 ★★★1个 ★★4个 ★41道章节题约 96 分钟教材印刷页 235-246
考点一 时间序列★
考点二 时间序列的水平分析★
考点三 时间序列的速度分析★★
考点四 时间序列的分解和预测程序★
考点五 平滑预测法★

2教材标色 + 三色笔记

左边是教材原文,彩色句子就是《考点速记》收了的内容,颜色是星级。右边是速记的考点表,和左边的小节对齐。读一节,看一眼右边的表,再往下走。

一、时间序列及其分类

教材 P235

社会经济现象总是随着时间的推移而变化,呈现动态性。统计对社会经济现象的研究,不仅要从静态上揭示研究对象在具体时间、地点、条件下的数量特征和数量关系,而且要从动态上反映其发展变化过程及规律性。统计对事物进行动态研究的基本方法是编制时间序列。

时间序列也称动态数列,是将某一统计指标在各个不同时间上的数值按时间先后顺序编制形成的序列。表 27-1 列举了我国 2017 到 2023 年若干国民经济指标资料。

表 27-1 我国 2017 到 2023 年若干国民经济指标

指标2017201820192020202120222023
国内生产总值(亿元)847382.9936010.11005872.41034867.61173823.01234029.41294271.7
年底总人口数(万人)140011140541141008141212141260141175140967
人均国内生产总值(元/人)60691667267145373338831118738591746
城镇人口比重(%)60.261.562.763.964.765.266.2

资料来源:《中国统计年鉴》

从表 27-1 中可以看出,时间序列由两个基本因素构成:一个是被研究现象所属时间,另一个是反映该现象在一定时间条件下数量特征的指标值。时间构成要素反映时间单位的不同,如年、季、月、日等。表中四个指标以年的顺序进行排列,称为年份时间序列;若以季、月、日为序排列,则称为季、月、日时间序列。同一时间序列中,各指标值的时间单位一般要求相等,这样在分析研究中无须考虑时间单位不同所造成的差异。时间序列中所排列指标值是具有某种性质特征的指标的具体数量表现,表中的四个时间序列代表四种不同的指标,它们是划分时间序列类型的依据。

时间序列按照其构成要素中统计指标值的表现形式,分为绝对数时间序列、相对数时间序列和平均数时间序列三种类型。绝对数时间序列是由绝对数指标值按时间先后顺序排列后形成的序列。依据指标值的时间特点,绝对数时间序列又分为时期序列和时点序列。时期序列中,每一指标值都反映现象在一段时期内发展的结果,即“过程总量”,如表 27-1 中的国内生产总值是当年各月国内生产总值相加的结果。时点序列中,每一指标值都反映现象在一定时点上的瞬间水平,如年底总人口数表明在各年年末时点上的人口数。由绝对数时间序列可以派生出相对数时间序列和平均数时间序列。它们是由同类相对数或平均数指标值按时间先后

教材 P236

顺序排列后形成的序列。表 27-1 中,城镇人口比重是相对数时间序列,人均国内生产总值则是平均数时间序列。

二、时间序列的水平分析

(一)发展水平

发展水平是时间序列中对应于具体时间的指标数值。也就是说,在绝对数时间序列中,发展水平就是绝对数;在相对数和平均数时间序列中,发展水平表现为相对数或平均数。

设时间序列以 y0,y1,y2,…,yn 表示,序列中第一项的指标值 y0 为最初水平,最末项的指标值 yn 为最末水平,处于两者之间的各期指标值(y1,y2,…,yn-1)则为中间水平。根据各期指标值在计算动态分析指标时的作用来划分,又可以分为基期水平和报告期水平。基期水平是作为对比的基础时期的水平,报告期水平则是所要反映与研究的那一时期的水平。

(二)平均发展水平

平均发展水平也称序时平均数或动态平均数,是根据时间序列中各时期发展水平计算的平均数,它可以概括性描述现象在一段时期内所达到的一般水平。时间序列类型不同,计算方法也不同。

1. 绝对数时间序列序时平均数的计算。

(1)由时期序列计算序时平均数。对于时期序列,序时平均数计算公式为

ȳ = (y1 + y2 + … + yn) ÷ n = Σyi ÷ n

式中,yi 为各时期的发展水平(i = 1,2,…,n),n 为时期序列的项数,ȳ 为序时平均数。

例如,根据表 27-1 中的国内生产总值时间序列,计算各年度的平均国内生产总值。

ȳ = (y1 + y2 + … + y7) ÷ 7 = (847382.9 + 936010.1 + … + 1294271.7) ÷ 7 = 7526257.1 ÷ 7 ≈ 1075179.6(亿元)

我国 2017 到 2023 年平均国内生产总值为 1075179.6 亿元。

(2)由时点序列计算序时平均数。时点序列的指标值反映现象在某一时点上的瞬间水平,要正确计算其平均数,从理论上说,应当掌握每一时点上的指标值,然后计算平均单位时点的指标数值。在社会经济统计中一般是将一天看作一个时点,即以“天”作为最小时间单位。这样便有连续时点序列和间断时点序列的区分。资料逐日登记的是连续时点序列;资料不是逐日登记,而是间隔较长一段时间(月、季或年)后再登记一次,然后依序排列的是间断时点序列。这两种时点序列的类型不同,计算序时平均数的方法也有所不同。

第一种情况,由连续时点计算,又分为两种情形。

一种情形是资料逐日登记且逐日排列,即已掌握了整段考察时期内连续性的时点数据,可采用简单算术平均数方法计算,计算公式同样为:

ȳ = (y1 + y2 + … + yn) ÷ n = Σyi ÷ n

式中,yi 为各时点的指标值(i = 1,2,…,n),n 为时点个数,ȳ 为序时平均数。

教材 P237

另一种情形是资料登记的时间单位仍然是 1 天,但实际上只在指标值发生变动时才记录一次。此时需采用加权算术平均数的方法计算序时平均数,权数是每一指标值的持续天数,计算公式为

ȳ = (y1f1 + y2f2 + … + ynfn) ÷ (f1 + f2 + … + fn) = Σyifi ÷ Σfi

式中,yi 为各时点的指标值(i = 1,2,…,n),fi(i = 1,2,…,n)为指标值的持续天数。

例:某种商品 6 月份的库存量记录见表 27-2。

表 27-2 某种商品 6 月份的库存量记录

日期1 到 45 到 78 到 1314 到 2021 到 2324 到 2829 到 30
库存量(台)49523929433851

该商品 6 月份的平均日库存量为:

ȳ = (49×4 + 52×3 + 39×6 + 29×7 + 43×3 + 38×5 + 51×2) ÷ (4 + 3 + 6 + 7 + 3 + 5 + 2) ≈ 40(台)

第二种情况,由间断时点计算,又分为两种情形。

一种情形是每隔一定的时间登记一次,每次登记的间隔相等。间隔相等的间断时点序列序时平均数的计算公式为:

ȳ = [(y1 + y2) ÷ 2 + (y2 + y3) ÷ 2 + … + (yn-1 + yn) ÷ 2] ÷ (n − 1)

式中,yi 为各时点的指标值(i = 1,2,…,n),n 为时点个数,ȳ 为序时平均数。

由上式可见,间隔相等的间断时点序列序时平均数的计算思路是“两次平均”:先求各个时间间隔内的平均数,再对这些平均数进行简单算术平均。

另一种情形是每隔一定的时间登记一次,每次登记的间隔不相等。间隔不相等的间断时点序列序时平均数的计算公式为:

ȳ = [(y1 + y2) ÷ 2 × f1 + (y2 + y3) ÷ 2 × f2 + … + (yn-1 + yn) ÷ 2 × fn-1] ÷ (f1 + f2 + … + fn-1)

间隔不相等的间断时点序列序时平均数的计算也采用“两次平均”的思路,且第一次的平均计算与间隔相等的间断序列相同;进行第二次平均时,由于各间隔不相等,所以应当用间隔长度作为权数,计算加权算术平均数。

例:根据表 27-3 计算某国 2011 到 2023 年平均每年第三产业从业人员数。

表 27-3 某国 2011 到 2023 年第三产业从业人员数(年底数)

年份201120142016201920212023
第三产业从业人员数(万人)271853092033042355613586835639
教材 P238

ȳ = [(27185 + 30920) ÷ 2 × 3 + (30920 + 33042) ÷ 2 × 2 + (33042 + 35561) ÷ 2 × 3 + (35561 + 35868) ÷ 2 × 2 + (35868 + 35639) ÷ 2 × 2] ÷ (3 + 2 + 3 + 2 + 2) = 33080(万人)

2. 相对数或平均数时间序列序时平均数的计算。相对数或平均数时间序列是派生数列,相对数或平均数通常是由两个绝对数对比形成的。要计算相对数或平均数时间序列的序时平均数,不能就序列中的相对数或平均数直接进行平均计算;而必须分别求出分子指标和分母指标时间序列的序时平均数,然后再进行对比。用公式表示:

ȳ = ā ÷ b̄

式中,ȳ 为相对数或平均数时间序列的序时平均数,ā 为分子指标时间序列的序时平均数,b̄ 为分母指标时间序列的序时平均数。

例:根据表 27-4 计算某国 2018 到 2023 年第三产业从业人员数占总从业人员数比重的年平均数。

表 27-4 某国 2018 到 2023 年从业人员数(年底数)

年份201820192020202120222023
总从业人员数(万人)757827544775064746527335174041
第三产业从业人员数(万人)349113556135806358683458335639
第三产业从业人员数占总从业人员数比重(%)46.0747.1347.7048.0547.1548.13

ā = [(34911 + 35561) ÷ 2 + (35561 + 35806) ÷ 2 + (35806 + 35868) ÷ 2 + (35868 + 34583) ÷ 2 + (34583 + 35639) ÷ 2] ÷ 5 = 35418.6(万人)

b̄ = [(75782 + 75447) ÷ 2 + (75447 + 75064) ÷ 2 + (75064 + 74652) ÷ 2 + (74652 + 73351) ÷ 2 + (73351 + 74041) ÷ 2] ÷ 5 = 74685.1(万人)

ȳ = ā ÷ b̄ = 35418.6 ÷ 74685.1 × 100% ≈ 47.4%

该国 2018 到 2023 年第三产业从业人员数占总从业人员数比重的年平均数为 47.4%。

(三)增长量与平均增长量

1. 增长量。增长量是报告期发展水平与基期发展水平之差,反映报告期比基期增加(减少)的绝对数量。计算公式为:

增长量 = 报告期水平 − 基期水平

根据基期的不同确定方法,增长量可分为逐期增长量和累计增长量。

(1)逐期增长量。逐期增长量是报告期水平与前一期水平之差,用公式表示为:

Δi = yi − yi-1(i = 1,2,…,n)

它表明现象逐期增加(减少)的绝对数量。当 i = 1 时,y0 表示时间序列的最初水平;y1 是

教材 P239

研究范围的起始期水平。

(2)累计增长量。累计增长量是报告期水平与某一固定时期水平(通常是时间序列最初水平)之差,用公式表示为:

Δi' = yi − y0(i = 1,2,…,n)

它表明报告期比该固定时期增加(减少)的绝对数量。

易于看出,同一时间序列中,累计增长量等于相应时期逐期增长量之和,即:

Δi' = yi − y0 = Σ(yi − yi-1)(i = 1,2,…,n)

2. 平均增长量。平均增长量是时间序列中逐期增长量的序时平均数,它表明现象在一定时段内平均每期增加(减少)的数量。计算公式为:

Δ̄ = Σ(yi − yi-1) ÷ n(i = 1,2,…,n)

式中,n 表示逐期增长量个数。

根据逐期增长量与累计增长量之间的数量关系,平均增长量还可以用下式表示:

Δ̄ = (yn − y0) ÷ (N − 1)

式中,N 表示时间序列项数。

三、时间序列的速度分析

(一)发展速度与增长速度

1. 发展速度。发展速度是以相对数形式表示的两个不同时期发展水平的比值,表明报告期水平已发展到基期水平的几分之几或若干倍。计算公式为:

发展速度 = 报告期水平 ÷ 基期水平

由于基期选择的不同,发展速度有定基与环比之分。定基发展速度是报告期水平与某一固定时期水平(通常是最初水平)的比值,用 ai 表示,则有:

ai = yi ÷ y0(i = 1,2,…,n)

它说明社会经济现象相对于某个基础水平,在一定时期内总的发展速度。

环比发展速度是报告期水平与其前一期水平的比值,用 bi 表示,则有:

bi = yi ÷ yi-1(i = 1,2,…,n)

它说明所研究现象相邻两个时期(逐期)发展变化的程度。

由上式可知,定基发展速度时间序列中,各时期比较的基础固定在一个共同的水平(y0)上;环比发展速度时间序列则呈现各时期发展水平交替作为报告期与基期使用的循环对比状态。两者虽有区别,但也存在着一定的数量依存关系。

第一,定基发展速度等于相应时期内各环比发展速度的连乘积。

yn ÷ y0 = (y1 ÷ y0) × (y2 ÷ y1) × … × (yn ÷ yn-1)

教材 P240

第二,两个相邻时期定基发展速度的比率等于相应时期的环比发展速度。

(yi ÷ y0) ÷ (yi-1 ÷ y0) = yi ÷ yi-1

实际工作中,经常利用上述关系式对发展速度指标进行推算或换算。

2. 增长速度。增长速度是报告期增长量与基期水平的比值,表明报告期水平比基期增长(或降低)了若干倍(或百分之几)。计算公式为:

增长速度 = 增长量 ÷ 基期水平

由于基期选择的不同,增长速度也有定基与环比之分。上述计算公式中,若增长量为累计增长量,则计算的是定基增长速度,用 Ai 表示,就有:

Ai = (yi − y0) ÷ y0 = ai − 1(i = 1,2,…,n)

若增长量为逐期增长量,则计算的是环比增长速度,用 Bi 表示,就有:

Bi = (yi − yi-1) ÷ yi-1 = bi − 1(i = 1,2,…,n)

发展速度与增长速度是对社会经济现象进行动态分析的基本指标,应用中要注意的问题是:定基增长速度与环比增长速度不能像定基发展速度与环比发展速度那样互相推算,因为定基增长速度不等于相应时期内各环比增长速度的连乘积;两个相邻时期定基增长速度的比率也不等于相应时期的环比增长速度。定基增长速度与环比增长速度之间的推算,必须通过定基发展速度和环比发展速度才能进行。

(二)平均发展速度与平均增长速度

平均发展速度和平均增长速度是两个非常重要的平均速度指标。前者反映现象在一定时期内逐期发展变化的一般程度,后者则反映现象在一定时期内逐期增长(降低)变化的一般程度。因此,这两个指标在国民经济管理和统计分析中有广泛的应用,是编制和检查计划的重要依据,还可以用于一个国家或地区不同阶段发展状况的比较,以及同一时期不同国家或地区发展状况的比较。

就计算方法来说,重点是平均发展速度指标。因为平均增长速度既不能由各期的环比增长速度求得,也不能根据一定时期的总增长速度计算,平均增长速度是通过它与平均发展速度之间的数量关系求得的:

平均增长速度 = 平均发展速度 − 1

由于平均发展速度是一定时期内各期环比发展速度的序时平均数,各时期对比的基础不同,所以不能采用一般序时平均数的计算方法。目前,计算平均发展速度通常采用几何平均法,几何平均法也称水平法。采用这一方法的原理是,一定时期内现象发展的总速度等于各期环比发展速度的连乘积。根据平均数的计算原理,应当按连乘法,即几何平均数公式计算各指标值的平均数。

yn ÷ y0 = (y1 ÷ y0) × (y2 ÷ y1) × … × (yn ÷ yn-1) = b1 × b2 × … × bn = Π bi

式中,Π 为连乘号,bi 为环比发展速度,n 为环比发展速度的时期数,则:

教材 P241

b̄ = ⁿ√(Π bi) = ⁿ√(yn ÷ y0)

式中,b̄ 为平均发展速度。

上述两式都是平均发展速度几何平均法的计算公式,可以根据资料的掌握情况选择应用。

(三)速度的分析与应用

在应用速度分析实际问题时,须防止误用乃至滥用的现象,应注意:

1. 当时间序列中的指标值出现 0 或负数时,不宜计算速度。例如,假定某企业连续 5 年的利润额分别为 5 万元、2 万元、0、−3 万元、2 万元,对这一序列计算速度,要么不符合数学公理,要么无法解释其实际意义。在这种情况下,适宜直接用绝对数进行分析。

2. 速度指标的数值与基数的大小有密切关系。在环比增长速度时间序列中,各期的基数不同,因此,运用这一指标反映现象增长的快慢时,往往要结合水平指标的分析才能得出正确结论,“增长 1% 的绝对值”是进行这一分析的指标。它反映同样的增长速度,在不同时间条件下所包含的绝对水平。计算公式为:

增长 1% 的绝对值 = 逐期增长量 ÷ 环比增长速度

用符号表示为:

增长 1% 的绝对值 = (yi − yi-1) ÷ [(yi − yi-1) ÷ yi-1 × 100] = yi-1 ÷ 100

环比增长速度是相对数,一般用百分数表示。上式推导中分母指标乘以 100,就将它还原为绝对数,这样才能与分子指标对比计算。

例如,某市 2018 到 2024 年能源生产量列于表 27-5,根据这些资料计算的发展速度、增长速度及增长 1% 的绝对值也列于该表中。

表 27-5 某市 2018 到 2024 年能源生产量及速度指标

年份2018201920202021202220232024
发展水平(万吨标准煤)99.38152.31160149.79190.77187.57191.3
定基发展速度(%)100153.26161.00150.72191.96188.74192.49
环比发展速度(%)无153.26105.0593.62127.3698.32101.99
定基增长速度(%)无53.2661.0050.7291.9688.7492.49
环比增长速度(%)无53.265.05−6.3827.36−1.681.99
增长 1% 的绝对值(万吨标准煤)无0.991.521.601.501.911.88

(1)由表中资料可以验证定基发展速度与环比发展速度之间的数量依存关系。

192.49% = 153.26% × 105.05% × 93.62% × 127.36% × 98.32% × 101.99%

教材 P242

即 2024 年与 2018 年的定基发展速度等于这一时期各年环比发展速度的乘积。又如:

101.99% = 192.49% ÷ 188.74%

即 2024 年与 2023 年的环比发展速度等于这两年定基发展速度的比率。

(2)由表中资料可以看到,2022 年能源生产量的环比增长速度是 27.36%,大于 2024 年的 1.99%,但是 2022 年能源生产量每增加 1% 的生产绝对量为 1.50 万吨标准煤,却低于 2024 年的 1.88 万吨标准煤,可见,2024 年该市的能源发展水平并不比 2022 年差,反而更好。

(3)用几何平均法计算该市 2018 到 2024 年能源生产量平均发展速度和平均增长速度。

b̄ = ⁶√(Π bi) = ⁶√(153.26% × 105.05% × 93.62% × 127.36% × 98.32% × 101.99%) = ⁶√192.50% ≈ 111.53%

或 b̄ = ⁶√(y6 ÷ y0) = ⁶√(191.3 ÷ 99.38) = ⁶√1.9249 ≈ 111.53%

平均增长速度 = b̄ − 1 = 111.53% − 1 = 11.53%

四、时间序列的分解和预测程序

时间序列的变化可能受一种或几种因素的影响,这种因素称为时间序列的成分。时间序列的成分通常有长期趋势(T)、季节变动(S)、循环波动(C)和不规则波动(I)等四种。

长期趋势(T)是时间序列在较长一段时间内呈现的持续上升或持续下降的变动。这种趋势可能是线性的,也可能是非线性的。

季节变动(S)是时间序列在一年内重复出现的周期性波动。例如,旅游、商品销售、农业生产、交通运输等行业的生产经营中都有明显的季节变动特征。

循环波动(C)是时间序列呈现出的非固定长度的周期性变动。例如,经济周期有涨落相间的交替波动,周期长短不一,无固定规律。

不规则波动(I)是时间序列中除去长期趋势、季节变动和循环波动之后的随机波动。不规则波动往往是由一些偶然因素引起的,难以预测和控制,因此在时间序列预测中通常不予单独考虑。

一个时间序列可能只包含一种成分,也可能是由几种成分混合而成的(见图 27-1)。时间序列分析时经常在一定的模型假定下把这些成分从时间序列里分离出来,对各成分分别进行分析。不同的模型中对四种成分之间的关系假定不同,如加法模型中假定 Yt = Tt + St + Ct + It,乘法模型中假定 Yt = Tt × St × Ct × It。

时间序列分析的一个主要目的就是根据历史数据对未来进行预测。时间序列的预测通常包括以下几个步骤:

第一步:确定时间序列所包含的成分;

第二步:找出适合该时间序列的预测方法;

第三步:对可能的预测方法进行评估,以确定最佳预测方案;

第四步:利用最佳预测方案进行预测。

教材 P243

图 27-1 含有不同成分的时间序列(四幅折线图,此处略)

a)有趋势的时间序列图 b)有趋势和季节性的时间序列图 c)有周期变动的时间序列图 d)不规则波动的时间序列图

五、平滑预测法

平滑法的目的就是“消除”时间序列的不规则成分所引起的随机波动,所以被称为平滑法,包括移动平均法和指数平滑法等。平滑法适用于平稳时间序列的预测,即没有明显的趋势、循环和季节波动的时间序列。平滑法简单易用,对数据的要求最低,通常对于近期(如下一期)的预测具有较高的精度。

(一)移动平均法

移动平均法使用时间数列中最近 k 期数据值的平均数作为下一期的预测值,其计算公式为:

Ȳt = (Yt-k+1 + Yt-k+2 + … + Yt-1 + Yt) ÷ k

式中,Ȳt 为对时间序列的 Yt 预测结果,k 为移动间隔(1 < k < t)。

对于 t + 1 期的简单移动平均预测值为:

Ft+1 = Ȳt = (Yt-k+1 + Yt-k+2 + … + Yt-1 + Yt) ÷ k

例如,根据表 27-6 中 2007 到 2025 年某国居民消费价格指数数据,应用移动平均法,选取

教材 P244

移动间隔 k = 3,计算各期居民消费价格指数的预测值,并对 2026 年居民消费价格指数进行预测。

表 27-6 应用移动平均法预测居民消费价格指数

年份居民消费价格指数3 期移动平均预测值预测误差
2007101.8无无
2008101.5无无
2009104.8无无
2010105.9102.7−3.2
201199.3104.14.8
2012103.3103.30.0
2013105.4102.8−2.6
2014102.6102.70.1
2015102.6103.81.2
2016102103.51.5
2017101.4102.41.0
2018102102.00.0
2019101.6101.80.2
2020102.1101.7−0.4
2021102.9101.9−1.0
2022102.5102.2−0.3
2023100.9102.51.6
2024102102.10.1
2025100.2101.81.6
2026无101.0无

以 3 项移动平均(k = 3)为例,表 27-6 中的 102.7 就是 2007 年、2008 年和 2009 年 3 年的平均值,用来作为 2010 年的预测值。同样地,101.0 就是 2023 年、2024 年和 2025 年 3 年的平均值,用来作为 2026 年的预测值。

(二)指数平滑法

指数平滑法是利用过去时间序列值的加权平均数作为预测值,即使得第 t + 1 期的预测值等于第 t 期的实际观察值与第 t 期预测值的加权平均值。这种方法的特点是,观测值离预测时期越久远,其权重也变得越小,呈现出指数下降,因而称为指数平滑。其基本计算公式为:

教材 P245

Ft+1 = αYt + (1 − α)Ft

式中,Ft+1 和 Ft 分别为第 t + 1 期和第 t 期的指数平滑预测值;Yt 为第 t 期的实际观察值;α 为平滑系数(即权重),取值范围为 0 < α < 1。

由于在开始计算时,没有第 1 期的预测值 F1,一般可以设 F1 为第 1 期的实际观察值,即 F1 = Y1,则第 2 期的预测值为:

F2 = αY1 + (1 − α)F1 = αY1 + (1 − α)Y1 = Y1

第 3 期的预测值为:

F3 = αY2 + (1 − α)F2 = αY2 + (1 − α)Y1

第 4 期的预测值为:

F4 = αY3 + (1 − α)F3 = αY3 + (1 − α)αY2 + (1 − α)²Y1

以此类推。

表 27-7 还是利用 2007 到 2025 年某国居民消费价格指数数据,应用指数平滑法,选取平滑系数 α = 0.8,计算各期居民消费价格指数的预测值,并对 2026 年居民消费价格指数进行预测。

表 27-7 应用指数平滑法预测居民消费价格指数

年份居民消费价格指数指数平滑预测值 α = 0.8预测误差
2007101.8无无
2008101.5101.80.3
2009104.8101.6−3.2
2010105.9104.2−1.7
201199.3105.66.3
2012103.3100.6−2.7
2013105.4102.8−2.6
2014102.6104.92.3
2015102.6103.10.5
2016102102.70.7
2017101.4102.10.7
2018102101.5−0.5
2019101.6101.90.3
2020102.1101.7−0.4
2021102.9102.0−0.9
2022102.5102.70.2
2023100.9102.51.6
教材 P246
年份居民消费价格指数指数平滑预测值 α = 0.8预测误差
2024102101.2−0.8
2025100.2101.81.6
2026无100.5无

表 27-7 是用 α = 0.8 对各期居民消费价格指数进行指数平滑预测的结果,并给出了预测误差和 2026 年的预测值:

F2026 = 0.8 × Y2025 + 0.2 × F2025 = 0.8 × 100.2 + 0.2 × 101.8 = 100.5

3必背

这些是必须背下来的。先遮住右边一列,看左边考点名,自己说出内容,说不出来的做记号。

经济基础 第27章 时间序列分析 必背

红 ★★★ 必考

本章没有 ★★★ 考点。重心全在 ★★ 的速度分析,计算题基本从那里出。

黄 ★★ 重点

考点必背内容
发展速度报告期水平 ÷ 基期水平,表明报告期发展到基期的几分之几或若干倍
定基发展速度ai = yi ÷ y0,基期固定为最初水平
环比发展速度bi = yi ÷ yi-1,基期是前一期
定基与环比的关系定基发展速度 = 各环比发展速度连乘;相邻两期定基发展速度之比 = 环比发展速度
增长速度增长量 ÷ 基期水平 = 发展速度 − 1
定基增长速度Ai = (yi − y0) ÷ y0 = ai − 1,用累计增长量
环比增长速度Bi = (yi − yi-1) ÷ yi-1 = bi − 1,用逐期增长量
增长速度不能互推定基增长速度不等于环比增长速度连乘,相邻定基增长速度之比也不等于环比增长速度;要推算必须先加 1 变成发展速度
平均发展速度反映一定时期内逐期发展变化的一般程度;用几何平均法(又叫水平法),原理是总速度 = 各期环比发展速度连乘积
平均发展速度公式b̄ = ⁿ√(b1 × b2 × … × bn) = ⁿ√(yn ÷ y0),n 是环比发展速度的个数
平均增长速度反映一定时期内逐期增长(降低)的一般程度;平均增长速度 = 平均发展速度 − 1,不能直接由环比增长速度算
速度分析注意一指标值出现 0 或负数时,不宜计算速度,直接用绝对数分析
速度分析注意二速度数值与基数大小关系密切,要结合水平指标看
增长 1% 的绝对值逐期增长量 ÷ 环比增长速度 = 前一期水平 ÷ 100

绿 ★ 里会考数字、公式、分类的点

考点必背内容
时间序列含义又叫动态数列,某一统计指标在不同时间上的数值按时间先后排成的序列
时间序列两要素现象所属时间 + 该时间条件下的指标值
时间序列三类型绝对数、相对数、平均数;绝对数序列再分时期序列(过程总量,如 GDP)和时点序列(瞬间水平,如年底人口)
发展水平序列里对应具体时间的指标数值;y0 最初水平,yn 最末水平,中间的是中间水平;按作用分基期水平、报告期水平
平均发展水平又叫序时平均数、动态平均数
时期序列序时平均数ȳ = Σyi ÷ n,简单算术平均
连续时点,逐日登记ȳ = Σyi ÷ n,同时期序列
连续时点,变动才登记ȳ = Σyifi ÷ Σfi,持续天数 fi 作权数
间断时点,间隔相等ȳ = [(y1 + y2) ÷ 2 + (y2 + y3) ÷ 2 + … + (yn-1 + yn) ÷ 2] ÷ (n − 1),「首尾折半,两次平均」,分母是 n − 1
间断时点,间隔不等先首尾折半,再用间隔长度 fi 作权数加权平均
相对数或平均数序列序时平均数ȳ = ā ÷ b̄,分子分母各自算序时平均再相除,绝不能拿相对数直接平均
增长量报告期水平 − 基期水平;逐期增长量 = yi − yi-1,累计增长量 = yi − y0
增长量关系累计增长量 = 相应各逐期增长量之和
平均增长量逐期增长量的序时平均数 = 逐期增长量之和 ÷ 逐期增长量个数 = (yn − y0) ÷ (项数 − 1)
时间序列四成分T 长期趋势(持续上升或下降)、S 季节变动(一年内重复的周期波动)、C 循环波动(非固定长度的周期变动)、I 不规则波动(剩下的随机波动)
分解模型加法模型 Y = T + S + C + I;乘法模型 Y = T × S × C × I
预测四步确定成分、找预测方法、评估方法定最佳方案、用最佳方案预测
平滑法目的:消除不规则成分引起的随机波动;适用:平稳序列(无明显趋势、循环、季节波动);特点:简单易用、对数据要求最低、近期(下一期)预测精度高
移动平均法最近 k 期的平均数当下一期预测值:Ft+1 = (Yt-k+1 + … + Yt) ÷ k,1 < k < t
指数平滑法Ft+1 = αYt + (1 − α)Ft,0 < α < 1;越久远的观测值权重越小,呈指数下降;F1 = Y1

数字与公式清单

  • 发展速度 = 报告期 ÷ 基期;增长速度 = 发展速度 − 1
  • 定基发展速度 = 环比发展速度连乘;相邻定基发展速度之比 = 环比发展速度
  • 平均发展速度 b̄ = ⁿ√(yn ÷ y0),n = 环比速度个数 = 数据个数 − 1
  • 平均增长速度 = 平均发展速度 − 1
  • 增长 1% 的绝对值 = 前一期水平 ÷ 100
  • 间隔相等间断时点序时平均:首尾折半,分母 n − 1
  • 平均增长量 = (yn − y0) ÷ (项数 − 1)
  • 相对数序列序时平均 = ā ÷ b̄
  • 移动平均 k 期:1 < k < t
  • 指数平滑 α:0 < α < 1,Ft+1 = αYt + (1 − α)Ft
  • 教材例题:α = 0.8,F2026 = 0.8 × 100.2 + 0.2 × 101.8 = 100.5
  • 教材例题:2018 到 2024 年能源生产量平均发展速度 = ⁶√(191.3 ÷ 99.38) ≈ 111.53%,平均增长速度 11.53%

4总结

一页纸看完整章。二轮快刷和考前只看这里和必背。

经济基础 第27章 时间序列分析 一页纸总结

本章一句话

把一个指标按时间排成一串(时间序列),然后从三个角度看它:水平怎么样(平均是多少、涨了多少)、速度怎么样(涨了百分之几、平均每年涨多快)、以后会怎么样(拆成趋势季节循环随机四种成分,再用移动平均或指数平滑预测下一期)。全章就是「排、算、测」三个字。

章末总览表

考点星级一句话要点考法
考点一 时间序列★两要素(时间 + 指标值);三类型(绝对、相对、平均);绝对数再分时期序列(总量可加,如 GDP)和时点序列(瞬间存量,如年底人口)单选(判断某指标属于哪类序列)、多选
考点二 时间序列的水平分析★发展水平(最初、最末、中间;基期、报告期);序时平均数按序列类型分五种算法,间断时点「首尾折半」是重点;增长量分逐期、累计;平均增长量 = (yn − y0) ÷ (项数 − 1)单选、计算(间断时点序时平均数、平均增长量)
考点三 时间序列的速度分析★★发展速度 = 报告期 ÷ 基期,增长速度 = 发展速度 − 1;定基与环比发展速度可互推(连乘、相除),增长速度不能;平均发展速度用几何平均 ⁿ√(yn ÷ y0),平均增长速度 = 平均发展速度 − 1;指标有 0 或负数不算速度;增长 1% 的绝对值 = 前一期水平 ÷ 100单选、多选、计算(本章计算题的主战场)
考点四 时间序列的分解和预测程序★四成分 TSCI:趋势、季节(一年内固定周期)、循环(周期不固定)、不规则;预测四步:定成分、选方法、评方法、做预测单选、多选(成分辨认、步骤排序)
考点五 平滑预测法★目的消除随机波动,只适用于平稳序列,近期预测精度高;移动平均 = 最近 k 期平均;指数平滑 Ft+1 = αYt + (1 − α)Ft,0 < α < 1单选、计算(给 α 和两个数套公式)

易错坑

  1. 能互相推算的只有「发展速度」:定基 = 环比连乘,相邻定基之比 = 环比。「增长速度」之间既不能连乘也不能相除,要算先加 1 变成发展速度。
  2. 几何平均开几次方看环比发展速度有几个,即数据个数减 1。2018 到 2024 年 7 个数据,开 6 次方。
  3. 间隔相等的间断时点序列,分母是 n − 1(间隔个数),不是 n(时点个数)。平均增长量的分母也是「项数 − 1」。
  4. 相对数或平均数序列的序时平均数,不能把各期比重直接平均,要分子、分母各算序时平均再相除。
  5. 季节变动和循环波动的区别在周期是否固定:一年内重复的是季节变动,长短不一的(如经济周期)是循环波动。平滑法只能用于没有趋势、循环、季节的平稳序列。

和前后章的关系

本章是统计部分(第 23 到 27 章)的最后一章。第 24 章讲了平均数(算术平均、几何平均)和第 25 章的抽样、第 26 章的回归,都是在「一批数据」上做文章;本章把数据按时间排开,序时平均数就是算术平均和加权平均的变形,平均发展速度就是几何平均数的应用。学完本章统计部分结束,第 28 章起进入会计部分(会计概论),思路完全换轨,本章的公式记牢就能收官。

5解读(读透版讲义)

哪里没看懂,来这里看大白话讲解。生活例子、考法、坑都在这。可以先读这个再回去读教材。

时间序列分析(教材原文·OCR)

文字为主,公式/图表以教材扫描为准。配套精华看复习网页。

第二十七章 “时间序列分析

一时间序列及其分类

社会经济现象总是随着时间的推移而变化,呈现动态性。统计对社会经济现象的研究 ,不
仅要从静态上揭示研究对象在具体时间、地点,条件下的数量特征和数量关系,而且要从动态
上反映其发展变化过程及规律性。统计对事物进行动态研究的基本方法是编制时间序列。

时间序列也称动态数列,是将某一统计指标在各个不同时间上的数值按时间先后顺序纺
制形成的序列。表 27-1 列举了我国 2017一2023 年若干国民经济指标资料。

表 27-1 我国 2017一2023 年若干国民经济指标
_ 年份
指标
2017 2018 2019 2020 2021 2022 2023
下 847382.9 | 936010.1 | 1005872.4 | 1034867.6 | 1173823.0 | 1234029.4 | 1294271.7
年底总人口数 140011 140541 141008 141212 141260 141175 140967
(万人)
人 二 什 60691 66726 71453 73338 83111 87385 91746
(元/人)
口
拉人人 60.2 61.5 62.7 63.9 64.7 65.2 66.2
力

资料来源:《中国统计年鉴》

从表 27-1 中可以看出,时间序列由两个基本因素构成: 一个是被研究现象所属时间,另
一个是反映该现象在一定时间条件下数量特征的指标值。时间构成要素反映时间单位的不
同,如年.季\月日等。 生生 全 顺序进行排列 ,称为年份时间序列; 若以季 月 日
为序排列,则称为季 月 .日时间序列。同一时间序列中,各指标值的时间单位一般要求相等,
这样在分析研究中无项考虑时间单位不同所造成的差异 时间序列中所排列指标值是具有某
种性质特征的指标的具体数量表现,表中的四个时间序列代表四种不同的指标,它们是划分时
间序列类型的依据。

时间序列按照其构成要素中统计指标值的表现形式,分为绝对数时间序列`.相对数时间序
列和平均数时间序列三种类型。绝对数时间序列是由绝对数指标值按时间先后顺序排列后形
成的序列。依据指标值的时间特点,绝对数时间序列又分为时期序列和时点序列。时期序列
中,每一指标值都反映现象在一段时期内发展的结果,即 “过程总量",如表 27-1 中的国内生
产总值是当年各月国内生产总值相加的结果。时点序列中,每一指标值都反映现象在一定时
点上的瞬间水平,如年底总人口数表明在各年年末时点上的人口数。由绝对数时间序列可以
派生出相对数时间序列和平均数时间序列。它们是由同类相对数或平均数指标值按时间先后

236 , 经济基础知识《中级)

顺序排列后形成的序列。表 27-1 中 ,城镇人口比重是相对数时间序列,人均国内生产总值则
是平均数时间序列。

二时间序列的水平分析

( 一)发展水平
发展水平是时间序列中对应于具体时间的指标数值。也就是说,在绝对数时间序列中,发
展水平就是绝对数; 在相对数和平均数时间序列中 ,发展水平表现为相对数或平均数。
设时间序列以m, 和,7,…,思表示,序列中第一项的指标值 y% 为最初水平,最末项的
指标值y 为最末水平,处于两者之间的各期指标值(y,入,…,》- )则为中间水平。根据
各期指标值在计算动态分析指标时的作用来划分,又可以分为基期水平和报告期水平。基
期水平是作为对比的基础时期的水平,报告期水平则是所要反映与研究的那一时期的水
平。
( 二 )平均发展水平
平均发展水平也称序时平均数或动态平均数,是根据时间序列中各时期发展水平计算的
平均数,它可以概括性描述现象在一段时期内所达到的一般水平。时间序列类型不同 ,计算方
法也不同。

  1. 绝对数时间序列序时平均数的计算。

(1 ) 由时期序列计算序时平均数。对于时期序列,序时平均数计算公式为
yi +ya二十 2
用 刀
式中, y, 为各时期的发展水平(六1,2,…,m),m 为时期序列的项数,7为序时平均数。
例如,根据表 27-1 中的国内生产总值时间序列,计算各年度的平均国内生产总值。
密

加 人
=于 ]2 十yn 一 本 一 7526257.1 ~ 1075179.6(亿元)

用

我国 2017一2023 年平均国内生产总值为 1075179.6 亿元。

(2 )由时点序列计算序时平均数。时点序列的指标值反映现象在某一时点上的瞬间水
平,要正确计算其平均数,从理论上说,应当掌握每一时点上的指标值,然后计算平均单位时点
的指标数值。在社会经济统计中一般是将一天看作一个时点,即以“天”作为最小时间单位。
这样便有连续时点序列和间断时点序列的区分。资料逐日登记的是连续时点序列; 资料不是
逐日登记,而是间隔较长一段时间 ( 月 、.季或年 )后再登记一次,然后依序排列的是间断时点序
列。这两种时点序列的类型不同 ,计算序时平均数的方法也有所不同。

第一种情况,由连续时点计算,又分为两种情形。

一种情形是资料逐日登记且逐日排列,即已掌握了整段考察时期内连续性的时点数据,可

7y=

力二因+ 二 妆2
也 也

式中, y; 为各时点的指标值 (二1,2,.…,m ),m 为时点个数,7为序时平均数。

7 =

第二十毛章“时间序列分析 ,237,
另一种情形是资料登记的时间单位仍然是 1 天,但实际上只在指标值发生变动时才记录
一次。此时需采用加权算术平均数的方法计算序时平均数,权数是每一指标值的持续天数,计

过yi

了-=站 +入户+人十为大 _ ial
AP
之/
21

式中,y 为各时点的指标值 (=1,2,…,m),太(=1,2, … ,7 ) 为指标值的持续天数。
例: 某种商品 6 月份的库存量记录见表 27-2。

表 27-2 某种商品 6 月份的库存量记录
日期 1一4 5一7 8一13 14一20 21一23 24一28 29一30
库存量(台 ) 49 52 39 29 43 38 51

该商品 6 月份的平均日库存量为:
-_ 49x4+52x3+39x6+29x7+43x3+38x5+5lx2
4+3+6+7+3+5+2

第二种情况,由间晰时点计算,又分为两种情形。
一种情形是每隔一定的时间登记一次,每次登记的间隔相等。间隔相等的间断时点序列
序时平均数的计算公式为:

=40(台)

yi +y ya +]3 加-1 十和
2 2 7
了一 刀.一1
式中,y 为各时点的指标值( 过1,2,'…,),m 为时点个数,7为序时平均数。
由上式可见,间隔相等的间断时点序列序时平均数的计算思路是“两次平均”: 先求各个
时间间隔内的平均数,再对这些平均数进行简单算术平均。
另一种情形是每隔一定的时间登记一次,每次登记的间隔不相等。间隔不相等的间断时
点序列序时平均数的计算公式为:
1 二2 》2 十 3 -1 十yn
+
之
间隔不相等的间断时点序列序时平均数的计算也采用“两次平均”的思路,且第一次的平
均计算与间隔相等的间断序列相同; 进行第二次平均时,由于各间隔不相等,所以应当用间隔
长度作为权数,计算加权算术平均数。
例: 根据表 27-3 计算某国 2011一2023 年平均每年第三产业从业人员数。

7=

表 27-3 某国 2011一2023 年第三产业从业人员数( 年底数 )
年份 2011 2014 2016 2019 2021 2023
第三产业
从业人员数 27185 30920 33042 35561 35868 35639
(万人) 、

,238 , 经济基础知识(中级)

27185+30920 30920+33042 33042+35561 35561+35868 35868+35639
阅 X3+ 7 X2+ 7 X3+ 2 X2+ 2 X

3+2+3+2+2

2

7=

=33080(万人)

  1. 相对数或平均数时间序列序时平均数的计算。相对数或平均数时间序列是派生数列,

相对数或平均数通常是由两个绝对数对比形成的。要计算相对数或平均数时间序列的序时平
均数,不能就序列中的相对数或平均数直接进行平均计算; 而必须分别求出分子指标和分母指
标时间序列的序时平均数,然后再进行对比。用公式表示:

7=三
站
式中,7为相对数或平均数时间序列的序时平均数,z 为分子指标时间序列的序时平均数,2 为
分母指标时间序列的序时平均数。
例: 根据表 27-4 计算某国 2018一2023 年第三产业从业人员数占总从业人员数比重的年

表 27-4 某国 2018一2023 年从业人员数( 年底数 )
年份 2018 2019 2020 2021 2022 2023
总从业人员数(万人) 75782 75447 75064 74652 73351 74041
第三产业从业人员数 34911 3556lzf|l。 35806 35868 34583 35639
(万人)
第三产业从业人员数占总
46.07 47.13 47.70 48.05 47.15 48.13
从业人员数比重(%)
34911+35561 35561+35806 ,35806+35868 |, 35868+34583 ,34583+35639
和 2 2 2 2 2
帮 5
=35418.6(万人)
75782+75447 , 75447+75064 , 75064+74652 ,74652+73351 | 73351+74041
三 - 2 2 2 包 2
5
= 74685.1(万人)

35418.6 关
5685了X 100% 一 47.4%

了
该国 2018一2023 年第三产业从业人员数占总从业人员数比重的年平均数为 47.4%。

( 三 )增长量与平均增长量

1.增长量。增长量是报告期发展水平与基期发展水平之差,反映报告期比基期增加(减
少 )的绝对数量。计算公式为:

增长量 = 报告期水平 - 基期水平
根据基期的不同确定方法,增长量可分为逐期增长量和累计增长量。
(1 )逐期增长量。逐期增长量是报告期水平与前一期水平之差,用公式表示为:
4=yryj (ti=12,…,)
它表明现象逐期增加(减少 ) 的绝对数量。当 i=1 时,yo 表示时间序列的最初水平;7 是

第二十毛章“时间序列分析 “239,

研究范围的起始期水平。
(2 ) 累计增长量。累计增长量是报告期水平与某一固定时期水平( 通常是时间序列最初
水平 )之差,用公式表示为:
4=和名 GE=1,2,)
它表明报告期比该固定时期增加( 减少 ) 的绝对数量。
易于看出,同一时间序列中,累计增长量等于相应时期逐期增长量之和,即;

44=和一 nm (7 一yi)
2.平均增长量。平均增长量是时间序列中逐期增长量的序时平均数,它表明现象在一定
时段内平均每期增加(减少 ) 的数量。计算公式为:
Or
4= 一 GE=12和1)
式中,m 表示逐期增长量个数。
根据逐期增长量与累计增长量之间的数量关系,平均增长量还可以用下式表示:

本和二加
4= Ni

式中, 表示时间序列项数。

三时间序列的速度分析

( 一')发展速度与增长速度
1 发展速度。发展速度是以相对数形式表示的两个不同时期发展水平的比值,表明报告
期水平已发展到基期水平的几分之几或若干倍。计算公式为:
、,, 报告期水平
发展速度 = 基期水平
由于基期选择的不同,发展速度有定基与环比之分。定基发展速度是报告期水平与某-
男定时期水平( 通常是最初水平 )的比值,用w 表示,则有:
和
yo
它说明社会经济现象相对于革个基础水平,在一定时期内总的发展速度。
环比发展速度是报告期水平与其前一期水平的比值,用到表示,则有;

= (12,)

昌

(=1)2,…))

Qi

它说明所研究现象相邻两个时期( 逐期 ) 发展变化的程度。
由上式可知,定基发展速度时间序列中,各时期比较的基础固定在一个共同的水平(加 )
上; 环比发展速度时间序列则呈现各时期发展水平交替作为报告期与基期使用的循环对比状
态。两者虽有区别,但也存在着一定的数量依存关系。
第一,定基发展速度等于相应时期内各环比发展速度的连乘积。
思-禾、筷 入

X ,… X
yo yo 入 Jn-1

240 经济基础知误 (中级)

第二,两个相邻时期定基发展速度的比率等于相应时期的环比发展速度。
思

Jo
实际工作中,经常利用上述关系式对发展速度指标进行推算或换算。

  1. 增长速度。增长速度是报告期增长量与基期水平的比值,表明报告期水平比基期增长

(或降低 )了若干倍( 或百分之几 )。 计算公式为:
增长量
境长速度= 全有水下
由于基期选择的不同 ,增长速度也有定基与环比之分。上述计算公式中,若增长量为累计
增长量, 生生 用4表示,就有:
二yo

Jo0
若增长量为逐期增长量,则计算的是环比增长速度,用肪表示,就有:

有=一Ji -5 -1 (012
Ji-1

发展速度与增长速度是对社会经济现象进行动态分析的基本指标,应用中要注意的问题
是:定基增长速度与环比增长速度不能像定基发展速度与环比发展速度那样互相推算 ,因为定
基增长速度不等于相应时期内各环比增长速度的连乘积; 两个相邻时期定基增长速度的比率
也不等于相应时期的环比增长速度。定基增长速度与环比增长速度之间的推算 ,必须通过定
基发展速度和环比发展速度才能进行。

( 二 )平均发展速度与平均增长速度

平均发展速度和平均增长速度是两个非常重要的平均速度指标。前者反映现象在一定时
期内逐期发展变化的一般程度,后者则反映现象在一定时期内逐期增长( 降低 )变化的一般程
度。因此,这两个指标在国民经济管理和统计分析中有广泛的应用,是编制和检查计划的重要
依据,还可以用于一个国家或地区不同阶段发展状况的比较,以及同一时期不同国家或地区发

就计算方法来说,重点是平均发展速度指标。因为平均增长速度既不能由各期的环比增
长速度求得,也不能根据一定时期的总增长速度计算 ,平均增长速度是通过它与平均发展速度
之间的数量关系求得的:

二= =a -1 (=12

平均增长速度 = 平均发展速度 -1
由于平均发展速度是一定时期内各期环比发展速度的序时平均数,各时期对比的基础不
同,所以不能采用一般序时平均数的计算方法。目前,计算平均发展速度通常采用几何平均
法,几何平均法也称水平法。采用这一方法的原理是,一定时期内现象发展的总速度等于各期
环比发展速度的连乘积。根据平均数的计算原理,应当按连乘法,即几何平均数公式计算各指
标值的平均数。

卫=半x卫xx二xx太x: “xb=了5

yo Jo 妨 Jn-1 =1
式中,IT为连乘号,上 为环比发展速度,m 为环比发展速度的时期数,则:

第二十毛章“时间序列分析 “2471,

5- JI 考 天
式中,5为平均发展吉度。

上述两式都是平均发展速度几何平均法的计算公式,可以根据资料的掌握情况选择应用。

( 三 )速度的分析与应用

在应用速度分析实际问题时 ,须防止误用乃至滥用的现象,应注意:

  1. 当时间序列中的指标值出现 0 或负数时,不宜计算速度。例如,假定某企业连续 5 年的

利润额分别为 5 万元,2 万元,0, -3 万元,2 万元,对这一序列计算速度,要么不符合数学公理,
要么无法解释其实际意义。在这种情况下 ,适宜直接用绝对数进行分析。

  1. 速度指标的数值与基数的大小有密切关系。在环比增长速度时间序列中,各期的基数

不同,因此,运用这一指标反映现象增长的快慢时,往往要结合水平指标的分析才能得出正确
结论-“增长 19 的绝对值” 是进行这一分析的指标。它反映同样的增长速度 ,在不同时间条
件下所包含的绝对水平。计算公式为:

增长 1% 的绝对值 =

逐期增长量

环比增长速度

用符号表示为:

曙 yo Ia
增长 1% 的绝对值 = FE =100

100

环比增长速度是相对数,一般用百分数表示。上式推导中分母指标乘以 100,就将它还原
为绝对数,这样才能与分子指标对比计算。

例如,某市 2018一2024 年能源生产量列于表 27-5 ,根据这些资料计算的发展速度.增长

速度及增长 19 的绝对值也列于该表中。

表 27-5 某市 2018一2024 年能源生产量及速度指标
年份 2018 2019 2020 2021 2022 2023 2024
发展水平
的 99.38 152.31 160 149.79 | 19077 | 187.57 191.3
(万吨标准煤 )
、 定 100 153.26 150.72 | 191.96 | 188.74 | 192.49
发展速度
(% )
环比 一 153.26 127.36 | 98.32 | 101.99
一 53.26 61.00 50.72 91.96 88.74 92.49
增长速度 人
人 环比 一 53.26 5.05 -6.38 27.36 -1.68 1.99
增长 19 的绝对值
_ 一 0.99 1.52 1.60 1.50 1.91 1.88
(万吨标准煤 )

(1 ) 由表中资料可以验证定基发展速度与环比发展速度之间的数量依存关系。
192.499%6=153.2696 x 105.0596 x 93.6295 x 127.3695 x 98.3296 x 101.9996

“242 , 经济基础知识 (中级)

即 2024 年与 2018 年的定基发展速度等于这一时期各年环比发展速度的乘积。又如;
101.9996=192.49% 188.74%
即 2024 年与 2023 年的环比发展速度等于这两年定基发展速度的比率。

(2 )由表中资料可以看到, 2022 年能源生产量的环比增长速度是 27.36% ,大于 2024 年的
1.999% ,但是 2022 年能源生产量每增加 1% 的生产绝对量为 1.50 万吨标准煤,却低于 2024 年
的 1.88 万吨标准煤,可见, 2024 年该市的能源发展水平并不比 2022 年差,反而更好。

〈3 )用几何平均法计算该市 2018一2024 年能源生产量平均发展速度和平均增长速度。

5= | II 六 = V153.26%X105.05驳X93.6795X177.36% 又98.37%X1019970 = 192.509%6
=1

一111.33%

严 6
或 万= 鱼=- /213 -9T9545 ~ 111.53%
太一/9938

平均增长速度 =5 -1=111.53% - 1 = 11.53%

山

四,时间序列的分解和预测程序

时间序列的变化可能受一种或几种因素的影响,这种因素称为时间序列的成分。时间序
列的成分通常有长期趋势(T入季节变动( S)循环波动( C ) 和不规则波动( IT)等四种。

长期趋势CT )是时间序列在较长一段时间内呈现的持续上升或持续下降的变动。这种趋
势可能是线性的,也可能是非线性的。

季节变动($ )是时间序列在一年内重复出现的周期性波动。例如,旅游.商品销售 .农业
生产 ,交通运输等行业的生产经营中都有明显的季节变动特征。

循环波动( C )是时间序列呈现出的非固定长度的周期性变动。例如,经济周期有涨落相
间的交替波动,周期长短不一,无固定规律。

不规则波动(I)是时间序列中除去长期趋势.季节变动和循环波动之后的随机波动。不
规则波动往往是由一些偶然因素引起的,难以预测和控制,因此在时间序列预测中通常不子单

一个时间序列可能只包含一种成分,也可能是由几种成分混合而成的( 见图 27-1 )。时间
序列分析时经常在一定的模型假定下把这些成分从时间序列里分离出来,对各成分分别进行
分析。不同的模型中对四种成分之间的关系假定不同 ,如加法模型中假定也=T+S+CA+H1,乘法
模型中假定忒=T, x 3 x C,x1s

时间序列分析的一个主要目的就是根据历史数据对未来进行预测。时间序列的预测通常
包括以下几个步又:

第一步: 确定时间序列所包含的成分;

第二步: 找出适合该时间序列的预测方法;

第三步: 对可能的预测方法进行评估,以确定最佳预测方案;

第四步: 利用最佳预测方案进行预测 。

第二十毛章 “时间序列分析 ,243

700 600
600] 500]
500]
|
油 400]| 钢
关 300]j
300
200
200
100
INRRRRNRSRNTPY SNKRRRSRNRSRNRDPY
SRSRSRSRSRSRSNYSRSDSYCSSY SENRYSRSRSRSYSRSYSRSSSY
个人人个个下个个个个个 人人个个个个
a) b)
1.4 1.06
1.3]] 1.04]
1.2] 10
中 11] 同
四 才 加
当 10 倒 L00
号
四 0.9 必 098
0.8] 0.96
0.7]
0.94
天生生二下下下SR NOkaeASSavdpay
NANANANRNRNANANRSRDSYAAAS NAN
个个信人人人下个个个个下个个个 少个个人人个人个个个人个个个少
C

图 27-1 含有不同成分的时间序列
a ) 有趋势的时间序列图 b )有趋势和季节性的时间序列图
c )有周期变动的时间序列图 d )不规则波动的时间序列图

五、平滑预测法

平滑法的目的就是“消除”时间序列的不规则成分所引起的随机波动,所以被称为平滑
法,包括移动平均法和指数平滑法等。平滑法适用于平稳时间序列的预测,即没有明显的趋
势.循环和季节波动的时间序列。平滑法简单易用,对数据的要求最低,通常对于近期(如下
一期 ) 的预测具有较高的精度。

( 一 )移动平均法

移动平均法使用时间数列中最近上期数据值的平均数作为下一期的预测值,其计算公式

了 =- 也-hi二+也-taT 十闷十了
天

式中, 为对时间序列的也预测结果 ,为移动间隔(1 一大一上)。

对于 i+1!1 期的简单移动平均预测值为:
了 卫-i+了-ta+ 十世 +了
RE二 和

例如,根据表 27-6 中 2007一2025 年某国居民消费价格指数数据,应用移动平均法,选取

244 , 经济基础知识(中级)

移动间隔 i=3,计算各期居民消费价格指数的预测值,并对 2026 年居民消费价格指数进行预

测。
表 27-6 应用移动平均法预测居民消费价格指数
年份 居民消费价格指数 3 期移动平均预测值 预测误差
2007 101.8 一 至
2008 101.5 一 一
2009 104.8 一 一
2010 105.9 -3.2
2011 99.3 104.1 4.8
2012 103.3 10343 0.0
2013 105.4 102.8 -2.6
2014 102.6 102.7 041
2015 102.6 103.8 1.2
2016 102 103.5 1.5
2017 101.4 102.4 1.0
2018 102 102.0 0.0
2019 101.6 101.8 02
2020 102.1 101.7 -04
2021 102.9 101.9 -10
2022 102.5 102.2 -03
2023 100.9 102.5 1.6
2024 102 102.1 041
2025 100.2 101.8 1.6
2026 一 到

以3 项移动平均(ji=3 )为例,表 27-6 中的 102.7 就是2007年.2008年和2009年3年的
平均值,用来作为 2010 年的预测值。同样地, 101.0 就是 2023 年.2024 年和 2025 年 3 年的平
均值,用来作为 2026 年的预测值。

( 二 )指数平滑法

指数平滑法是利用过去时间序列值的加权平均数作为预测值,即使得第 t+l 期的预测
值等于第:期的实际观察值与第;期预测值的加权平均值。这种方法的特点是,观测值离
预测时期越久远,其权重也变得越小,呈现出指数下降,因而称为指数平滑。其基本计算公

第二十毛章“时间序列分析 245,

玉=ay+(1-a )忆

式中, Pi 和瓦分别为第 1 期和第:期的指数平滑预测值;也 为第 : 期的实际观察值; w 为平
滑系数( 即权重 ),取值范围为0< ac < 1。

由于在开始计算时,没有第 1 期的预测值 玉,一般可以设 太 为第 1 期的实际观察值,即
局=闷,则第 2 期的预测值为:

矶=a8+(1-a)有=a+(C1-a )态=蕊

第 3 期的预测值为:

下=aJD+(1-a )忆=awJ+(C1-a )蕊

第 4 期的预测值为:

尺=ayJ+(1-a)太=aZ+(l-a )aJ+(1-a ) 了

表 27-7 还是利用 2007一2025 年某国居民消费价格指数数据,应用指数平滑法 ,选取平
滑系数 w“=0.8,计算各期居民消费价格指数的预测值,并对 2026 年居民消费价格指数进行预

测。
表27_7 应用指数平滑法预测居民消费价格指数
年从 居民消费价格指数 消烙消枯和人 预测误差
2007 101.8 Po Se
2008 101.5 101.8 0.3
2009 104.8 101.6 -3.2
2010 105.9 104.2 一1.7
2011 99.3 105.6 6.3
2012 103.3 100.6 一2.7
2013 105.4 102.8 -2.6
2014 102.6 104.9 2.3
2015 102.6 103.1 0.5
2016 102 102.7 0.7
2017 101.4 102.1 0.7
2018 102 101.5 -0.5
2019 101.6 101.9 0.3
2020 102.1 101.7 -0.4
2021 102.9 102.0 -0.9
2022 102.5 102.7 0.2
2023 100.9 102.5 1.6

246 ”经济基础知误 (中级)
年从 居民消费价格指数 于 兴扣人 预测误差
2024 102 101.2 -0.8
2025 100.2 101.8 1.6
2026 一 100.5 一

表 27-7 是用w“=0.8 对各期居民消费价格指数进行指数平滑预测的结果,并给出了预测
误差和 2026 年的预测值:
Po6=08xZos+02xPos=08x1002+02x101.8=100.5


零基础复习卡(两版教材核验)

来源核验:主教材《2026经济基础知识中级原书有色差(371)》PDF 第247-257页;《经济基础知识(中级)-292》PDF 第194-199页(书内第186-191页)。

一句话先懂

时间序列就是把同一指标按时间排队:先看水平,再看增长,再识别趋势、季节、循环和随机波动,最后做短期预测。

零基础解释

  1. 三类序列:绝对数序列记录规模,又分时期序列和时点序列;相对数序列记录比率;平均数序列记录平均水平。
  2. 时期与时点:时期指标可累加,如全年产量;时点指标是某一瞬间存量,通常不能直接累加,如年末人口、月末存款。
  3. 增长量:逐期增长量=`报告期-前一期`;累计增长量=`报告期-固定基期`;相应累计增长量等于各逐期增长量之和。
  4. 速度:发展速度=`报告期水平/基期水平`;增长速度=`发展速度-1`。定基速度以固定期为基期,环比速度以前一期为基期。
  5. 平均速度:平均发展速度采用几何平均;平均增长速度=`平均发展速度-1`,不能直接把各期增长速度算术平均。
  6. 序列成分:长期趋势T、季节变动S、循环波动C、不规则波动I。
  7. 平滑预测:移动平均用最近若干期的平均预测下一期;指数平滑给近期数据更大权重,`α`越大越重视最新实际值。

必背清单

  • 时期序列各期数值可相加,大小受时期长短影响。
  • 时点序列各期数值通常不可相加,大小与时间间隔长短无直接关系。
  • 定基发展速度等于相应环比发展速度连乘积。
  • 平均增长量=`累计增长量/逐期增长量个数`。
  • 增长1%的绝对值=`前期水平/100`,用来防止“速度快但增量小”的错觉。
  • 指标值出现0或负数时,不宜计算速度。
  • 平滑法适合没有明显趋势、循环和季节波动的平稳序列,通常用于近期预测。

易混点

  • 发展速度与增长速度差1:发展速度120%,增长速度20%。
  • 平均增长速度不能平均各增长率,先算几何平均发展速度再减1。
  • 季节变动是一年内重复;循环波动周期长度不固定,常跨多年。
  • α越大越灵敏,预测更追随最新数据;α越小越平滑。

记忆口诀

  • “时期开一段能相加,时点截一刻不相加”。
  • “定比固、环比前;发展除,增长减;平均速度几何连”。
  • 四成分:“趋季循随”(趋势、季节、循环、随机)。

自测题

  1. 单选:年末银行存款余额形成的时间序列属于( )。A时期绝对数 B时点绝对数 C相对数 D平均数

答案:B。 余额反映特定时点的存量。

  1. 计算:某指标由100增至120,发展速度和增长速度分别是多少?

答案:120%、20%。 `120/100=120%`,再减1得20%。

  1. 判断:三年增长速度分别10%、20%、30%,平均增长速度一定等于20%。

答案:错。 应计算几何平均发展速度后减1。

  1. 单选:每年春节前后重复出现的客运高峰属于( )。A长期趋势 B季节变动 C循环波动 D完全随机

答案:B。 在一年内按季节或日历重复。

  1. 判断:指数平滑系数α越大,最新实际值对下一期预测的影响越大。

答案:对。 α表示本期实际值的权重。

  1. 简答:为什么还要看“增长1%的绝对值”?

答案: 增长速度受基数影响,同样1%的增长在不同基数下对应的绝对增量不同;该指标把速度与规模联系起来。

6刷题(章节配套练习,含校订与教学改编)

先做后看答案。单选点一下就判,多选选完点「核对答案」。错题自动进错题本,二轮会回来重做。

1. 单项选择题
将某一统计指标在各个不同时间上的数值按时间先后顺序编制形成的 序列是()。
A. 指数序列B. 静态序列C. 时间序列D. 发展水平
答案 C 本题考查时间序列的概念。时间序列也称动态数列,是将某一统计指标在各个不同 时间上的数值按时间先后顺序编制形成的序列。
2. 单项选择题
以下关于时间序列的说法,错误的是()。
A. 对存在周期变化的数据,采用时间序列模型进行描述是比较合适的B. 对随时间推移而逐渐增长或衰减的数据,采用时间序列模型进行描述比较合适C. 时间序列分析可在一定模型假设下分离趋势、季节等成分D. 无法利用时间序列模型进行预测
答案 D 时间序列模型的一个重要应用就是对时序数据进行预测。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

3. 单项选择题
“年底总人口数”指标的时间序列属于()。
A. 时点序列B. 平均数时间序列C. 相对数时间序列D. 时期序列
答案 A 时间序列按照其构成要素中统计指标值的表现形式,分绝对数时间序列、相对数 时间序列、平均数时间序列三种类型。依据指标值的时间特点,绝对数时间序列又分为时期序 列和时点序列。其中,时点序列是指每一指标值反映现象在一定时点上的瞬间水平,如年底总 人口数是说明在各年年末这一时点上的人口数。
4. 单项选择题
每一个指标值反映经济现象在一段时间内发展的结果,指的是()。
A. 时点序列B. 平均数时间序列C. 相对数时间序列D. 时期序列
答案 D 时期序列是指每一个指标值反映现象在一段时间内发展的结果,即“过程总量”。
5. 单项选择题
将各年全年商品房销售面积按年份依次排列,该时间序列属于()。
A. 平均数时间序列B. 相对数时间序列C. 时期序列D. 时点序列
答案 C 全年商品房销售面积反映一定时期成交面积的过程总量,属于时期序列,选C。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

6. 单项选择题
将某国各年年末私营单位就业人数按年份依次排列,该序列属于()。
A. 平均数时间序列B. 相对数时间序列C. 时期序列D. 时点序列
答案 D 年末就业人数反映特定时点的存量水平,属于时点序列,故选D。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

7. 单项选择题
“进出口总额”指标的时间序列属于()。
A. 平均数时间序列B. 相对数时间序列C. 时期序列D. 时点序列
答案 C 时间序列按照其构成要素中统计指标值的表现形式,分为绝对数时间序列、相对数 时间序列和平均数时间序列三种类型。绝对数时间序列是由绝对数指标值按时间先后顺序排 列后形成的序列。根据指标值的时间特点,绝对数时间序列又分为时期序列和时点序列。时 期序列中,每一指标值反映现象在一段时期内发展的结果,即“过程总量”
8. 单项选择题
“城镇人口比重”指标的时间序列属于()。
A. 时点序列B. 平均数时间序列C. 相对数时间序列D. 时期序列
答案 C 由绝对数时间序列可以派生出相对数和平均数时间序列。它们是由同类相对数或 平均数指标按时间先后顺序排列后形成的序列。城镇人口比重是相对数时间序列。
9. 单项选择题
2019—2025年期间,某国制造业城镇单位就业人员平均工资的时间序列 如下: 年份 2019年2020年2021年2022年2023年2024年2025年 制造业城镇单位就业人员平均工资(元) 36665 41650 46431 51369 55324 59470 64452 按照时间序列的分类,该时间序列属于()。
A. 时期序列B. 时点序列C. 相对数时间序列D. 平均数时间序列
答案 D 平均数时间序列是平均数指标值按时间先后顺序排列后形成的序列。
10. 多项选择题
按构成要素中统计指标值的表现形式,时间序列可以分为( )。
A. 平均数时间序列B. 发展水平C. 绝对数时间序列D. 相对数时间序列E. 发展速度
答案 ACD 时间序列按构成要素中统计指标值的表现形式分为:绝对数时间序列、相对数 时间序列、平均数时间序列。
11. 单项选择题
某超市2025年9月电视的库存量记录见下表。 日期 1-9日 10—15日 16-27日 28—30日 库存量(台) 50 60 40 50 该商品9月份的平均日库存量是()台。
A. 40B. 45C. 48D. 50
答案 C 按库存保持的天数加权,9月平均库存量=(50×9+60×6+40×12+50×3)/30=48,选C。
12. 单项选择题
某企业本年度前四个月的生产情况见下表。 月份 1月 2月 3月 4月 产值(万元) 44 50 58 64 该企业1月至4月的平均产值为()万元。
A. 44B. 54C. 59D. 66
答案 B 这是时期序列,平均值=(44+50+58+64)/4=54,选B。
13. 单项选择题
某企业3月31日、4月30日、5月31日、6月30日职工人数分别为1400、1500、1460、1420人。按月等间隔时点序列的两次平均法,第二季度平均职工人数约为()。
A. 1410B. 1445C. 1457D. 1460
答案 C 3月31日为第二季度期初时点。第二季度平均职工人数=(1400/2+1500+1460+1420/2)/3≈1457人,选C。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

14. 单项选择题
某行业2017年末、2020年末、2022年末、2025年末职工人数依次为1000、1200、1600、1400万人。按不等间隔时点序列两次平均法,2017年末至2025年末这8年间的平均职工人数为()万人。
A. 1200B. 1300C. 1325D. 1400
答案 C 各段平均为1100、1400、1500,间隔为3、2、3年;加权平均=(1100×3+1400×2+1500×3)/8=1325,选C。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

15. 单项选择题
某时点时间序列是每隔一定时间登记一次数据,且每次登记的间隔不相 等,计算其序时平均数应采用的方法是( )。
A. 简单算术平均数方法B. 加权算术平均数方法C. 先求各个时间间隔内的平均数,再对这些平均数进行加权算术平均D. 几何平均法
答案 C 间隔相等的间断时点序列序时平均数的计算思路是“两次平均”:先求各个时间间 隔内的平均数,再对这些平均数进行简单算术平均。间隔不相等的间断时点序列序时平均数 的计算也采用“两次平均”的思路,且第一次的平均计算与间隔相等的间断序列相同;进行第 二次平均时,由于各间隔不相等,所以应当用间隔长度作为权数,计算加权算术平均数。
16. 多项选择题
下列关于平均发展水平计算的说法,正确的有()。
A. 平均发展水平也称为序时平均数B. 时点序列和时期序列平均发展水平的计算方法不同C. 连续时点序列和间断时点序列平均发展水平计算方法相同D. 间断时点序列平均发展水平的计算采用“两次平均”的思路E. 相对数时间序列的平均发展水平可就序列中的相对数直接进行平均计算
答案 ABD 连续时点序列和间断时点序列的类型不同,计算序时平均数的方法也有所不同, 选项C错误。相对数或平均数时间序列的序时平均数,不能就序列中的相对数或平均数直接 进行平均计算,而必须分别求出分子指标和分母指标时间序列的序时平均数,然后再进行对 比,选项E错误。
17. 多项选择题
下列时间序列分析指标中,适用于水平分析的有()。
A. 增长量B. 平均发展水平C. 发展水平D. 平均增长速度E. 平均增长量
答案 ABCE 时间序列的水平分析指标包括:发展水平、平均发展水平、增长量与平均增长量。
18. 单项选择题
在同一时间序列中,累计增长量与相应时期逐期增长量之间的数量关系 是()。
A. 累计增长量等于相应时期逐期增长量的加权平均数B. 累计增长量等于相应时期逐期增长量之积C. 累计增长量等于相应时期逐期增长量之和除以逐期增长量个数D. 累计增长量等于相应时期逐期增长量之和
答案 D 根据基期的不同确定方法,增长量可以分为逐期增长量和累计增长量。累计增长 量等于相应时期逐期增长量之和。
19. 单项选择题
时间序列中逐期增长量的序时平均数是()。
A. 逐期增长量B. 累计增长量C. 平均增长量D. 平均增长速度
答案 C 平均增长量是逐期增长量的序时平均数。
20. 单项选择题
在对时间序列进行分析计算时,可将增长量分为逐期增长量与累计增长 量,两者的区别是()。
A. 适用的时间序列类型不同B. 计量单位不同C. 基期确定方法不同D. 报告期确定方法不同
答案 C 根据基期的不同确定方法,增长量分为逐期增长量与累计增长量。逐期增长量是报 告期水平与前一期水平之差;累计增长量是报告期水平与某一固定时期水平(通常是时间序 列最初水平)之差。
21. 多项选择题
根据基期的不同确定方法,增长量可分为()。
A. 逐期增长量B. 平均增长量C. 累计增长量D. 定基发展速度E. 环比发展速度
答案 AC 根据基期的不同确定方法,增长量可分为逐期增长量和累计增长量。
22. 多项选择题
下列关于增长量的说法,正确的有()。
A. 增长量是报告期发展水平与基期发展水平之差B. 累计增长量是报告期水平与某一固定时期水平之差C. 逐期增长量是报告期水平与前一期水平之差D. 同一时间序列中,累计增长量等于相应时期内逐期增长量的乘积E. 平均增长量是时间序列中逐期增长量的序时平均数
答案 ABCE 同一时间序列中,累计增长量等于相应时期逐期增长量之和,选项D错误。
23. 单项选择题
在时间序列分析中,两个相邻时期定基发展速度的比率等于相应时期的 ()。
A. 定基增长速度B. 逐期增长量C. 定基发展速度D. 环比发展速度
答案 D 两个相邻时期定基发展速度的比率等于相应时期的环比发展速度。
24. 单项选择题
在时间序列分析中,报告期水平与前一期水平的比值是( )。
A. 环比发展速度B. 累计增长量C. 逐期增长量D. 环比增长速度
答案 A 环比发展速度=报告期水平/前一期水平,故选A。
25. 单项选择题
某国2019—2025 年期间全国财政支出的时间序列如下: 年份 2019年 2020年 2021年 2022年 2023年 2024年 2025年 全国财政支出(亿元) 109247.8 125953 140212.1 151785.6 175877.8 187755.2 203085.5 则2025年与2024年的环比发展速度为()。
A. 108.17%B. 92.45%C. 8.17%D. 8.55%
答案 A 2025年环比发展速度=203085.5/187755.2×100%≈108.17%,选A。
26. 单项选择题
在时间序列的速度分析中,增长速度可以表示为( )。
A. 报告期增长量与基期水平的差B. 发展水平之比C. 报告期增长量与基期水平的比值D. 发展速度+1
答案 C 增长速度是报告期增长量与基期水平的比值。
27. 单项选择题
已知某地区近三年社会消费品零售总额的环比增长速度分别为4%、 6%、9%,则这一时期该地区社会消费品零售总额的定基增长速度为()。
A. 4%×6%×9%B. (4% ×6%×9%)+1C. (104% × 106% × 109%)-1D. 104% × 106% × 109%
答案 C 定基增长速度=(104%× 106% ×109%)-1。
28. 单项选择题
两个相邻时期定基发展速度的比率等于相应时期的()。
A. 环比发展速度B. 环比增长速度C. 定基发展速度D. 定基增长速度
答案 A 两个相邻时期定基发展速度的比率等于相应时期的环比发展速度。
29. 单项选择题
以2019年为基期,2024年和 2025年某国粮食总产量定基增长速度分别 为14.40%和14.85%。则2025年对2024年的环比发展速度为()。
A. 0.39%B. 14.63%C. 100.39%D. 114.63%
答案 C 2025年环比发展速度=(1+14.85%)/(1+14.40%)×100%≈100.39%,选C。
30. 单项选择题
某家庭在2017年的收入为10万元,2025年的收入为36万元,以2017 年为基期,则这个家庭收入的平均发展速度是()。
A. 102%B. 106%C. 115%D. 117%
答案 D 2017年至2025年共8个年度间隔。平均发展速度=(36/10)^(1/8)×100%≈117.36%,最接近117%,选D。
31. 单项选择题
某企业2019-2025年销售收入的年平均增长速度是27.6%,这期间相应 的年平均发展速度是( )。
A. 4.6%B. 17.6%C. 72.4%D. 127.6%
答案 D 本题考查平均发展速度与平均增长速度。平均发展速度=平均增长速度+1。
32. 多项选择题
时间序列的速度分析指标有()。
A. 发展速度B. 发展水平C. 平均增长速度D. 平均增长量E. 增长速度
答案 ACE 时间序列的速度分析指标有发展速度和增长速度,平均发展速度和平均增长速度。
33. 单项选择题
前期水平为正、环比增长速度非零且以小数表示时,“增长1%的绝对值”的计算公式为()。
A. 逐期增长量/(环比增长速度×100)B. 环比增长速度/逐期增长量C. 逐期增长量/环比发展速度-1D. 环比发展速度/逐期增长量-1
答案 A 环比增长速度以小数表示时,增长1%的绝对值=逐期增长量/(环比增长速度×100)=前期水平/100。也可写为逐期增长量除以环比增长速度百分数的分子,选A。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

34. 单项选择题
某地城镇固定资产投资2024年为631684亿元,2025年为635636亿元, 则 2025年城镇固定资产投资的增长1%绝对值为()亿元。
A. 6316.84B. 6356.36C. 631684D. 635636
答案 A 增长1%的绝对值=前期水平/100=631684/100=6316.84亿元,选A。
35. 多项选择题
在对时间序列及发展速度分析时,应注意的事项有()。
A. 不宜采用几何平均法计算平均发展速度B. 不需要结合水平指标进行分析C. 速度指标数值与基数大小有密切关系D. 时间序列指标值出现负数时不宜计算速度E. 时间序列指标值出现0时不宜计算速度
答案 CDE 速度分析应注意的问题包括:①当时间序列中的指标值出现0或负数时,不宜计 算速度;②速度指标的数值与基数的大小有密切关系。
36. 多项选择题
关于时间序列速度分析的说法,正确的有()。
A. 发展速度有定基与环比之分B. 增长速度是报告期增长量与基期水平的比值C. 当时间序列的指标值出现0或负数时,不宜计算速度D. 平均发展速度的计算经常使用几何平均法E. 平均增长速度可以根据一定时期的总增长速度进行简单平均计算
答案 ABCD 平均增长速度=平均发展速度-1,选项E错误。
37. 单项选择题
时间序列在较长一段时间内呈现的持续上升或持续下降的变动,称为 ()。
A. 长期趋势B. 季节变动C. 循环波动D. 不规则波动
答案 A 时间序列的成分通常有四种:长期趋势(T)、季节变动(S)、循环波动(C)和不规则 波动(I)。其中,长期趋势是时间序列在较长一段时间内呈现的持续上升或持续下降的变动。 这种趋势可能是线性的,也可能是非线性的。
38. 多项选择题
时间序列的成分通常有()。
A. 长期趋势B. 季节变动C. 循环波动D. 不规则波动E. 均匀波动
答案 ABCD 时间序列的成分通常有长期趋势、季节变动、循环波动和不规则波动等四种。
39. 单项选择题
如果以Yₜ表示第t期实际观测值,Fₜ表示第t期指数平滑预测值,α表示平滑系数,则指数平滑预测值的计算公式是( )。
A. Fₜ₊₁=αFₜ+(1-α)Yₜ₊₁B. Fₜ₊₁=αYₜ+(1-α)FₜC. Fₜ₊₁=α(Fₜ+Yₜ)D. Fₜ₊₁=αFₜ
答案 B 指数平滑法将过去时间序列值的加权平均数作为预测值。t+1期的预测值等于第t期实际观测值与第t期预测值的加权平均数:Fₜ₊₁=αYₜ+(1-α)Fₜ,所以选B。

校勘说明:按《经济基础知识(中级)章节同步习题集-304.pdf》原PDF第216页题面、第219页答案复核修正;保留原题答案。

40. 单项选择题
某公司2020—2024年主要产品销售额(单位:百万元)分别为:114、 115、121、120和 116,选取移动间隔h=3,用移动平均法预测2025年该公司的主要产品销售 额,则预测值是()。
A. 117B. 118C. 119D. 115
答案 C 移动间隔h=3,取2022—2024年最近3项平均:(121+120+116)/3=119百万元,选C。
41. 多项选择题
关于用于无明显趋势、无明显季节性序列的简单平滑预测方法,下列说法正确的有()。
A. 目的是减弱不规则成分引起的随机波动B. 包括简单移动平均法和一次指数平滑法C. 不经扩展或处理即可充分刻画明显趋势和季节波动D. 操作必然复杂且数据要求高E. 常用于近期预测,实际精度仍需通过预测误差检验
答案 ABE 本题限定简单平滑方法:通过平均或递减权重减弱随机扰动,操作较简,常用于短期预测;存在趋势季节时需扩展模型或预先处理,任何方法均不保证短期一定高精度。选ABE。

校勘说明:为明确期间、计算口径或预测方法适用条件所作的校订后教学题设,不冒充原题原文。

7本章打卡

做完一项勾一项,当天页会自动更新整体进度。

学完这章就是往前走了一步。记不住的,明天再来看必背,不用今天全记住。

↑ 回到今日顶部