1重点一览
先花 2 分钟看清这章有几个考点、哪几个是必考,心里有数再读书。
2教材标色 + 三色笔记
左边是教材原文,彩色句子就是《考点速记》收了的内容,颜色是星级。右边是速记的考点表,和左边的小节对齐。读一节,看一眼右边的表,再往下走。
一、抽样调查基本概念
(一)基本概念
抽样调查是使用频率最高的一种调查方式。它是指按照某种原则和程序,从总体中抽取一部分单位,通过对这一部分单位进行调查得到信息,以达到对总体情况的了解,或者对总体的有关参数进行估计。下面先介绍几个基本概念。
1. 总体与样本。总体即调查对象的全体。例如,欲对北京市的个体商业进行抽样调查,则北京市所有的个体商业单位就构成一个总体。如果要研究某公司所有注册在职人员的工资状况,总体就是该公司所有注册在职员工。在一项具体的调查项目中,调查总体必须是明确的而不能是模糊的。
样本是总体的一部分,它由从总体中按一定原则或程序抽出的部分个体所组成。因此,与总体一样,样本也是一个集合。每个被抽中进入样本的单位称为入样单位。样本中包含的入样单位的个数称为样本量。抽样调查中调查的具体实施是针对样本而言的。
2. 总体参数与样本统计量。总体参数是我们所关心变量的数字特征,它是根据总体中所有单位的数值计算的。例如,在对北京市个体商业进行的调查中,北京市个体商业的年零售总额就是一个总体参数。也可以说总体参数就是总体指标值,它是未知的常数,是我们通过调查想要了解的,不受样本的抽选结果影响。常用的总体参数有总体总量、总体均值、总体比例、总体方差等。例如,某公司所有注册在职人员的平均工资,某城市拥有两套以上住房的人口比例等。
样本统计量是根据样本中各单位的数值计算的,是对总体参数的估计,因此也称为估计量。样本统计量是一个随机变量,它取决于样本设计和正好被选入样本的单元特定组合。例如,用样本中员工的平均工资来估计该公司所有注册在职人员的平均工资,这里,样本中员工的平均工资是该公司所有员工平均工资的一个估计量。常用的样本统计量有样本均值、样本比例、样本方差等。
3. 抽样框。抽样框是供抽样所用的所有抽样单元的名单,是抽样总体的具体表现。在抽样框中,可以对每个单位编上一个号码,由此可以按一定随机化程序进行抽样。在抽样后,调查人员也可以根据抽样框上所提供的信息找到被选中的入样单位,从而实施调查。
抽样框可以有多种形式,常用的有名录框,如企业名录、电话号码簿、人员名册等。抽样框也可以是一张地图或其他适当形式。但不管什么形式,抽样框中的单位必须是有序的,便于编号。高质量的抽样框应当提供被调查单位更多的信息,并且没有重复和遗漏。
(二)概率抽样与非概率抽样
根据抽取样本方法的不同,可以将抽样分为概率抽样和非概率抽样两类。
概率抽样也称随机抽样,是指依据随机原则,按照某种事先设计的程序,从总体中抽取部分单元的方法。概率抽样具有以下特点:①按一定的概率以随机原则抽取样本。所谓随机原则,就是在抽取样本时排除主观上有意识地抽取调查单元的情况,使每个单元都有一定的机会
被抽中。②总体中每个单元被抽中的概率是已知的,或者是可以计算出来的。③当采用样本对总体参数进行估计时,要考虑到每个样本单元被抽中的概率。也就是说,估计量不仅与对样本单元的观测有关,也与样本单元被选入样本的概率有关。概率抽样中,如果每个单位被抽入样本的概率相等,则称这种抽样方法为等概率抽样;如果每个单位被抽入样本的概率不同,则称为不等概率抽样。无论等概率或不等概率抽样,抽取时都要通过一定的随机化程序来实现。
非概率抽样又称为非随机抽样,是调查者根据自己的方便或主观判断抽取样本的方法,其最主要的特征是抽取样本时并不是依据随机原则。这类抽样有许多不同的具体抽取样本的方法,下面列举一些主要的方法:①判断抽样。这是指在抽取样本时,调查人员依据调查目的和对调查对象情况的了解,人为确定样本单元。例如,选择“平均型”单元作为样本,选定的样本可以代表所研究变量的平均水平。②方便抽样。这是指在抽取样本时,依据方便原则,以达到最大限度降低调查成本的目的。比如“拦截式”调查,在街边或居民小区拦住行人进行调查。③自愿样本。这是指不是经过抽取,而是由自愿接受调查的单元所组成的样本。比较典型的是网上调查。④配额抽样。这是指将总体中的各单元按一定标准划分为若干类型,将样本数额分配到各类型中,从各类型中抽取样本的方法则没有严格限制,一般采用方便抽样的方法抽取样本单元。
(三)抽样调查的一般步骤
一般而言,一个完整的抽样调查过程需要以下几个步骤。
1. 确定调查问题。确定调查问题所要回答的是“要做什么样的调查研究”和“为什么要做这项调查研究”。在这个过程中需要明确地定义问题,包括对整个问题的叙述以及确定研究问题的具体组成部分。
2. 调查方案设计。这一阶段,要明确如何实施调查,主要包括抽样方案的设计和问卷设计。抽样方案描述如何抽取样本,问卷设计则将比较抽象的调研问题逐步细化,演变为现场调查中采访者询问的、比较具体的问题的工作过程。
3. 实施调查过程。在这个过程中要获得样本单元的调查数据,关键的问题是要保证原始数据的质量,这就需要对调查过程进行有效的管理和监控。在调查过程中,要有管理制度和措施,使得从事具体调查的人员有章可循,按章操作。
4. 数据处理分析。这个过程包括对调查获得的原始数据进行检查、核对,对验收合格的数据进行编码和录入,对录入的数据进行预处理,对数据进行统计分析,对总体参数进行估计等。
5. 撰写调查报告。调查报告是调查活动的最终成果,是前面劳动成果的展现。
(四)抽样调查中的误差
样本估计值和总体参数真值之间的差异称为误差。凡调查就一定有误差,误差或大或小总会存在,不可能完全避免。一般来说,调查中的误差可以分为抽样误差和非抽样误差两大类。
抽样误差是由于抽样的随机性造成的,用样本统计量估计总体参数时出现的误差。对任何抽样方案,都会存在许多待选样本,实际中抽到的只是其中一个样本。抽到哪一个样本完全是随机的,而抽到不同的样本,对总体的估计就会不同,这就是抽样误差产生的根本原因。
非抽样误差是指除抽样误差以外,由其他原因引起的样本统计量与总体真值之间的差异。非抽样误差产生的原因主要有以下三种。
1. 抽样框误差。例如,用市场监督管理局签发的营业执照作为个体商业的抽样框,对个体商业实施抽样调查,以掌握个体商业零售额的情况。但有些个体商贩是无照经营,这部分零售
额就会漏掉。有些人虽有营业执照,但已经转行,不再经商。用抽样框中的单位数对总体零售额进行推估,也会造成误差。有些人虽然只有一个摊点,却办理了多个营业执照,他入选样本的概率就是其他人的数倍,使得在设计入样概率基础上的估计结果失真。凡此种种都是由于抽样框不完善造成的,故称其为抽样框误差。
2. 无回答误差。现场调查中由于各种原因,调查人员没能从被调查者那里得到所需要的数据。例如,被调查者不在家,因病无法接受调查,拒绝接受调查等。可以把无回答分为两类:一类是由于随机因素造成的,如调查时被调查者恰巧不在家,这种无回答减少了有效样本量,会造成估计量方差增大;另一类无回答是非随机因素的影响,如被调查者不愿告诉实情而拒绝回答。第二类情况下,回答者与不回答者在调查指标上存在数量的差异,调查的结果中只有回答者的信息,却没有无回答者的信息。这类无回答不仅造成估计量方差增大,还会带来估计偏差。
3. 计量误差。计量误差是指由于调查所获得的数据与其真值之间不一致造成的误差。这种误差可能是由调查人员、问卷设计、受访者等原因造成的。例如,调查员在调查中有意无意地诱导被调查者,调查中的提问错误或记录答案错误,调查人员有意作弊,由于问卷的原因受访者对调查问题的理解上有偏误,受访者记忆不清,受访者提供虚假数字等。
二、几种基本概率抽样方法
概率抽样中有不同的抽样方法,下面简要介绍几种最基本的方法。
(一)简单随机抽样
简单随机抽样分为有放回简单随机抽样和不放回简单随机抽样两种方法。有放回简单随机抽样是指从总体中随机抽出一个样本单位,记录观测结果后,将其放回总体中去,再抽取第二个,以此类推,直到抽满 n 个单位为止。采用这种方法,单位有被重复抽中的可能。这种抽样方法容易造成信息重复而影响估计的效率,所以较少采用。不放回简单随机抽样是指从包含 N 个单元的总体中逐个随机地抽取单元并不放回,每次都在所有尚未被抽入样本的单元中等概率地抽取下一个单元,直到抽取 n 个单元为止。采用这种方法,每个单元最多只能被抽中一次,故不会由于样本单位被重复抽中而提供重复信息,所以比有放回抽样的抽样误差低。
简单随机抽样是最基本的随机抽样方法,操作简单,且每个单位的入样概率相同,因而样本估计量形式也比较简单。但是,简单随机抽样没有利用抽样框中更多的辅助信息,所以用样本统计量估计总体参数的效率受到影响。同时,在简单随机抽样条件下,样本的分布可能十分分散,这就增加了调查过程中的费用和时间。这种抽样方法的适用条件是:①抽样框中没有更多可以利用的辅助信息;②调查对象分布的范围不广阔;③个体之间的差异不是很大。
(二)分层抽样
分层抽样是指先按照某种规则把总体分为不同的层,然后在不同的层内独立、随机地抽取样本,这样所得到的样本称为分层样本。如果每层中的抽样都是简单随机抽样,则称为分层随机抽样。分层抽样的优点如下。①分层抽样不仅可以估计总体参数,同时也可以估计各层的参数。例如,按照行业将某市所有中小企业进行分层,进行就业人口的抽样调查,最终不仅能估计全市中小企业就业的相关指标,还可以在各行业进行推算。②便于抽样工作的组织。例如,某项全国范围的大型抽样调查,要编制全国范围的抽样框往往是一件非常困难的事,但如果按行政区划或行业分层后,可以调动各级主管部门的积极性,分头编制抽样框并实施抽样的组织和调查工作。此外,为了组织调查的方便,各层还可以根据层内的特点,分别采用不同的
抽样方法。③每层都要抽取一定的样本单位,这样样本在总体中分布比较均匀,可以降低抽样误差。例如,某部门共有 6 名员工,其中 3 名经理、3 名普通职员,现要估计该部门的平均工资。他们的年薪见表 25-1。
表 25-1 某部门员工年薪
| 编号 | 经理层(万元) | 普通职员层(万元) |
|---|---|---|
| 1 | 12 | 6 |
| 2 | 14 | 6 |
| 3 | 14 | 8 |
| 合计 | 40 | 20 |
虽然很容易算出总体均值 Ȳ = (40 + 20) ÷ 6 = 10(万元),仍用概率抽样方法随机抽取 2 人为样本,并用样本数据对总体均值进行估计。在简单随机抽样下,抽中年薪最少的 2 个人的样本均值为 ȳ1 = (6 + 6) ÷ 2 = 6(万元),年薪最多的 2 个人的样本均值为 ȳ2 = (14 + 14) ÷ 2 = 14(万元),显然与总体均值 10 万元相比误差都比较大。如果抽样前已经知道所有员工的职位信息,且知道不同职位的员工年薪有较大差异,则可以采用分层抽样,在经理层中抽一人,在普通职员层中抽一人,共同组成样本,这时样本最小的可能值为 ȳ1 = (12 + 6) ÷ 2 = 9(万元),最大的可能值为 ȳ2 = (14 + 8) ÷ 2 = 11(万元),显然分层抽样的估计值更集中在总体均值周围。
分层抽样中,样本量在各层中分配的方法可以归为两类:等比例分配和不等比例分配。等比例分配是指层中单位数越多,在该层中抽取的样本单位就越多,该层的样本单位比例与该层中的总体单位比例相一致,即 nh ÷ n = Nh ÷ N。这里,n 为样本量,nh 为第 h 层的样本量,N 为总体单位数,Nh 为第 h 层的总体单位数。等比例分配操作比较容易,也易于理解,在实践中被广泛使用。但在有些情况下需要使用不等比例分配方法。比如各层单位数相差悬殊,如果按等比例抽样,总体单位数少的层所分到的样本量过小,代表性不足,就需要在该层适当增大样本量;或者有些层内的方差过大,为了降低抽样误差,在方差大的层中多抽,在方差小的层中少抽,这些都属于不等比例抽样。显然,在条件具备时,如果各层的总体方差已知,不等比例抽样的抽样误差可能比等比例抽样更小。
分层抽样的应用条件是:抽样框中有足够的辅助信息,能够将总体单位按某种标准划分到各层之中,实现在同一层内各单位之间的差异尽可能地小,不同层之间各单位的差异尽可能地大。
(三)系统抽样
系统抽样是指先将总体中的所有单元按一定顺序排列,在规定范围内随机抽取一个初始单元,然后按事先规定的规则抽取其他样本单元。最简单的系统抽样是等距抽样,即将总体 N 个单位按直线排列,根据样本量 n 确定抽样间隔,即抽样间隔为 N ÷ n ≈ k,k 为最接近 N ÷ n 的一个整数。在 1 ~ k 范围内随机抽取一个整数 i,令位于 i 位置上的单位为起始单位,往后每间隔 k 抽取一个单位,直至抽满 n。
系统抽样的优点是:①操作简便。它只需要随机确定起始单位,整个样本就自然确定了。
②对抽样框的要求也比较简单。它只要求总体单位按一定顺序排列,而不一定是一份具体的名录清单。例如,欲对某城市汽车尾气排放情况进行调查,抽样比为 1%,即平均每 100 辆车中抽 1 辆,采用系统抽样,可以将汽车牌号作为一种排列,在 1 ~ 100 中随机抽取一个号,如 53,结果凡牌号末两位为 53 的车辆均作为样本单位。
系统抽样的缺点是方差估计比较复杂,这就会给计算抽样误差带来一定困难。
系统抽样的估计效果与总体单位排列顺序有关。如果排列顺序与调查内容没有联系,称为按无关标识排列,这时系统抽样估计与简单随机抽样估计效率相仿。如果排列顺序与调查内容有关,称为按有关标识排列。按有关标识排列的系统抽样精度一般比简单随机抽样的精度高。上例对汽车尾气排放情况的调查中,是按汽车牌号排列,牌号与尾气排放没有关系,属于按无关标识排列。如果是按汽车价格排列,价格与尾气排放量有相关性,则属于按有关标识排列。在后一种情况下的系统样本中,既有高档汽车,也有低价位的汽车,样本的结构与总体的结构十分相似,因而可以有效降低抽样误差。
(四)整群抽样
整群抽样是将总体中所有的基本单位按照一定规则划分为互不重叠的群,抽样时直接抽取群,对抽中的群调查其全部基本单位,对没有抽中的群则不进行调查。例如,欲调查某市在职的房地产行业人员工资水平,将房地产行业所有在职人员按照所属企业分群,直接抽取企业单位,入样的企业单位内所有职工均接受调查,没有入样的企业单位员工都不调查。相对于简单随机抽样,整群抽样的优点有:①实施调查方便,可以节省费用和时间。在总体单位分布很广的条件下,如采用简单随机抽样,样本的分布十分分散,调查实施有一定难度,费时费力。而群中各单位的分布非常集中,抽中一个群以后,在一个点上可以调查多个单位,调查效率较高。②抽样框编制得以简化,抽样时只需要群的抽样框,而不要求全部基本单位的抽样框。例如,调查房地产行业在职人员工资水平时,没有所有员工名单的抽样框,但是有当地房地产企业的抽样框,所以可以依据该抽样框抽取单位,然后对抽中的企事业单位,调查其所有在职人员的工资水平。
整群抽样的主要缺点是:由于抽取的样本单位比较集中,群内各单位之间存在相似性,差异比较小,而群与群之间的差别往往比较大,使得整群抽样的抽样误差比较大。为了达到一定的误差要求,就有必要增大样本量,如多抽取一些群进行调查。但是,如果群的构造是相反的情况,即群内各单位之间存在较大的差异,而群与群的结构相似,整群抽样反而会降低估计误差。例如,以家庭为群,采用整群抽样估计某地区的男女比例,家庭内成员之间存在很大差异(有男有女),而家庭与家庭之间的性别结构却十分相似(同样也是有男有女),在这个背景下整群抽样估计男女比例的误差就低于简单随机抽样。所以,整群抽样特别适合于对某些特殊群结构进行调查。
(五)多阶段抽样
在大规模抽样调查中,一次抽取到最终样本单位是很难实现的,往往需要经过两个或两个以上阶段才能抽到最终样本单位,这就是多阶段抽样方法。首先从总体中采用随机方法抽取若干个小总体,称为初级单元;再在这些选中的初级单元中随机抽取若干个单位。如果经过两个阶段抽样,抽取到接受调查的最终单位,称为二阶段抽样;如果经过三个阶段才抽取到接受调查的最终单位,称为三阶段抽样,以此类推。所以,多阶段抽样是对经过两个及两个以上抽样阶段的抽样方法的统称。
在大范围的抽样调查中,采用多阶段抽样是必要的。首先,在大范围抽样调查中,往往没
有包括所有总体单位的抽样框,或者编制这样的抽样框十分困难。多阶段抽样是分阶段进行的,抽样框也可以分级进行准备。在第一阶段抽样中,只需准备总体中关于初级单元的抽样框;在第二阶段抽样中,仅在那些被抽中的初级单元中准备第二阶段抽样所需的抽样框。其次,因为多阶段抽样是在选中的单位中进行再抽选,这样就使样本的分布相对集中,从而可以节省调查中的人力和财力。例如,全国性的居民入户调查,首先抽区县,然后在选中的区县中抽居委会(村委会),最后在选中的居委会(村委会)中抽取居民户。如果构造下一级抽样框的工作和抽取样本的工作能得到各级行政单位的配合,则为多阶段抽样的实施创造了十分有利的条件。
多阶段的抽样设计比较复杂,这里不仅涉及如何划分阶段,还包括在每个阶段上应当抽取多大样本量,以及每个阶段的抽样方法。此外,多阶段的抽样误差计算也比较复杂。
现实中的抽样设计经常是多种抽样方法的组合。比如两阶段抽样中,第一阶段采用分层随机抽样,第二阶段采用系统抽样。又如采用分层抽样时,不同层内可以采用不同抽样方法,某些层内采用简单随机抽样,某些层内采用系统抽样。不同的抽样方法下,估计量会呈现不同的性质。因此,抽样设计中除了设计样本单位的选择之外,还需要选择适用的样本估计量。
三、估计量和样本量
(一)估计量的性质
在不同的抽样方法下,同一估计量也会有不同的估计效果。在同一抽样方法下,也会有不同的估计量可供选择,什么样的估计量是好估计量,下面以不放回简单随机抽样下的总体均值估计为例,介绍几个常用的选择标准。
1. 估计量的无偏性。假设一个总体包含 6,7,8,9,10 这 5 个数字。虽然很容易计算出总体均值为 8,但为说明估计量的性质,仍采用不放回简单随机抽样的方法,从中抽取 2 个数字作为样本,并选用样本均值作为估计量。由于总体比较小,可以列出所有可能的样本及相应样本均值,见表 25-2。
表 25-2 可能的样本组合及样本均值
| 样本 | 样本均值 |
|---|---|
| 6,7 | 6.5 |
| 6,8 | 7 |
| 6,9 | 7.5 |
| 6,10 | 8 |
| 7,8 | 7.5 |
| 7,9 | 8 |
| 7,10 | 8.5 |
| 8,9 | 8.5 |
| 8,10 | 9 |
| 9,10 | 9.5 |
一共有 10 种不同的样本,显然用样本均值估计总体均值时,对于不同的样本可以得到不同的估计值,这些估计值的均值为:
(1 ÷ 10) × (6.5 + 7 + 7.5 + 8 + 7.5 + 8 + 8.5 + 8.5 + 9 + 9.5) = 8
与总体均值 8 相等。实际上,对于不放回简单随机抽样,所有可能的样本均值取值的平均值总是等于总体均值,这就是样本均值估计量的无偏性。
2. 估计量的有效性。在同一抽样方案下,对某一总体参数 θ,如果有两个无偏估计量 θ̂1 和 θ̂2,由于样本的随机性,θ̂1 的可能样本取值较 θ̂2 更密集在总体参数真值 θ 附近,人们会认为 θ̂1 比 θ̂2 更有效。
由于方差是度量分布密集或离散状况的重要指标,估计量方差常用于描述抽样误差。估计量方差越大,说明用可能的样本估计值之间的差异越大,用样本统计量估计总体参数的效率就越低,抽样误差越大。因此,θ̂1 比 θ̂2 更有效,必然有 Var(θ̂1) < Var(θ̂2),即 θ̂1 的方差小于 θ̂2 的方差。
3. 估计量的一致性。随着样本量的增大,估计量的值如果稳定于总体参数的真值,这个估计量就有一致性,可称为一致估计量。
(二)抽样误差的估计
抽样误差虽然无法避免,但它是可计算的。调查人员可以计算抽样误差有多大,并采用适当的方式(如增大样本量)对其进行控制。下面以不放回简单随机抽样下均值估计量为例,简要介绍估计量方差的估计方法。
假设从总体的 N 个单元中按照不放回简单随机抽样方法抽取 n 个单元作为样本,用 Y1,Y2,…,YN 表示总体关于变量 Y 的 N 个观测值,用 y1,y2,…,yn 表示样本中的 n 个观测值。把样本均值 ȳ = (1 ÷ n) × Σyi 作为总体均值 Ȳ = (1 ÷ N) × ΣYi 的估计量,则估计量 ȳ 的方差为:
V(ȳ) = (1 − n ÷ N) × S² ÷ n
式中,S² = [1 ÷ (N − 1)] × Σ(Yi − Ȳ)²,为总体方差。
由上面的估计量方差可以看出:①抽样误差与总体分布有关,总体单位值之间差异越大,即总体方差 S² 越大,抽样误差就越大;②抽样误差与样本量 n 有关,在其他条件相同的情况下,样本量越大,抽样误差就越小。此外,抽样误差与抽样方式和估计量的选择也有关系。例如,分层抽样的估计量方差一般小于简单随机抽样。利用有效辅助信息也可以有效地减小抽样误差。
(三)样本量的计算
通常情况下,样本中所包含的样本单位数量(样本量,n)增大,相应样本估计量的抽样误差会减小;反之,样本中所包含的样本单位数量(样本量,n)减少,相应样本估计量的抽样误差会增大。在实际应用中,样本量的确定主要应考虑以下几方面因素。
1. 调查的精度。调查的精度是指用样本数据对总体进行估计时可以接受的误差水平。要求的调查精度越高(误差水平越小),所需要的样本量就越大。
2. 总体的离散程度。在其他条件相同的情况下,总体方差越大,所需要的样本量也越大。
3. 总体的规模。对于大规模的总体,总体规模对样本量的需求几乎没有影响。但是对小规模的总体,总体规模越大,为保证相同估计精度,样本量也要随之增大(但不是同比例的)。
4. 无回答情况。无回答减少了有效样本量。在无回答率较高的调查项目中,样本量要大一些,以减少无回答带来的影响。
5. 经费的制约。调查经费是影响样本量的一个十分重要的因素。事实上,样本量是调查经费与调查精度之间的某种折中和平衡。
此外,调查的限定时间、实施调查的人力资源也是影响样本量的客观因素。
不考虑费用限制、无回答情况及其他影响因素时,简单随机抽样的样本量计算公式为:
n0 = uα² × S² ÷ d²,n = n0 ÷ (1 + n0 ÷ N)
其中,N 为总体规模,当总体规模很大(N 大于 10000)时,总体规模 N 对样本量 n 的影响较小,样本量 n 接近于 n0。uα 为标准正态分布的双侧 α 分位数,在置信度(1 − α)为 95% 时 uα 值为 1.96。d 为绝对允许误差,用于表示一定的置信度(1 − α)下样本估计值 θ̂ 与总体参数 θ 之间的误差不超过某一给定的最大可能范围 Pr(|θ̂ − θ| ≤ d) = 1 − α,允许误差越小,表明人们就越相信抽样结果接近于“真实”。S² 为总体方差,总体方差 S² 未知时,一般用样本方差 s² 替代。在比例估计中,若 P 为总体比例,则总体方差 S² 计算公式为 P(1 − P)。
假定待估计的总体比例在 0.5 附近,总体规模(N)为 1000 万,当绝对允许误差分别为 0.01、0.03、0.05 时,简单随机抽样所需要的样本量分别为 9604、1068、385。随着样本量的增大,增加同等样本量所增加的精度幅度呈下降趋势。
3必背
这些是必须背下来的。先遮住右边一列,看左边考点名,自己说出内容,说不出来的做记号。
经济基础 第25章 抽样调查 必背
红 ★★★ 必考
| 考点 | 必背内容 |
|---|---|
| 总体 | 调查对象的全体;具体调查中总体必须明确,不能模糊 |
| 样本 | 总体的一部分,也是一个集合;抽中进入样本的单位叫入样单位,入样单位的个数叫样本量;调查的具体实施针对样本 |
| 抽样框 | 供抽样用的所有抽样单元的名单,是抽样总体的具体表现;单位必须有序、便于编号;高质量抽样框要信息多、无重复无遗漏 |
| 总体参数 | 按总体中所有单位数值算出来的总体指标值;是未知的常数,不受样本抽选结果影响;常见:总体总量、总体均值、总体比例、总体方差 |
| 样本统计量 | 按样本中各单位数值算的,是对总体参数的估计,又叫估计量;是随机变量;常见:样本均值、样本比例、样本方差 |
| 概率抽样 | 又叫随机抽样,依据随机原则按事先设计的程序抽;三特点:随机原则抽、每个单元被抽中概率已知或可算、估计时要考虑各单元被抽中的概率 |
| 非概率抽样 | 又叫非随机抽样,靠方便或主观判断抽,最主要特征是不依据随机原则;四种「判方愿配」:判断抽样(人为定样本)、方便抽样(拦截式调查)、自愿样本(网上调查)、配额抽样(先分类型,再分配样本数额) |
| 抽样误差 | 由抽样的随机性造成;根本原因:抽到不同的样本,对总体的估计就不同;不可避免但可计算、可控制 |
| 非抽样误差 | 除抽样误差以外的其他原因造成的差异;三种来源「框、答、量」:抽样框误差(重复、遗漏)、无回答误差(随机不在家 + 主观不愿答)、计量误差(诱导、提问错、作弊、理解偏、记忆不清、弄虚作假) |
| 简单随机抽样 | 分有放回和不放回两种;不放回误差更低,有放回较少用;适用条件三条:没有更多辅助信息、对象分布范围不广、个体差异不大 |
| 分层抽样 | 先分层,再各层内独立随机抽;每层都简单随机抽叫分层随机抽样;优点三条:能估各层参数、便于组织、每层都抽从而降低抽样误差;应用条件:有足够辅助信息,层内差异小、层间差异大 |
| 系统抽样 | 排好顺序,随机定起点,按规则往后抽;优点:操作简便、对抽样框要求低(只要有序不必有名单);缺点:方差估计复杂,算抽样误差难 |
| 整群抽样 | 分成互不重叠的群,直接抽群,抽中的群全查、没抽中的不查;优点:省费用时间、只需群的抽样框;缺点:群内相似群间差异大,抽样误差大,要增大样本量(多抽几个群) |
| 多阶段抽样 | 经过两个及两个以上抽样阶段的抽样方法的统称 |
黄 ★★ 重点
本章速记里没有 ★★ 考点,只有两个 ★★★ 和一个 ★。
绿 ★ 里会考的点
| 考点 | 必背内容 |
|---|---|
| 好估计量三性质 | 无偏性(所有可能样本均值的平均值 = 总体均值)、有效性(取值越密集在真值附近越有效,方差小)、一致性(样本量越大越稳定于真值) |
| 抽样误差影响因素 | 总体方差越大误差越大;样本量越大误差越小;和抽样方式、估计量选择有关(分层抽样方差一般小于简单随机抽样);利用辅助信息可减小误差 |
| 样本量影响因素 | 「精、散、模、答、钱」:精度越高样本越大;总体越离散样本越大;大总体几乎不影响、小总体越大样本要随之增大(非同比例);无回答率高要多抽;经费是精度和经费的折中;另有时间和人力 |
数字与公式清单
- 分层抽样等比例分配:nh ÷ n = Nh ÷ N(该层样本比例 = 该层在总体中的比例)
- 系统抽样抽样间隔:N ÷ n ≈ k(k 取最接近的整数),在 1 ~ k 里随机选起点 i,以后每隔 k 抽一个
- 不放回简单随机抽样均值估计量方差:V(ȳ) = (1 − n ÷ N) × S² ÷ n,S² 为总体方差
- 简单随机抽样样本量:n0 = uα² × S² ÷ d²,n = n0 ÷ (1 + n0 ÷ N);N 大于 10000 时 n 接近 n0
- 95% 置信度对应 uα = 1.96;比例估计的总体方差 S² = P(1 − P)
- 总体比例 0.5 附近、N 为 1000 万时,允许误差 0.01、0.03、0.05 对应样本量 9604、1068、385
- 教材例子:6 名员工年薪,简单随机抽 2 人均值范围 6 到 14 万元,分层抽样范围 9 到 11 万元,总体均值 10 万元
- 教材例子:总体 6、7、8、9、10,抽 2 个共 10 种样本,样本均值的平均值 = 8 = 总体均值(无偏性)
4总结
一页纸看完整章。二轮快刷和考前只看这里和必背。
经济基础 第25章 抽样调查 一页纸总结
本章一句话
不可能把所有人都问一遍,所以从总体里抽一部分(样本)来推全体。这章讲三件事:抽样要用哪些词(总体、样本、抽样框、参数、统计量)、误差从哪来、五种抽法怎么抽(简单随机、分层、系统、整群、多阶段),最后附带讲什么叫好的估计量、样本要抽多少。
章末总览表
| 考点 | 星级 | 一句话要点 | 考法 |
|---|---|---|---|
| 考点一 抽样调查基本概念 | ★★★ | 总体参数是未知常数、样本统计量是随机变量;概率抽样三特点、非概率抽样四种「判方愿配」;抽样误差由随机性造成,非抽样误差三来源「框、答、量」 | 单选(概念辨析)、多选(概率抽样特点、非概率抽样方法、非抽样误差来源) |
| 考点二 基本概率抽样方法 | ★★★ | 五种方法「简分系群多」各自的含义、优缺点、适用条件;分层要层内像层间不像,整群误差大要多抽群,系统抽样简便但方差难算 | 单选(给场景判断是哪种抽样)、多选(某种方法的优点或适用条件) |
| 考点三 估计量和样本量 | ★ | 好估计量三性:无偏、有效、一致;抽样误差随总体方差增大、随样本量减小;样本量五因素「精、散、模、答、钱」 | 单选、多选(影响因素方向题) |
易错坑
- 总体参数不受样本影响,它是固定的真值;会随样本变的是样本统计量(估计量)。
- 配额抽样也「分类」,但它是非概率抽样;分层抽样才是概率抽样。题目里出现「按方便原则」「人为确定」「自愿」就是非概率。
- 分层抽样和整群抽样的区别:分层是每层都抽一部分,整群是抽几个群、抽中的群全查。分层要层内差异小,整群最怕群内差异小(会让误差变大)。
- 系统抽样的缺点是「方差估计复杂」,整群抽样的缺点才是「抽样误差大」,别互换。
- 总体规模对样本量的影响:大总体(大于 10000)几乎没影响,小总体才随之增大且不是同比例;不是「总体越大样本一定按比例越大」。
和前后章的关系
第 24 章描述统计讲的均值、方差是本章估计量和总体方差的基础,本章把「拿样本推总体」的过程讲清楚,抽样误差的公式里就用到了总体方差。后面第 26 章回归分析、第 27 章时间序列都是在拿到样本数据之后做分析,本章是数据从哪来的那一步。
5解读(读透版讲义)
哪里没看懂,来这里看大白话讲解。生活例子、考法、坑都在这。可以先读这个再回去读教材。
抽样调查(教材原文·OCR)
文字为主,公式/图表以教材扫描为准。配套精华看复习网页。
第二十五章 抽样调碍
一\抽样调查基本概念
( 一 )基本概念
抽样调查是使用频率最高的一种调查方式。它是指按照某种原则和程序,从总体中抽取
一部分单位,通过对这一部分单位进行调查得到信息,以达到对总体情况的了解 ,或者对总体
的有关参数进行估计。下面先介绍几个基本概念。
- 总体与样本。总体即调查对象的全体。例如 ,欲对北京市的个体商业进行抽样调查,则
北京市所有的个体商业单位就构成一个总体。如果要研究某公司所有注册在职人员的工资状
况,总体就是该公司所有注册在职员工。在一项具体的调查项目中,调查总体必须是明确的而
不能是模糊的。
样本是总体的一部分,它由从总体中按一定原则或程序抽出的部分个体所组成。因此,与
总体一样,样本也是一个集合。每个被抽中进入样本的单位称为人样单位。样本中包含的人
样单位的个数称为样本量。抽样调查中调查的具体实施是针对样本而言的。
- 总体参数与样本统计量。总体参数是我们所关心变量的数字特征,它是根据总体中所
有单位的数值计算的。例如,在对北京市个体商业进行的调查中 ,北京市个体商业的年零售总
额就是一个总体参数。也可以说总体参数就是总体指标值,它是未知的常数,是我们通过调查
想要了解的,不受样本的抽选结果影响。常用的总体参数有总体总量 ,总体均值 ,总体比例 总
体方差等。例如,某公司所有注册在职人员的平均工资,某城市拥有两套以上住房的人口比例
等。
样本统计量是根据样本中各单位的数值计算的,是对总体参数的估计,因此也称为估计
量。样本统计量是一个随机变量,它取决于样本设计和正好被选和人样本的单元特定组合。例
如,用样本中员工的平均工资来估计该公司所有注册在职人员的平均工资,这里,样本中员工
的平均工资是该公司所有员工平均工资的一个估计量。常用的样本统计量有样本均值.样本
比例,样本方差等。
- 抽样框。抽样框是供抽样所用的所有抽样单元的名单 ,是抽样总体的具体表现。在抽
样框中,可以对每个单位编上一个号码,由此可以按一定随机化程序进行抽样。在抽样后,调
查人员也可以根据抽样框上所提供的信息找到被选中的人样单位,从而实施调查。
抽样框可以有多种形式,常用的有名录框,如企业名录 .电话每人员名册等。抽样框也可
以是一张地图或其他适当形式。但不管什么形式,抽样框中的单位必须是有序的,便于编号。
高质量的抽样框应当提供被调查单位更多的信息,并且没有重复和遗漏。
( 二 )概率抽样与非概率抽样
根据抽取样本方法的不同,可以将抽样分为概率抽样和非概率抽样两类。
概率抽样也称随机抽样,是指依据随机原则 ,按照某种事先设计的程序,从总体中抽取部
分单元的方法。概率抽样具有以下特点: 四按一定的概率以随机原则抽取样本。所谓随机原
则 ,就是在抽取样本时排除主观上有意识地抽取调查单元的情况,使每个单元都有一定的机会
"222 .经济基础知识 (中级)
被抽中。@)总体中每个单元被抽中的概率是已知的,或者是可以计算出来的。图当采用样本
对总体参数进行估计时,要考虑到每个样本单元被抽中的概率。也就是说,估计量不仅与对样
本单元的观测有关,也与样本单元被选人样本的概率有关。概率抽样中,如果每个单位被抽
入样本的概率相等,则称这种抽样方法为等概率抽样; 如果每个单位被抽入样本的概率不同,
则称为不等概率抽样。无论等概率或不等概率抽样 ,抽取时都要通过一定的随机化程序来实
现。
非概率抽样又称为非随机抽样,是调查者根据自己的方便或主观判断抽取样本的方法,其
最主要的特征是抽取样本时并不是依据随机原则。这类抽样有许多不同的具体抽取样本的方
法,下面列举一些主要的方法: 四判断抽样。这是指在抽取样本时,调查人员依据调查目的和
对调查对象情况的了解,人为确定样本单元。例如 ,选择“平均型 单元作为样本 ,选定的样本
可以代表所研究变量的平均水平。@)方便抽样。这是指在抽取样本时 ,依据方便原则 ,以达到
最大限度降低调查成本的目的。比如“拦截式" 调查,在街边或居民小区拦住行人进行调查。
图自愿样本。这是指不是经过抽取,而是由自愿接受调查的单元所组成的样本。比较典型的
是网上调查。色配额抽样。这是指将总体中的各单元按一定标准划分为若干类型,将样本数
额分配到各类型中,从各类型中抽取样本的方法则没有严格限制 ,一般采用方便抽样的方法抽
取样本单元。
( 三 )抽样调查的一般步又
一般而言 ,一个完整的抽样调查过程需要以下几个步骤。
- 确定调查问题。确定调查问题所要回答的是“要做什么样的调查研究”和“为什么要
做这项调查研究”。在这个过程中需要明确地定义问题,包括对整个问题的叙述以及确定研究
问题的具体组成部分。
- 调查方案设计。这一阶段,要明确如何实施调查, 主要包括抽样方案的设计和问卷设
计。抽样方案描述如何抽取样本,问卷设计则将比较抽象的调研问题逐步细化,演变为现场调
查中采访者询问的.比较具体的问题的工作过程。
- 实施调查过程。在这个过程中要获得样本单元的调查数据,关键的问题是要保证原始
数据的质量,这就需要对调查过程进行有效的管理和监控。在调查过程中,要有管理制度和措
施,使得从事具体调查的人员有章可循,按章操作。
- 数据处理分析。这个过程包括对调查获得的原始数据进行检查 ,核对,对验收合格的数
据进行编码和录入,对录入的数据进行预处理,对数据进行统计分析,对总体参数进行估计等。
- 撰写调查报告。调查报告是调查活动的最终成果,是前面劳动成果的展现。
(四 )抽样调查中的误差
样本估计值和总体参数真值之问的差异称为误差。凡调查就一定有误差,误差或大或小
总会存在,不可能完全避免。一般来说,调查中的误差可以分为抽样误差和非抽样误差两大类。
抽样误差是由于抽样的随机性造成的,用样本统计量估计总体参数时出现的误差。对任
何抽样方案,都会存在许多待选样本,实际中抽到的只是其中一个样本。抽到哪一个样本完全
是随机的,而抽到不同的样本,对总体的估计就会不同,这就是抽样误差产生的根本原因。
非抽样误差是指除抽样误差以外,由其他原因引起的样本统计量与总体真值之间的差异。
非抽样误差产生的原因主要有以下三种。
- 抽样框误差。例如,用市场监督管理局签发的营业执照作为个体商业的抽样框,对个体
商业实施抽样调查,以掌握个体商业零售额的情况。但有些个体商贩是无照经营,这部分零售
第二让五章,抽“*样"调查 '223,
额就会漏掉。有些人虽有营业执照,但已经转行,不再经商。用抽样框中的单位数对总体零售
额进行推估,也会造成误差。有些人虽然只有一个摊点,却办理了多个营业执照,他人选样本
的概率就是其他人的数倍,使得在设计人样概率基础上的估计结果失真。凡此种种都是由于
- 无回答误差。现场调查中由于各种原因,调查人员没能从被调查者那里得到所需要的
数据。例如,被调查者不在家,因病无法接受调查,拒绝接受调查等。可以把无回答分为两类:
一类是由于随机因素造成的,如调查时被调查者恰巧不在家,这种无回答减少了有效样本量,会
造成估计量方差增大; 另一类无回答是非随机因素的影响,如被调查者不愿告诉实情而拒绝回
答。第二类情况下 ,回答者与不回答者在调查指标上存在数量的差异 ,调查的结果中只有回答
者的信息,却没有无回答者的信息。这类无回答不仅造成估计量方差增大,还会带来估计偏差。
- 计量误差。计量误差是指由于调查所获得的数据与其真值之间不一致造成的误差。这
种误差可能是由调查人员 ,问卷设计 `受访者等原因造成的。例如,调查员在调查中有意无意
地诱导被调查者,调查中的提问错误或记录答案错误,调查人员有意作弊,由于问卷的原因受
访者对调查问题的理解上有偏误,受访者记忆不清,受访者提供虚假数字等。
二\几种基本概率抽样方法
概率抽样中有不同的抽样方法,下面简要介绍几种最基本的方法。
( 一)简单随机抽样
简单随机抽样分为有放回简单随机抽样和不放回简单随机抽样两种方法。有放回简单随
机抽样是指从总体中随机抽出一个样本单位,记录观测结果后,将其放回总体中去,再抽取第
二个,以此类推,直到抽满个单位为止。采用这种方法,单位有被重复抽中的可能。这种抽
样方法容易造成信息重到而影响估计的效率,所以较少采用。不放回简单随机抽样是指从包
含 个单元的总体中逐个随机地抽取单元并不放回 ,每次都在所有尚未被抽和样本的单元中
等概率地抽取下一个单元,直到抽取半个单元为止。采用这种方法,每个单元最多只能被抽中
一次,故不会由于样本单位被重复抽中而提供重琶信息,所以比有放回抽样的抽样误差低。
简单随机抽样是最基本的随机抽样方法,操作简单 ,且每个单位的入样概率相同,因而样
本估计量形式也比较简单。但是,简单随机抽样没有利用抽样框中更多的辅助信息,所以用样
本统计量估计总体参数的效率受到影响。同时,在简单随机抽样条件下 ,样本的分布可能十分
分散,这就增加了调查过程中的费用和时间。这种抽样方法的适用条件是: 中抽样框中没有更
多可以利用的辅助信息; @)调查对象分布的范围不广阔; @个体之间的差异不是很大。
( 二 )分层抽样
分层抽样是指先按照某种规则把总体分为不同的层,然后在不同的层内独立 .随机地抽取
样本,这样所得到的样本称为分层样本。如果每层中的抽样都是简单随机抽样 ,则称为分层随
机抽样。分层抽样的优点如下。钙分层抽样不仅可以估计总体参数,同时也可以估计各层的
参数。例如,按照行业将某市所有中小企业进行分层,进行就业人口的抽样调查,最终不仅能
估计全市中小企业就业的相关指标,还可以在各行业进行推算。@便于抽样工作的组织。例
如,某项全国范围的大型抽样调查,要编制全国范围的抽样框往往是一件非常困难的事,但如
果按行政区划或行业分层后,可以调动各级主管部门的积极性,分头编制抽样框并实施抽样的
组织和调查工作。此外,为了组织调查的方便,各层还可以根据层内的特点,分别采用不同的
. 224 ”经济基础知识 (中级)
抽样方法。@)每层都要抽取一定的样本单位,这样样本在总体中分布比较均匀,可以降低抽
样误差。例如,某部门共有6 名员工,其中3 名经理.3 名普通职员 ,现要估计该部门的平均工
资。他们的年薪见表 25-1。
表 25-1 某部门员工年薪
编号 经理层( 万元 ) 普通职员层( 万元 )
1 12 6
2 14 6
3 14 8
合计 40 20
虽然很容易算出总体均值子=各二2 -10( 万元),仍用概率抽样方法随机抽取 2 人为样
本,并用样本数据对总体均值进行估计。在简单随机抽样下 ,抽中年薪最少的 2 个人的样本
均值为 放 =@ 二6 =6( 万元 ),年薪最多的 2 个人的样本均值为元 = 地半地 = 14(万元)显然
与总体均值 10 万元相比误差都比较大。如果抽样前已经知道所有员工的职位信息,且知着
不同职位的员工年薪有较大差异,则可以采用分层抽样,在经理层中抽一人,在普通职员层
中抽一人,共同组成样本,这时样本最小的可能值为 亢 = 也:*6 =9( 万元),最大的可能值为
元=革汪= 11(万元)显然分层抽样的估计值更集中在总体均值周轩。
分层抽样中,样本量在各层中分配的方法可以归为两类: 等比例分配和不等比例分配。
等比例分配是指层中单位数越多,在该层中抽取的样本单位就越多,该层的样本单位比例与该
层中的总体单位比例相一致,即 六 = 让。 这里 , 为样本量,mw 为第大层的样本量, N 为总体音
位数,N 为第坟层的总体单位数。等比例分配操作比较容易,也易于理解,在实践中被广泛使
用。但在有些情况下需要使用不等比例分配方法。比如各层单位数相差悬殊,如果按等比例
抽样,总体单位数少的层所分到的样本量过小,代表性不足,就需要在该层适当增大样本量;或
者有些层内的方差过大,为了降低抽样误差,在方差大的层中多抽,在方差小的层中少抽,这些
都属于不等比例抽样。显然,在条件具备时,如果各层的总体方差已知,不等比例抽样的抽样
误差可能比等比例抽样更小。
分层抽样的应用条件是: 抽样框中有是够的辅助信息,能够将总体单位按某种标准划分
到各层之中,实现在同一层内各单位之间的差异尽可能地小,不同层之间各单位的差异尽可能
地大。
( 三 )系统抽样
系统抽样是指先将总体中的所有单元按一定顺闯排列,在规定范围内随机抽取一个初始
单元,然后按事先规定的规则抽取其他样本单元。最简单的系统抽样是等距抽样,即将总体
W 个单位按直线排列,根据样本量 ”确定抽样间隔,即抽样间隔为 定~刀上为最接近六 的一
个整数。在 1趟范围内随机抽取一个整数.令位于;i 位置上的单位为起始单位,往后每间隔
抽取一个单位,直至抽满/。
系统抽样的优点是: 四操作简便。它只需要随机确定起始单位,整个样本就自然确定了。
第二让亚章”,抽*样"调查 225,
@)对抽样框的要求也比较简单。它只要求总体单位按一定顺序排列,而不一定是一份具体的
名录清单。例如 ,欲对某城市汽车尾气排放情况进行调查,抽样比为 1%,即平均每 100 辆车中
抽 1 辆,采用系统抽样,可以将汽车牌号作为一种排列,在 1~100 中随机抽取一个号,如 53 ,结
果凡牌号末两位为 53 的车辆均作为样本单位。
系统抽样的缺点是方差估计比较复杂,这就会给计算抽样误差带来一定困难。
系统抽样的估计效果与总体单位排列顺序有关。如果排列顺序与调查内容没有联系 ,称
为按无关标识排列,这时系统抽样估计与简单随机抽样估计效率相仿。如果排列顺序与调查
内容有关,称为按有关标识排列。按有关标识排列的系统抽样精度一般比简单随机抽样的精
度高。上例对汽车尾气排放情况的调查中,是按汽车牌号排列 ,牌号与尾气排放没有关系,属
于按无关标识排列。如果是按汽车价格排列,价格与尾气排放量有相关性,则属于按有关标识
排列。在后一种情况下的系统样本中,既有高档汽车,也有低价位的汽车,样本的结构与总体
的结构十分相似,因而可以有效降低抽样误差。
(四 )整群抽样
整群抽样是将总体中所有的基本单位按照一定规则划分为互不重到的群,抽样时直接抽
取群,对抽中的群调查其全部基本单位,对没有抽中的群则不进行调查。例如,和欲调查某市在
职的房地产行业人员工资水平,将房地产行业所有在职人员按照所属企业分群,直接抽取企业
单位,和人样的企业单位内所有职工均接受调查,没有入样的企业单位员工都不调查。相对于简
单随机抽样,整群抽样的优点有: @实施调查方便,可以节省费用和时间。在总体单位分布很
广的条件下 ,阁采用简单随机抽样 ,样本的分布十分分散,调查实施有一定难度,费时费力。而
群中各单位的分布非常集中 ,抽中一个群以后,在一个点上可以调查多个单位,调查效率较高。
@抽样框编制得以简化,抽样时只需要群的抽样框,而不要求全部基本单位的抽样框。例如,
调查房地产行业在职人员工资水平时,没有所有员工名单的抽样框,但是有当地房地产企业的
抽样框,所以可以依据该抽样框抽取单位,然后对抽中的企事业单位 ,调查其所有在职人员的
工资水平。
整群抽样的主要缺点是: 由于抽取的样本单位比较集中,群内各单位之间存在相似性,差
异比较小 ,而群与群之间的差别往往比较大,使得整群抽样的抽样误差比较大。为了达到一定
的误差要求,就有必要增大样本量,如多抽取一些群进行调查。但是,如果群的构造是相反的
情况,即群内各单位之间存在较大的差异 ,而群与群的结构相似,整群抽样反而会降低估计误
差。例如,以家庭为群,采用整群抽样估计某地区的男女比例,家庭内成员之间存在很大差异
(有男有女 ),而家庭与家庭之间的性别结构却十分相似( 同样也是有男有女 ),在这个背景
整群抽样估计男女比例的误差就低于简单随机抽样。所以,整群抽样特别适合于对某些特殊
群结构进行调查。
(五 )多阶段抽样
在大规模抽样调查中 ,一次抽取到最终样本单位是很难实现的,往往需要经过两个或两个
以上阶段才能抽到最终样本单位,这就是多阶段抽样方法。首先从总体中采用随机方法抽取
若干个小总体,称为初级单元; 再在这些选中的初级单元中随机抽取若干个单位。如果经过两
个阶段抽样,抽取到接受调查的最终单位 ,称为二阶段抽样; 如果经过三个阶段才抽取到接受
调查的最终单位,称为三阶段抽样,以此类推。所以,多阶段抽样是对经过两个及两个以上抽
样阶段的抽样方法的统称。
在大范围的抽样调查中,采用多阶段抽样是必要的。首先,在大范围抽样调查中 ,往往没
“ 226 ”经济基础知误 (中级)
有包括所有总体单位的抽样框,或者编制这样的抽样框十分困难。多阶段抽样是分阶段进行
的,抽样框也可以分级进行准备。在第一阶段抽样中,只需准备总体中关于初级单元的抽样
框; 在第二阶段抽样中,仅在那些被抽中的初级单元中准备第二阶段抽样所需的抽样框。其
次,因为多阶段抽样是在选中的单位中进行再抽选,这样就使样本的分布相对集中,从而可以
节省调查中的人力和财力。例如,全国性的居民入户调查,首先抽区县,然后在选中的区县中
抽居委会( 村委会 ),最后在选中的居委会( 村委会 )中抽取居民户。如果构造下一级抽样杠
的工作和抽取样本的工作能得到各级行政单位的配合,则为多阶段抽样的实施创造了十分有
利的条件。
多阶段的抽样设计比较复杂,这里不仅涉及如何划分阶段,还包括在每个阶段上应当抽取
多大样本量,以及每个阶段的抽样方法。此外,多阶段的抽样误差计算也比较复杂。
现实中的抽样设计经常是多种抽样方法的组合。比如两阶段抽样中,第一阶段采用分层
随机抽样,第二阶段采用系统抽样。又如采用分层抽样时,不同层内可以采用不同抽样方法,
某些层内采用简单随机抽样 ,某些层内采用系统抽样。不同的抽样方法下 ,估计量会呈现不同
的性质。因此 ,抽样设计中除了设计样本单位的选择之外,还需要选择适用的样本估计量。
三\估计量和样本量
(一)估计量的性质
在不同的抽样方法下 ,同一估计量也会有不同的估计效果。在同一抽样方法下 ,也会有不
同的估计量可供选择,什么样的估计量是好估计量, 下面以不放回简单随机抽样下的总体均值
估计为例 ,介绍几个常用的选择标准。
- 估计量的无偏性。假设一个总体包含 6,7, 8, 9, 10 这 5 个数字。虽然很容易计算出总
体均值为8,但为说明估计量的性质,仍采用不放回简单随机抽样的方法,从中抽取 2 个数字
作为样本 ,并选用样本均值作为估计量。由于总体比较小,可以列出所有可能的样本及相应样
本均值,见表 25-2。
表 25-2 可能的样本组合及样本均值
样本 样本均值
6,7 6.5
6,8 7
6,9 7.5
6, 10 8
7,8 7.5
7,9 8
7,10 8.5
8,9 8.5
8,10 9
9, 10 9.5
第二让五章”,抽“*样"调`查 227,
一共有 10 种不同的样本,显然用样本均值估计总体均值时,对于不同的样本可以得到不
同的估计值,这些估计值的均值为:
疝x(6.5 +7+7.5+8+7.5+8+8.5+8.5+9+9.5) =8
与总体均值 8 相等。实际上,对于不放回简单随机抽样,所有可能的样本均值取值的平均
值总是等于总体均值,这就是样本均值估计量的无偏性。
- 估计量的有效性。在同一抽样方案下,对某一总体参数 b ,如果有两个无偏估计量 b
和 饭 ,由于样本的随机性,b 的可能样本取值较 b. 更密集在总体参数真值 6 附近,人们会认
为 比 负 更有效。
由于方差是度量分布密集或离散状况的重要指标,估计量方差常用于描述抽样误差。估
计量方差越大,说明用可能的样本估计值之间的差异越大,用样本统计量估计总体参数的效率
就越低 ,抽样误差越大。因此,6 比 岂 更有效,必然有 Var(b ) 一 Var(外),即 b 的方差小于
6 的方差。
- 估计量的一致性。随着样本量的增大,估计量的值如果稳定于总体参数的真值 ,这个估
计量就有一致性,可称为一致估计量。
( 二 )抽样误差的估计
抽样误差虽然无法避免,但它是可计算的。调查人员可以计算抽样误差有多大,并采用适
当的方式( 如增大样本量 ) 对其进行控制。下面以不放回简单随机抽样下均值估计量为例 ,简
要介绍估计量方差的估计方法。
假设从 生体间上个旦于中入时不放四午间请机销杰方法掉取"人于下作为本,
用妃,克,: 天起休关于灾昌了的个再测全 用入, 力,…,六表示样本中的个
观测值。把样本均值 了=圭 二> 作为总体均值了=二 攻之 的估计量,则估计量了的方差
K刀=(1 -二上
式中,= 六> (也 - 芒? ,为总体方差。
由上面的估计量方差可以看出: 中抽样误差与总体分布有关,总体单位值之间差异越大,
即总体方差 $ 越大,抽样误差就越大; @抽样误差与样本量z 有关,在其他条件相同的情况
下 ,样本量越大,抽样误差就越小。此外,抽样误差与抽样方式和估计量的选择也有关系。例
如,分层抽样的估计量方差一般小于简单随机抽样。利用有效辅助信息也可以有效地减小抽
( 三 )样本量的计算
通常情况下 ,样本中所包含的样本单位数量(样本量,m )增大,相应样本佑计量的抽样误
差会减小; 反之,样本中所包含的样本单位数量( 样本量,m ) 减少,相应样本估计量的抽样误
差会增大。在实际应用中 ,样本量的确定主要应考虑以下几方面因素。
- 调查的精度。调查的精度是指用样本数据对总体进行估计时可以接受的误差水平。要
求的调查精度越高( 误差水平越小 ) 所需要的样本量就越大。
- 总体的离散程度。在其他条件相同的情况下 ,总体方差越大,所需要的样本量也越大。
' 228 经济基础知识 (中级)
3.总体的规模。对于大规模的总体,总体规模对样本量的需求几乎没有影响。但是对
小规模的总体,总体规模越大,为保证相同估计精度,样本量也要随之增大( 但不是同比例
的)。
- 无回答情况。无回答减少了有效样本量。在无回答率较高的调查项目中,样本量要大
一些,以减少无回答带来的影响。
- 经费的制约。调查经费是影响样本量的一个十分重要的因素。事实上,样本量是调查
经费与调查精度之间的某种折中和平衡。
此外,调查的限定时间 ,实施调查的人力资源也是影响样本量的客观因素。
不考虑费用限制,无回答情况及其他影响因素时 ,简单随机抽样的样本量计算公式为:
其中, N 为总体规模, 当总体规模很大(大于 10000 )时,总体规模N对样本量” 的
影响较小,样本量 接近于 m。us 为标准正态分布的双侧 a 分位数,在置信度(1-a )为
95% 时 us 值为1.96。d 为绝对允许误差,用于表示一定的置信度(1-a )下样本估计值 6
与总体参数 0 之间的误差不超过某一给定的最大可能范围户(|6 -6|和4)=1-a ,多
许误差越小,表明人们就越相信抽样结果接近于“真实*。$S 为总体方差,总体方差 ?未知
时,一般用样本方差 替代。在比例估计中,若己为总体比例,则总体方差$ 计算公式为
P(1-P)。
假定待估计的总体比例在 0.5 附近,总体规模(N ) 为 1000 万,当绝对允许误差分别为
0.01.0.03 .0.05 时,简单随机抽样所需要的样本量分别为 9604、1068、385。随着样本量的增
大,增加同等样本量所增加的精度幅度呈下降趋势。
零基础复习卡(两版教材核验)
来源核验:主教材《2026经济基础知识中级原书有色差(371)》PDF 第232-239页;《经济基础知识(中级)-292》PDF 第186-191页(书内第178-183页)。
一句话先懂
抽样调查不是“随便找几个人问”,而是用可说明的抽样程序取得样本,再用样本统计量估计总体参数。
零基础解释
- 四个基本名词:总体是全部研究对象,样本是被抽中的部分;总体参数是未知但固定的总体数字特征,样本统计量随抽到谁而变化。
- 抽样框:实际供抽样使用的全部抽样单元名单。名单漏人、重复或含不属于总体的单位,会产生抽样框误差。
- 概率抽样:每个单位被抽中的概率已知或可计算,因而能估计抽样误差。常见有简单随机、分层、系统、整群和多阶段抽样。
- 非概率抽样:被抽中概率未知,如判断、方便、自愿、配额、滚雪球抽样,速度快但总体推断能力弱。
- 误差:抽样误差来自只调查部分单位;非抽样误差包括抽样框、无回答、计量等误差,普查也会有非抽样误差。
- 好估计量:无偏性看长期平均是否等于真值;有效性看同为无偏时谁方差更小;一致性看样本量增大后是否趋近真值。
必背清单
- 简单随机:每个单位等概率,分有放回和不放回。
- 分层抽样:“层内相似、层间差异”,每层都抽,适合总体差异明显且有分层信息。
- 系统抽样:先随机起点,再按固定间隔抽取;总体名单不能有与间隔重合的周期性。
- 整群抽样:抽中群后调查群内全部单位;“群内尽量杂、群间尽量像”。
- 多阶段抽样:分阶段逐级抽,例如省-市-县-家庭。
- 样本量通常随精度要求提高、总体离散程度增大、预计无回答率上升而增大;对很大总体,总体规模继续增大影响很小。
易混点
- 分层和整群正相反:分层每层抽一部分;整群抽若干群并调查群内全部单位。
- 抽样误差不是调查错误,是概率抽样只观察部分总体产生的随机差异。
- 普查没有抽样误差,但有非抽样误差。
- 样本统计量是随机变量,总体参数是未知常数。
记忆口诀
- “层内同、层间异;群内杂、群间似”。
- 估计量三性:“均值对真叫无偏,方差更小叫有效,样本越大越靠近叫一致”。
自测题
- 判断:总体均值会随本次抽到的样本不同而变化。
答案:错。 总体参数是未知常数,变化的是样本统计量。
- 单选:先把学生按年级分组,再从每个年级随机抽人,属于( )。A整群 B分层 C系统 D判断
答案:B。 每一层都抽取部分单位。
- 单选:随机抽取若干班级,调查被抽班级的全部学生,属于( )。A整群 B分层 C配额 D方便
答案:A。 抽中的是群,群内全部调查。
- 判断:普查不会产生任何调查误差。
答案:错。 普查没有抽样误差,但仍可能有无回答、计量等非抽样误差。
- 单选:两个无偏估计量中,方差较小者具有更好的( )。A一致性 B有效性 C代表性 D完整性
答案:B。 有效性用估计量方差比较。
- 多选:其他条件不变,会使所需样本量增加的有( )。A允许误差缩小 B总体离散程度增大 C预计无回答率上升 D精度要求降低
答案:ABC。 精度要求降低通常可减少样本量。
6刷题(章节配套练习,含校订与教学改编)
先做后看答案。单选点一下就判,多选选完点「核对答案」。错题自动进错题本,二轮会回来重做。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确统计定义、经验标准或教学条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:按《经济基础知识(中级)章节同步习题集-304.pdf》原PDF第201页题面、第205页答案复核修正;保留原题答案。
校勘说明:按《经济基础知识(中级)章节同步习题集-304.pdf》原PDF第201页题面、第205页答案复核修正;保留原题答案。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
校勘说明:为明确抽样程序、统计定义或适用条件所作的校订后教学题设,不冒充原题原文。
7本章打卡
做完一项勾一项,当天页会自动更新整体进度。
学完这章就是往前走了一步。记不住的,明天再来看必背,不用今天全记住。