样本量的大小不仅仅对因果推论有着重要的意义,也越来越强烈地影响到常规社会科学研究中的数据收集和资料分析过程。在过去的十几年中,越来越多的社会科学研究者自己收集调查资料进行定量分析。在这个过程中,很多学者都会遇到的问题是:究竟应该收集多大的样本才能算得上“足够大”?一方面,调查研究中问卷的发放受到人力和物力的限制,因此从经济的角度考虑,样本量要尽量小。另一方面,从统计推论的角度看,更多的研究个体可以帮助学者避免因为抽样误差而忽略潜在的显著性变量,因而样本量越大越有助于得到精确的结论。在这样的权衡中,如何通过科学的方法确定自己需要的样本量就尤为重要(Cohen 1990;Kraemer & Thiemann 1987;O’Brien & Muller 1993)。
统计分析中样本量的估算是通过检定力分析(power analysis)来实现的。现有的检定力分析方法绝大多数是针对t检验或者方差分析,很少涉及回归模型。这主要是因为应用统计学更多的是使用实验设计的方法进行研究(例如事先将研究个体分配进实验组和控制组),在这些方法中,最后的结果往往依赖于组间均值的比较。由于用于比较组间均值的统计方法主要是t检验或者方差分析,因而现有的检定力分析主要涉及这些方法(Montgomery 2008)。但是,在社会科学研究中,我们比较常用的统计工具是多元回归以及逻辑斯蒂回归。相比较而言,回归模型下的检定力分析以及样本量计算问题在社会学研究中并没有得到充分的关注。
针对这一空白,本章试图通过实例来展示社会科学研究中基于回归模型的样本估算方法。通过预先设定回归模型的某些参数,本章介绍的方法能够帮助研究者在抽样之前了解自身研究所需要的样本量从而为下一步的数据收集提供帮助
在进行社会科学因果关系分析的时候,一个十分重要的考虑因素是样本量问题。这个问题在因果关系分析中之所以重要,是因为一个小样本的分析即使得出某种因果关系,这种因果关系也有可能只是一种“偶然事件”,并不代表某种真正意义上的因果关系。比如在进行新药测试的时候,如果一个医生只有两个病人,一个放到了实验组服用新药,一个放到了控制组不服用任何药物。那么即使我们发现他们的某些症状呈现差异(例如服用新药的人症状减轻,而没有服用新药的人症状加重),我们也难以有十足的自信说这种症状上的差异是由于药物引起而不仅仅是一种偶然事件。同样的,在费舍尔经典的“英国女士品茶实验”中,一位女士宣称她可以准确判断出一杯英国茶是先放牛奶后放茶水还是先放茶水后放牛奶。费舍尔让她品尝了多杯英国茶来判断这位女士是否有能力判断茶水和牛奶的放入顺序。这时,实验A只给这位女士两杯茶,其中一杯是先放牛奶而另一杯是后放牛奶。实验B给这位女士10杯茶,其中5杯是随机先放牛奶,5杯是随机后放牛奶。假设这位女士在这两个实验中都判断对了牛奶和茶水的放置顺序(即实验A中这位英国女士辨识出了哪一杯是先放牛奶的,而在实验B中这位英国女士判断出了哪5杯是先放牛奶的),那么究竟哪个实验更有说服力呢?换句话说,研究者根据哪个实验的结果能够更有自信得出结论说这位女士有准确地品茶能力呢?无疑,实验B是优于实验A的。这是因为在试验A中,即使是靠猜测,一个人能够判断出两杯茶中哪杯先放牛奶的概率是
。但是一个人能够准确地猜中10杯茶中哪些是先放牛奶的概率就只有
。这么低的概率说明仅仅靠猜是不可能答对的。之所以我们在实验B中可以确信我们的结论更可靠就是因为实验B有更大的样本量。
样本量的大小不仅仅对因果推论有着重要的意义,也越来越强烈地影响到常规社会科学研究中的数据收集和资料分析过程。在过去的十几年中,越来越多的社会科学研究者自己收集调查资料进行定量分析。在这个过程中,很多学者都会遇到的问题是:究竟应该收集多大的样本才能算得上“足够大”?一方面,调查研究中问卷的发放受到人力和物力的限制,因此从经济的角度考虑,样本量要尽量小。另一方面,从统计推论的角度看,更多的研究个体可以帮助学者避免因为抽样误差而忽略潜在的显著性变量,因而样本量越大越有助于得到精确的结论。在这样的权衡中,如何通过科学的方法确定自己需要的样本量就尤为重要(Cohen 1990;Kraemer & Thiemann 1987;O’Brien & Muller 1993)。
统计分析中样本量的估算是通过检定力分析(power analysis)来实现的。现有的检定力分析方法绝大多数是针对t检验或者方差分析,很少涉及回归模型。这主要是因为应用统计学更多的是使用实验设计的方法进行研究(例如事先将研究个体分配进实验组和控制组),在这些方法中,最后的结果往往依赖于组间均值的比较。由于用于比较组间均值的统计方法主要是t检验或者方差分析,因而现有的检定力分析主要涉及这些方法(Montgomery 2008)。但是,在社会科学研究中,我们比较常用的统计工具是多元回归以及逻辑斯蒂回归。相比较而言,回归模型下的检定力分析以及样本量计算问题在社会学研究中并没有得到充分的关注。
针对这一空白,本章试图通过实例来展示社会科学研究中基于回归模型的样本估算方法。通过预先设定回归模型的某些参数,本章介绍的方法能够帮助研究者在抽样之前了解自身研究所需要的样本量从而为下一步的数据收集提供帮助