很多人开始设计问卷时,第一反应是问“至少要收多少份”。但样本量并不存在脱离研究问题的固定答案。同一份问卷,如果只是描述总体情况、需要比较多个群体,或计划建立较复杂的统计模型,所需样本规模可能完全不同。真正需要先确定的,不是一个看似标准的数字,而是研究要回答什么问题,以及现有样本能否支撑这个回答。

先确定研究对象和抽样范围

样本量规划的起点是研究总体。需要先说明你想把结论推广给谁,以及实际能够接触到谁。例如,研究对象可能是某一类学生、某个组织中的成员,或符合特定条件的受访者。研究总体的边界越模糊,后续的样本量和抽样方式就越难解释。

还要区分“理论上的研究总体”和“实际可抽取的对象”。前者决定结论的适用范围,后者决定调查能否执行。如果研究只通过一个班级、一个社群或单一渠道发放问卷,就不应轻易把结果表述为整个地区或所有相关人群的情况。此时,样本量即使增加,也不能自动弥补抽样来源过于单一的问题。

当研究总体规模较小且边界清楚时,样本量规划还应考虑总体规模本身。总体很小,并不意味着可以随意抽取少量个体;如果希望覆盖总体,可能需要尽量进行全面调查。相反,当总体较大时,决定样本规模的重点通常会转向研究目标、抽样质量和分析要求,而不是简单追求与总体规模成比例增长。

再判断研究主要要回答哪类问题

样本量首先服务于分析目标。可以先把研究问题归入以下几类,但不要把它们当成互相排斥的固定模板。

如果研究主要是描述性调查,重点可能是了解某种态度、行为或现状。这时需要考虑总体估计是否足够稳定,以及样本是否覆盖了研究对象中的重要差异。若研究还希望分别描述不同年级、地区或身份群体,就不能只按照总体描述的需要规划样本,而应进一步考虑各组是否都有足够的观察对象。

如果研究重点是组间比较,关键问题就变成“比较哪些组”。两组比较和多个组比较,对样本规划的要求不同;各组样本过于失衡,也会影响比较的解释。不能因为总体样本数看起来不少,就默认每个分组都能得到可靠结论。只要某个分组是论文中的核心结论来源,就应在规划阶段单独检查该组是否有足够样本。

如果研究希望分析变量之间的关系,或考察某些因素对结果的影响,则需要明确计划使用何种分析方式。相关分析、回归分析、分类结果分析等方法,对变量类型、数据分布和样本规模的要求并不完全相同。尤其当模型同时纳入多个解释变量,或还要考察交互关系、控制变量和分组差异时,样本需求通常会随分析复杂度上升。

因此,不能只问“问卷有多少题”,而要问“最终模型中准备分析哪些变量”。题目数量多,不一定意味着模型变量多;一个题目也可能经过编码、合并或转换后形成不同的分析变量。相反,如果把大量变量都纳入模型,却没有事先说明理论依据,样本再多也无法解决研究设计本身缺乏重点的问题。

按分析计划估计,而不是套用万能数字

确定了主要分析方式后,可以进一步明确样本量估计所依据的假设。常见的考虑包括预期差异或关系的大小、显著性判断标准、希望达到的检验把握度,以及数据中可能存在的缺失和无效回答。

其中,预期效应大小尤其重要。如果研究只希望识别非常明显的组间差异,所需样本与试图识别较小差异时通常不同。预期差异越小,往往越需要更多样本才能避免把真实差异误判为不存在。但预期效应不能为了得到一个好看的样本量而随意设定,应尽量依据既有文献、先前研究、理论判断或小规模预调查,并在论文中说明依据。

如果研究计划进行统计功效分析,应把它作为研究设计的一部分,而不是在收集数据后为了证明样本“够用”才补做。功效分析的结果取决于研究假设、分析方法和参数设定;它不是一个能脱离情境直接生成标准答案的计算器。若缺少可靠的先验信息,可以明确说明假设较为保守,或通过不同假设下的结果比较样本规划的敏感性。

此外,样本量计算所得的通常是“有效样本”需求,而不是问卷发放数量。实际调查中可能出现拒答、漏答、重复提交、逻辑矛盾或不符合纳入标准的问卷。因此,发放计划应在预计有效率的基础上留出余量。但这个余量应建立在合理的调查预期上,不能用无限增加发放量来掩盖抽样渠道和问卷质量的问题。

检查每个重要分组是否真的有样本

很多问卷研究的困难不在总体样本太少,而在研究者一开始规划了过多分组。比如,研究同时想比较多个年级、不同地区、不同专业和不同身份,最后还要交叉分析这些特征。这样做会迅速把样本分散到许多小单元中,使部分比较缺乏稳定依据。

规划时可以先列出论文真正需要报告的比较维度,再区分核心分组和辅助描述变量。核心分组应优先保证样本覆盖,辅助变量则不一定都要单独展开比较。如果某个群体只是为了描述样本特征而收集,就不必默认要对其进行独立推断。

还要提前检查分组之间是否可能天然不均衡。若某一组在研究对象中本来就较少,单纯依靠便利抽样可能难以获得足够观察对象。此时需要在抽样渠道、招募方式或研究问题之间做选择,而不是等数据收集结束后才发现关键比较无法完成。

分组越多,越应谨慎解释探索性结果。样本量不足时,即使表格中出现了组间差异,也不宜仅凭一个统计结果作出过强结论;同样,未发现差异也不必然等于各组确实没有差异,可能只是数据无法提供足够辨别力。

把可获得样本纳入设计,而不是最后才妥协

样本规划既是统计问题,也是执行问题。研究者需要评估自己能够接触到哪些人、调查渠道是否稳定、受访者是否愿意完成问卷,以及调查时间和伦理要求是否允许继续扩大招募。

在设计阶段,可以把“理想样本规模”和“现实可获得规模”分别写出来。理想规模用于说明完整研究目标需要什么条件,现实规模用于判断当前方案是否可行。两者之间如果差距较大,应尽早调整研究设计,而不是先按理想目标写好分析计划,再在数据不足时被动删减。

可执行的判断顺序可以是:

  1. 明确研究总体、纳入标准和结论准备推广到的范围。
  2. 写出主要研究问题,并区分描述、组间比较和关系或预测分析。
  3. 确定主要结果变量、核心分组和计划使用的分析方式。
  4. 检查每个核心分组是否能获得足够观察对象,以及样本是否可能严重失衡。
  5. 根据效应大小、统计把握度、总体规模和抽样设计估计有效样本需求。
  6. 结合无效回答、缺失数据和实际招募能力,制定发放或招募计划。
  7. 在正式收集数据前,预先规定样本不足时的调整方案和解释边界。

这套顺序的价值在于,它把“要多少样本”放在研究问题和分析方案之后。若一开始没有确定主要结果和比较对象,任何样本量数字都很难说明究竟服务于什么结论。

样本不足时,优先调整研究问题

如果评估后发现可获得样本明显不足,不一定只能继续扩大问卷发放。更稳妥的做法,是先判断哪些研究目标超出了数据能力,再缩小问题范围。

一种方式是减少分组。可以保留理论上最重要的比较维度,取消对次要群体的单独比较,或把原本过细的分类合并为更有解释意义的类别。但合并不能只是为了让每组人数看起来充足,还要考虑不同类别是否具有合理的理论相似性。若两个群体在研究机制上明显不同,简单合并可能损害解释力。

另一种方式是减少分析变量,保留与核心研究问题直接相关的结果变量和解释变量。样本有限时,复杂模型中加入过多控制变量、交互项或分层分析,容易造成结果不稳定,也会让论文难以说明每个变量为何被纳入。缩小变量范围并不等于降低研究质量,前提是调整后的问题仍然清晰,并与理论和文献依据一致。

还可以把研究定位从全面推断调整为探索性研究,或将结论限定在实际调查对象和特定情境内。这样的调整必须在论文中明确说明,不能用更宽泛的表述掩盖样本来源有限的问题。探索性结果可以用于发现线索、形成后续假设,但不应被包装成对更大总体的确定性结论。

如果研究目标本身必须进行复杂比较,而样本又无法支持,就应考虑延长招募、增加合适的抽样渠道,或重新安排研究时机。若无法改善样本条件,与其保留一个看似完整但实际无法支撑的分析框架,不如坦诚缩小研究范围。

样本量之外,还要检查样本质量

样本数量只是判断依据之一。样本是否来自目标总体、招募渠道是否过于集中、不同群体是否严重失衡、问卷是否存在大量低质量回答,都会影响结论可信度。

例如,同一渠道连续收集到的大量问卷,可能只反映该渠道使用者的特征。如果研究问题涉及更广泛的人群,就需要在局限性中说明这一点。又如,某个核心群体样本很少,即使总体有效问卷数量达到预期,也不能把该群体的比较结果写得过于确定。

问卷设计本身也会影响有效样本。题目含义不清、选项不完整、填写路径过长或缺乏必要的筛选条件,都可能增加缺失和无效回答。样本量规划不应与问卷设计完全分开:在预调查或小规模试填阶段,应同时观察受访者是否理解题目、是否能完成问卷,以及哪些题目容易造成数据缺失。

最终,论文中应交代样本量是如何确定的,包括研究目标、抽样范围、分析计划、样本量估计依据、实际获得的有效样本,以及样本不足可能带来的影响。如果实际样本与原计划不同,也应说明调整原因和由此改变的分析边界。

一个合格的样本规划,不是找到一个可以放进方法章节的数字,而是让研究问题、抽样对象、分析方法和现实条件彼此匹配。先决定最重要的结论,再判断需要什么样本;如果样本无法支撑原方案,就及时减少比较、简化模型或收窄结论范围。这样得到的研究,通常比“样本数量看起来不少但分析目标过多”的问卷更容易解释,也更经得起方法上的追问。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。