问卷回收后,某些变量总会出现空白;实验中也可能因为设备、漏答或中途退出留下缺失记录。面对缺失值,研究者最常问的是“删掉还是填补”。但如果跳过了缺失为什么发生这一步,任何处理都可能在不知不觉中改变估计。量化研究中真正需要先回答的,不是哪个方法更流行,而是数据缺失更接近哪一种机制。

先判断缺失从何而来

缺失机制通常被分为三类。完全随机缺失意味着某个值是否缺失与数据中任何变量都无关。比如问卷装订错误导致整页未被看到,或纯粹随机漏答,既不由受访者特征决定,也不由缺失值本身大小决定。随机缺失则更常见:缺失概率与已经观测到的变量有关,但在控制这些变量后,与未观测值本身没有系统关联。例如女性更可能不报告收入,但性别是已知的;在同一性别内部,是否报告收入与收入水平没有明显关系。非随机缺失最为棘手,它意味着缺失概率与未观测值本身有关。高收入者更不愿填写收入、健康状况差的人更可能跳过健康题,都属于这一类。

机制判断不能简化成跑一个统计检验。常用统计检验只能提供间接证据,拒绝完全随机缺失不等于就能区分随机缺失与非随机缺失;不拒绝也不等于证明完全随机缺失,还可能受到样本量影响。研究者需要结合变量含义、调查流程和缺失来源做判断。敏感变量、自报收入、成绩或健康指标,应更警惕非随机缺失;背景变量较齐全且缺失与分组特征有关时,随机缺失的假设往往更合理。

删除、单一插补与多重插补的边界

完整案例分析只保留所有变量都齐全的样本。若缺失确实属于完全随机缺失,删除后估计通常仍无偏,主要代价是样本量减少、标准误变大、检验功效下降。当缺失比例较高或样本本身不大时,这种效率损失会影响结论稳定性。若缺失属于随机缺失且与模型中的解释变量有关,直接删除可能改变样本构成,使估计产生偏误。配对删除虽然能保留更多样本,但不同分析基于不同案例集合,估计之间的一致性会下降,无法替代机制判断。

均值或中位数插补看似方便,却会压缩变量分布。填补后该变量的标准差被人为缩小,与其他变量的相关关系也可能被削弱,后续标准误和置信区间都会受到影响。回归插补利用观测变量预测缺失值,比均值插补更能保留变量间关系,但它把预测值当作真实观测值使用,忽略了预测误差和插补不确定性,容易让标准误偏小、显著性被高估。回归插补在随机缺失下可能比删除或均值插补更合理,但仍不适合作为最终分析的主要依据,尤其是需要报告不确定性的时候。

多重插补建立在随机缺失假设上。它不只为每个缺失值生成一个填补值,而是根据观测变量和缺失模式生成多个完整数据集,分别估计后再合并结果。这样做能够把插补不确定性和抽样波动纳入标准误,变量间关系也更少被人工扭曲。要发挥这一优势,插补模型中需要纳入与缺失机制和后续分析相关的变量;如果遗漏了影响缺失的观测变量,估计仍可能有偏。多重插补也并非适用于所有情况。一旦缺失属于非随机缺失,再精细的插补模型也无法从观测数据中找回未观测值本身的系统差异,只能借助敏感性分析或明确说明局限。

把机制判断转化为处理路径

面对具体数据,研究者可以先看缺失规模和分布:哪些变量缺失较多,是否有整块缺失,样本是否足够。缺失很少且样本较大时,许多策略的差异不会太大;问题在于缺失比例不低或集中在关键变量上。接着判断机制:若能合理假定完全随机缺失,完整案例分析或简单插补可以作为一种透明且容易解释的处理方式,但需要报告样本损失。若更接近随机缺失,且缺失比例不低,应优先考虑多重插补,并把可能解释缺失的观测变量纳入插补模型。若怀疑非随机缺失,则不能声称插补已经消除偏误;此时更诚实的做法是进行敏感性分析,改变缺失假设看结论是否稳定,或在文中明确说明结果可能受缺失机制影响的方向和幅度。

无论采用哪种策略,论文中都应报告缺失比例、缺失模式、所依据的机制假设以及处理方式。读者需要的不是一个“正确”答案,而是判断依据是否充分、处理与假设是否一致。只要把缺失机制放到策略之前,即使无法完全消除偏误,也能让研究结论更可解释。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。