你遇到的问题
问卷或数据库里总有缺失值,你习惯性地把有缺失的个案整行删掉、或者用该变量的均值补上,却隐约担心这样会不会带来偏差、审稿人会不会问「你怎么处理缺失的」,也没弄清多重插补到底比这些老办法好在哪。
适用场景
任何含缺失值的定量数据都涉及这个问题,处理方式的选择取决于缺失机制。MCAR(完全随机缺失)指缺失与任何变量都无关;MAR(随机缺失)指缺失可由已观测变量解释;MNAR(非随机缺失)指缺失与缺失值本身有关(如高收入者更不愿填收入)。判断机制是选方法的前提——现代方法(多重插补、FIML)在 MAR 下即可给出较无偏的估计,而简单删除通常要求更严格的 MCAR 才不至于偏。
正确做法
首先报告每个关键变量的缺失比例,并尽量说明缺失机制的判断依据。方法上,推荐多重插补(MI,生成多套完整数据、分别分析再合并结果)或全信息最大似然(FIML,常用于 SEM),二者在 MAR 假设下能较好地保留不确定性、给出较无偏的估计。应避免用整体均值填补——它人为缩小了变量的方差、低估标准误,使显著性被高估;列删(listwise)在非 MCAR 时会引入偏差且损失样本量。写作时要交代缺失比例、判断的缺失机制和所采用的处理方法。
报告示例:各研究变量的缺失比例在 1.2% 至 6.8% 之间。Little 的 MCAR 检验不显著(χ²=142.3,df=128,p=.18),结合缺失与人口学变量的关联分析,判断缺失近似满足 MAR。据此采用多重插补生成 20 套完整数据集,在每套上分别估计模型后按 Rubin 规则合并,报告合并后的系数与标准误;为对照,同时报告了 FIML 的结果,二者结论一致。
常见错误
错误一:用变量均值填补缺失,看似保住了样本量,实则压低了方差、低估标准误,让本不显著的结果变得显著。错误二:不加说明地整行删除缺失个案(列删),在缺失并非完全随机时既损失样本量又引入选择偏差,且论文里对缺失比例和处理方法只字不提。
需要更进一步?
如果你已经统计出各变量的缺失比例、做了 MCAR 检验或跑了多重插补,却拿不准结果该怎么写、插补几套合适,可以把软件输出整段贴进本站的统计结果解读器,它会帮你把缺失情况和处理方法整理成规范表述。若涉及 MNAR 下的敏感性分析、纵向数据的缺失或插补模型的变量选择这类较棘手的情形,建议预约辅导。