写作规范

缺失值怎么处理:删除、均值填补还是多重插补

作者 / 审校:shujufenxi 编辑部·最后审校 2026-07-08

你遇到的问题

问卷或数据库里总有缺失值,你习惯性地把有缺失的个案整行删掉、或者用该变量的均值补上,却隐约担心这样会不会带来偏差、审稿人会不会问「你怎么处理缺失的」,也没弄清多重插补到底比这些老办法好在哪。

适用场景

任何含缺失值的定量数据都涉及这个问题,处理方式的选择取决于缺失机制。MCAR(完全随机缺失)指缺失与任何变量都无关;MAR(随机缺失)指缺失可由已观测变量解释;MNAR(非随机缺失)指缺失与缺失值本身有关(如高收入者更不愿填收入)。判断机制是选方法的前提——现代方法(多重插补、FIML)在 MAR 下即可给出较无偏的估计,而简单删除通常要求更严格的 MCAR 才不至于偏。

正确做法

首先报告每个关键变量的缺失比例,并尽量说明缺失机制的判断依据。方法上,推荐多重插补(MI,生成多套完整数据、分别分析再合并结果)或全信息最大似然(FIML,常用于 SEM),二者在 MAR 假设下能较好地保留不确定性、给出较无偏的估计。应避免用整体均值填补——它人为缩小了变量的方差、低估标准误,使显著性被高估;列删(listwise)在非 MCAR 时会引入偏差且损失样本量。写作时要交代缺失比例、判断的缺失机制和所采用的处理方法。

报告示例:各研究变量的缺失比例在 1.2% 至 6.8% 之间。Little 的 MCAR 检验不显著(χ²=142.3,df=128,p=.18),结合缺失与人口学变量的关联分析,判断缺失近似满足 MAR。据此采用多重插补生成 20 套完整数据集,在每套上分别估计模型后按 Rubin 规则合并,报告合并后的系数与标准误;为对照,同时报告了 FIML 的结果,二者结论一致。

常见错误

错误一:用变量均值填补缺失,看似保住了样本量,实则压低了方差、低估标准误,让本不显著的结果变得显著。错误二:不加说明地整行删除缺失个案(列删),在缺失并非完全随机时既损失样本量又引入选择偏差,且论文里对缺失比例和处理方法只字不提。

需要更进一步?

如果你已经统计出各变量的缺失比例、做了 MCAR 检验或跑了多重插补,却拿不准结果该怎么写、插补几套合适,可以把软件输出整段贴进本站的统计结果解读器,它会帮你把缺失情况和处理方法整理成规范表述。若涉及 MNAR 下的敏感性分析、纵向数据的缺失或插补模型的变量选择这类较棘手的情形,建议预约辅导。

操作步骤

SPSS

  1. 分析→缺失值分析,查看各变量的缺失个数与百分比。
  2. 勾选 EM,输出 Little 的 MCAR 检验(p>0.05 则不能拒绝完全随机缺失假设)与 EM 估计。
  3. 如需多重插补:分析→多重插补→插补缺失数据值,设定插补数(如 20)生成插补数据集。
  4. 在插补数据上运行目标分析,SPSS 会按 Rubin 规则自动汇总(输出的 Pooled 行)。

R

library(mice)
md.pattern(dat) # 缺失模式
imp <- mice(dat, m = 20, method = 'pmm', seed = 123) # 20 个插补集(PMM)
fit <- with(imp, lm(y ~ x1 + x2)) # 各集分别拟合
summary(pool(fit)) # 按 Rubin 规则合并

完整示例(模拟数据)

对含缺失值的数据集进行多重插补,N=250,X2 与 Y 存在缺失(模拟数据样例)。

对含缺失值的数据集(N=250,模拟数据样例)进行处理。缺失分析显示 X2 缺失 12.0%、Y 缺失 8.0%,完整个案占 78.0%。Little 的 MCAR 检验 χ²(15)=18.4,p=0.242,未能拒绝完全随机缺失假设,提示缺失近似 MCAR。采用预测均值匹配(PMM)生成 20 个插补集,分别拟合回归后按 Rubin 规则合并:X1 系数 β=0.31(95% CI [0.19, 0.43],p<0.001),X2 系数 β=0.22(95% CI [0.08, 0.36],p=0.003),结论与完整个案分析一致但更稳健。

统计量数值
X2 / Y 缺失比例12.0% / 8.0%
完整个案比例78.0%
MCAR 检验χ²(15)=18.4,p=0.242
插补数 m(方法)20(PMM)
合并系数 X1(β,95% CI)0.31 [0.19, 0.43]

常见疑问

多重插补 MI 和 FIML 有什么区别?
多重插补(MI)生成多份完整数据集分别分析再合并结果;FIML 在估计模型时直接利用所有可观测信息、不生成填补值,二者在 MAR 假设下通常给出相近且无偏的估计。
MCAR、MAR、MNAR 是什么意思?
MCAR(完全随机缺失)指缺失与任何变量无关;MAR(随机缺失)指缺失可由已观测变量解释;MNAR(非随机缺失)指缺失与未观测值本身有关,最难处理。
为什么不推荐用均值填补或整行删除?
均值填补会低估方差、扭曲相关;成列删除在非 MCAR 时产生有偏估计并损失样本量。现代方法 MI 与 FIML 在 MAR 下更能保持无偏和统计效力。
多重插补应该生成多少个数据集?
传统建议 3-5 个即可,但当缺失比例较高时,生成 20 个或更多可提高估计的稳定性与功效,通常插补份数接近缺失百分比较为稳妥。

参考来源

用统计结果解读器生成结果段落预约辅导

工具输出请自行核对后使用。内容参考见 方法论标准

相关文章

← 返回知识库