统计术语表

46 个常见统计概念,一句话讲清楚。看不懂输出里的术语时随手一查。

检验

P 值(p-value)
P 值指在原假设为真的前提下,观测到当前或更极端结果的概率。P 值越小,说明数据与原假设越不相容;当 P 值小于预设的显著性水平 α(如 0.05)时拒绝原假设。它并不是原假设为真的概率,也不代表效应大小。
显著性水平 α(significance level)α 水平
显著性水平 α 是研究者在检验前设定的、可容忍的第一类错误概率上限,常取 0.05 或 0.01。当 P 值小于 α 时判定结果统计显著。α 越小,拒绝原假设越保守,但相应会增大第二类错误的风险。
原假设(null hypothesis)H0
原假设通常表示「无效应」或「无差异」的默认命题,例如两组均值相等。假设检验的逻辑是先假定 H0 成立,再判断数据是否提供足够证据将其拒绝。注意「未能拒绝 H0」不等于「H0 为真」。
备择假设(alternative hypothesis)H1
备择假设是与原假设对立的命题,代表研究者想要证实的效应或差异存在。它可以是双侧(如 μ ≠ μ0)或单侧(如 μ > μ0)。拒绝原假设即意味着数据支持备择假设。
第一类错误(Type I error)弃真错误
第一类错误指原假设实际为真时却错误地将其拒绝,即「无中生有」。其发生概率等于显著性水平 α。在医学检验中相当于把健康者误判为患病(假阳性)。
第二类错误(Type II error)取伪错误
第二类错误指原假设实际为假时却未能将其拒绝,即漏掉了真实存在的效应。其概率记为 β,而检验力等于 1−β。样本量过小或效应量过弱都会增大 β。
自由度(degrees of freedom)df
自由度指在计算统计量时可以自由变动的独立数值个数,通常等于样本量减去被估计参数的数量。例如单样本 t 检验的自由度为 n−1。自由度决定了 t、卡方、F 等分布的具体形状。
检验力(statistical power)power / 1−β
检验力指当效应真实存在时,检验能够正确拒绝原假设的概率,等于 1−β。它受效应量、样本量、显著性水平 α 和数据变异共同影响。研究常以 0.80 作为可接受的检验力下限,并据此进行样本量估算。
方差齐性(homogeneity of variance)同方差性
方差齐性指各比较组的总体方差相等,是 t 检验、方差分析等参数方法的重要前提。常用 Levene 检验或 Bartlett 检验来判断;若其 P 值大于 0.05 则认为满足齐性。方差不齐时可改用 Welch 校正。
卡方检验(chi-square test)χ² 检验
卡方检验用于分析分类变量之间的关联或拟合优度,通过比较观测频数与期望频数的差异来计算 χ² 统计量。差异越大,χ² 越大,越倾向拒绝「相互独立」的原假设。使用时要求期望频数不宜过小(一般不低于 5)。
t 检验(t-test)
t 检验用于比较均值,适用于小样本或总体方差未知的情形,包括单样本、独立样本和配对样本三种类型。其统计量服从 t 分布,前提通常是数据近似正态。当样本量很大时 t 分布趋近于正态分布。
F 检验(F-test)
F 检验通过比较两个方差的比值来进行推断,其统计量服从 F 分布。它是方差分析中判断组间差异是否显著的核心,也用于检验回归模型整体的显著性。F 值越大,越倾向拒绝各组均值相等的原假设。
方差分析(ANOVA)变异数分析
方差分析用于比较三个或以上组别的均值是否存在差异,通过分解组间变异与组内变异并计算 F 值来判断。它避免了多次 t 检验导致的第一类错误膨胀。若结果显著,需进一步做事后多重比较确定哪些组不同。
协方差分析(ANCOVA)
协方差分析在方差分析的基础上纳入一个或多个连续协变量,以控制其对因变量的干扰后再比较组间均值差异。它结合了回归与方差分析的思想,能提高检验的精确性和检验力。使用前提之一是回归斜率齐性。
非参数检验(nonparametric test)
非参数检验不依赖总体服从特定分布(如正态)的假设,多基于秩次进行,适用于小样本、偏态数据或有序等级资料。常见方法包括 Mann-Whitney U、Wilcoxon、Kruskal-Wallis 检验。其代价是当数据满足参数条件时检验力略低。
事后多重比较(post-hoc comparison)两两比较
当方差分析发现组间存在显著差异后,事后多重比较用于确定具体是哪些组之间不同。为控制多次比较导致的第一类错误膨胀,常用 Bonferroni、Tukey HSD、Scheffé 等校正方法。它只在总体检验显著后进行。

回归

决定系数 R²(coefficient of determination)R 方
决定系数 R² 表示回归模型中自变量能够解释的因变量方差比例,取值范围 0 到 1。R² = 0.6 意味着模型解释了 60% 的变异。它随自变量增多而不减,故多元回归常参考调整后 R²。
回归系数(regression coefficient)β 系数
回归系数表示在其他自变量不变时,自变量每变化一个单位所引起因变量的平均变化量。非标准化系数带原始量纲,标准化系数(Beta)则可比较不同自变量的相对重要性。其显著性由对应的 t 检验判断。
多重共线性(multicollinearity)
多重共线性指回归模型中多个自变量之间高度相关,导致系数估计不稳定、标准误增大、解释困难。常用方差膨胀因子 VIF 诊断,一般 VIF 大于 10 提示存在严重共线性。可通过剔除变量、主成分或岭回归缓解。
中介效应(mediation)中介变量
中介效应指自变量通过影响某个中间变量(中介变量 M)进而影响因变量,揭示了「为什么」或作用机制。常用 Baron-Kenny 逐步法或 Bootstrap 法检验间接效应。若纳入 M 后直接效应消失则为完全中介。
调节效应(moderation)调节变量
调节效应指第三个变量(调节变量)改变了自变量与因变量之间关系的强度或方向,回答「在什么条件下」。统计上表现为自变量与调节变量的交互项显著。它与中介效应的机制截然不同。

描述

标准差(standard deviation)SD
标准差是方差的算术平方根,用于衡量数据相对于均值的离散程度,单位与原始数据一致。标准差越大,数据分布越分散。它是描述单个变量波动性的核心指标。
正态分布(normal distribution)高斯分布
正态分布是一种对称的钟形连续分布,由均值 μ 和标准差 σ 两个参数决定。其约 68%、95%、99.7% 的数据分别落在均值 ±1、±2、±3 个标准差范围内。许多参数检验都以数据近似正态为前提。
偏度(skewness)
偏度衡量数据分布的不对称程度。正偏(右偏)时右侧尾部更长、均值大于中位数;负偏(左偏)则相反。偏度为 0 表示分布左右对称,如正态分布。
峰度(kurtosis)
峰度衡量数据分布尾部的厚薄与峰的尖锐程度。以正态分布为基准(超额峰度为 0),峰度高表示尖峰厚尾、极端值更多,峰度低表示平峰薄尾。它常与偏度一起用于检查正态性。
相关系数(correlation coefficient)Pearson r
皮尔逊相关系数 r 衡量两个连续变量间线性关系的方向与强度,取值范围为 −1 到 1。绝对值越接近 1 关联越强,0 表示无线性相关。需注意相关不等于因果,且 r 只反映线性关系。
中位数与四分位数(median & quartiles)
中位数是将数据排序后处于正中位置的值,不受极端值影响,适合描述偏态分布的集中趋势。四分位数将数据四等分,第一四分位数 Q1 与第三四分位数 Q3 之间的距离即四分位距 IQR。二者常用箱线图直观呈现。
离群值(outlier)异常值
离群值是明显偏离数据主体的极端观测,可能源于测量误差或真实的特殊个案。常用规则为超出 Q1−1.5×IQR 到 Q3+1.5×IQR 范围,或标准化分数绝对值大于 3。处理前应甄别原因,不可随意删除。
方差(variance)σ²
方差是各数据与均值之差平方的平均,用于衡量数据的离散程度,是标准差的平方。样本方差在计算时除以 n−1(贝塞尔校正)以获得对总体方差的无偏估计。方差单位为原始数据单位的平方。

效应量

效应量(effect size)
效应量是衡量效应实际大小或变量间关联强度的标准化指标,如 Cohen's d、r、η²、OR 等。它不受样本量影响,弥补了 P 值只反映显著性而不反映强度的缺陷。报告效应量已成为现代研究的规范要求。
Cohen's d
Cohen's d 是衡量两组均值差异的标准化效应量,等于均值差除以合并标准差。经验上 0.2、0.5、0.8 分别对应小、中、大效应。它常用于 t 检验结果的效应强度报告。

抽样

置信区间(confidence interval)CI
置信区间是根据样本数据构造的、用于估计总体参数的区间,如 95% CI。其正确含义是:若重复抽样并构造区间,约 95% 的区间会包含真实参数,而非「真值有 95% 概率落在此区间」。区间越窄,估计越精确。
标准误(standard error)SE
标准误是样本统计量(如样本均值)的标准差,衡量该统计量的抽样波动,公式为 SE = SD/√n。它随样本量增大而减小,反映估计的精确程度。注意区分:标准差描述个体离散,标准误描述估计精度。
中心极限定理(central limit theorem)CLT
中心极限定理指出,无论总体分布形状如何,只要样本量足够大,样本均值的抽样分布都近似服从正态分布。这是许多参数检验在大样本下成立的理论基础。通常样本量 n ≥ 30 即可获得较好的近似。
缺失值(missing data)
缺失值指数据集中未被观测或记录的取值。其机制分为完全随机缺失(MCAR)、随机缺失(MAR)和非随机缺失(MNAR),机制不同会影响处理策略。常用方法包括删除法、均值填补和多重插补,其中多重插补通常更稳健。
抽样误差(sampling error)
抽样误差指仅因为用样本而非整个总体进行估计所产生的、统计量与真实参数之间的随机偏差。它随样本量增大而减小,可通过标准误量化。抽样误差不同于因设计缺陷造成的系统性偏倚。

因子分析

信度(reliability)Cronbach's α
信度指测量工具结果的一致性与稳定性,即重复测量得到相近结果的程度。常用克伦巴赫 α 系数评估内部一致性,一般 α 大于 0.7 视为可接受。高信度是高效度的必要而非充分条件。
效度(validity)
效度指测量工具能够真正测到所要测量构念的程度,即测量的准确性。常见类型包括内容效度、结构效度和效标效度。一个测验可以很可信(信度高)却不有效(效度低)。
因子载荷(factor loading)
因子载荷表示某个观测题项与其所属潜在因子之间的相关强度,反映题项对因子的代表程度。载荷绝对值通常要求大于 0.4 或 0.5 才视为有意义。它是判断因子结构和构念效度的关键依据。
KMO 检验(Kaiser-Meyer-Olkin)取样适切性量数
KMO 用于衡量变量间的偏相关程度,判断数据是否适合进行因子分析,取值 0 到 1。一般 KMO 大于 0.7 较为理想,低于 0.5 则不宜做因子分析。它常与 Bartlett 球形检验配合使用。

医学

似然比(likelihood ratio)LR
在假设检验中,似然比检验通过比较两个模型的最大似然值之比来判断拟合优劣。在诊断医学中,似然比则衡量某检验结果改变患病概率的能力:阳性似然比越大、阴性似然比越小,诊断价值越高。
比值比(odds ratio)OR
比值比是暴露组的发病比值(odds)与非暴露组发病比值之比,常用于病例对照研究衡量关联强度。OR 大于 1 表示暴露增加风险,等于 1 表示无关联,小于 1 表示保护作用。当疾病发生率很低时,OR 近似等于相对危险度 RR。
相对危险度(relative risk)RR
相对危险度是暴露组的发病率与非暴露组发病率之比,多用于队列研究评估暴露与结局的关联。RR 大于 1 表示暴露升高发病风险,等于 1 表示无影响。它比 OR 更直观地反映风险倍数,但需要能够直接计算发病率。
风险比(hazard ratio)HR
风险比来自生存分析(如 Cox 比例风险模型),表示暴露组在任一时点发生结局事件的瞬时风险与对照组之比。HR 大于 1 表示风险增加、生存时间缩短。它考虑了随访时间和事件发生的先后,适用于终点事件与时间相关的研究。
敏感度与特异度(sensitivity & specificity)
敏感度指真实患病者中被检验正确判为阳性的比例(真阳性率),反映检出病人的能力。特异度指真实健康者中被正确判为阴性的比例(真阴性率),反映排除健康者的能力。二者常此消彼长,需结合临床目的权衡取舍。
ROC 曲线下面积(AUC)AUROC
AUC 是 ROC 曲线下的面积,综合反映诊断或预测模型区分阳性与阴性的整体能力,取值 0.5 到 1。0.5 相当于随机猜测,越接近 1 区分能力越强,一般 0.7 以上可接受、0.8 以上较好。它不依赖具体的判别临界值。