在统计学中,统计插补(),又称缺失值插补或缺失数据插补,是指用替代值替换缺失数据的过程。若替换的是整个数据点,称为单元插补(unit imputation);若替换的是数据点中的某个分量,则称为项目插补(item imputation)。缺失数据会引发三个主要问题:引入大量偏倚、使数据处理和分析更加困难、以及降低统计
。
由于缺失数据会给分析带来困难,插补被视为避免列表删除(listwise deletion)缺陷的一种方式。大多数统计软件默认会丢弃含有缺失值的个案,这可能引入偏倚或影响结果代表性。插补则通过基于其他可用信息估计替代值来保留所有个案。一旦所有缺失值被插补完成,即可使用针对完整数据的标准技术对数据集进行分析。目前常用的缺失数据处理方法包括:热卡插补、冷卡插补、列表删除与成对删除、均值插补、非负矩阵分解、回归插补、末次观测结转(LOCF)、随机回归插补以及多重插补等。
缺失数据的机制
缺失数据的机制通常分为三类。完全随机缺失(MCAR, missing completely at random)指数据缺失与否与任何观测或未观测到的变量无关;随机缺失(MAR, missing at random)指缺失与否依赖于已观测到的变量,但不依赖于未观测的变量;非随机缺失(MNAR, missing not at random)指缺失与否与未观测的变量本身有关。不同插补方法在三种机制下的表现各有差异,多数方法在MAR假设下表现良好,而在MNAR下可能产生偏倚。
列表删除与成对删除
列表删除
列表删除(listwise deletion,亦称完全案例分析)是最常见的缺失数据处理方式,即直接删除含有缺失值的所有个案。若数据为完全随机缺失(MCAR),列表删除不会引入额外偏倚,但会因有效样本量减少而降低统计检验功效。例如1000个样本中有80个含缺失值,删除后有效样本降至920。若缺失机制不是MCAR,列表删除将使剩余样本不再代表总体,从而引入偏倚。
成对删除
成对删除(pairwise deletion,或称可用案例分析)在分析特定变量时仅删除该变量缺失的个案,而在分析其他变量时保留该个案。使用成对删除会导致各参数估计的总样本量不一致,甚至可能产生超过100%的相关等数学上不可能的结果。尽管列表删除和成对删除有诸多缺点,但由于实现简单,它们仍是最流行的缺失数据处理方法。
单值插补
热卡插补
热卡插补(hot-deck imputation)曾是一种常见方法,它从同一数据集中随机选取相似记录的值来填补缺失值。其名称源于穿孔卡片时代——当时正被处理(即“热”的)卡片堆中的数据被用作填补来源。热卡插补的一种特殊形式称为末次观测结转(LOCF, last observation carried forward),即按某变量对数据集排序后,用缺失值上方最近的观测值进行填补。当个案是同一对象在不同时间点的重复测量时,LOCF相当于假设“若某次测量缺失,最合理的猜测是其值与上次测量相同”。然而,LOCF已知会增加偏倚风险并可能导致错误结论,因此不推荐使用。
冷卡插补
冷卡插补(cold-deck imputation)则从另一数据集或历史调查中选择供体值。随着计算能力的提升,更先进的插补方法已基本取代了原始的随机和排序热卡插补技术。冷卡插补适用于跨时间间隔的调查,可以从过去相似项目的回答中获取替换值。
均值插补
均值插补(mean substitution)将缺失值替换为该变量在其他所有个案上的均值。其优点是不改变该变量的样本均值,但缺点是会人为削弱变量之间的相关性——因为插补值与任何其他变量之间必然不存在关联。因此均值插补在单变量分析中具有一定优势,但在多变量分析中存在问题。均值插补可在类别内进行(如按性别分组),是广义回归插补的一个特例。
非负矩阵分解
(NMF)在处理缺失数据时,可以在最小化代价函数的过程中忽略缺失值,而非将其当作零来处理从而引入偏倚。这使得NMF成为一种数学上完备的插补方法。研究表明,在已知NMF分量的情况下,缺失数据对代价函数的影响可降至二阶效应级别。
回归插补
回归插补(regression imputation)使用其他变量建立回归模型,预测含有缺失值的变量。该模型的拟合值即用作缺失值的替代。问题在于插补值不包含误差项,因此所有估计值恰好落在回归线上而无残差方差,导致变量间的关系被高估、插补值的精度也被夸大。所有多重插补方法遵循三个步骤:
多重插补可用于MCAR、MAR乃至MNAR情况,但在MNAR下仍可能存在偏倚。链式方程多重插补(MICE, multiple imputation by chained equations),亦称完全条件设定(fully conditional specification)或序贯回归多重插补,是常用的多重插补方法之一。MICE在设计上针对MAR数据,但模拟研究表明在足够辅助变量的支持下也可处理MNAR数据。
近年来的多重插补方法引入机器学习技术以提升性能。MIDAS(Multiple Imputation with Denoising Autoencoders)使用去噪自编码器——一种无监督神经网络——来学习观测数据的细粒度潜在表示,在精度和效率上优于传统多重插补策略。
相对于单值插补,多重插补计入了插补的不确定性。单值插补将插补值视为真实值,忽视了不确定性,可能导致结果过于精确以及错误的结论。多重插补通过多次插补来描述不确定性及真实值可能取值的范围。此外,多重插补的实现并不困难,多种统计软件均提供了相应工具。例如R语言中的MICE包可执行链式方程多重插补;MIDAS可用R语言的rMIDAS包或Python的MIDASpy包实现。
插补引入的潜在偏倚
插补方法虽有用,但若使用不当或假设不成立,可能引入不同程度的偏倚:
- 均值插补对相关结构的破坏:均值插补人为地将缺失值设为常数,人为削弱或消除变量间的相关性,使多变量分析结果失真。
- 回归插补对方差和精度的扭曲:回归插补使用回归模型的拟合值替代缺失值,不包含误差项,导致估计值落在回归线上而无残差,使变量间关系被过度确定,插补值的精度被高估。
- LOCF的系统性偏倚:末次观测结转假设缺失后的测量值与最后一次观测相同,这在大多数纵向研究中不成立,可能导致治疗效果被高估或低估,增加错误结论的风险。
- 单值插补忽视不确定性:单值插补将插补值当作真实值处理,未反映插补过程的不确定性,会导致置信区间过窄、p值偏小,从而夸大统计显著性。
- 列表删除在非MCAR下的选择偏倚:当缺失机制不是MCAR时,列表删除会使完整样本不再代表总体,产生选择性偏倚。
- MNAR下多重插补的局限性:多重插补通常假设数据为MAR,若实际为MNAR,即使多重插补也可能产生偏倚。
- 模型设定误差:插补结果的准确性依赖于模型的正确设定。若插补模型忽略重要变量或使用错误的函数形式,将产生系统性偏倚。
- 对分布形态的扭曲:大量插补值集中在某一点(如均值)或沿回归线分布,会改变变量的整体分布形态,影响后续统计分析的有效性。
因此,研究者应根据数据缺失机制、变量关系和研究背景谨慎选择插补方法,并对插补结果进行敏感性分析。
参见
- 自助法
- 删失
- 最大期望算法
- 插值
- 矩阵还原
- 最大似然估计
参考文献
评论 (0)