{{about|統計學上导致结果与事实之间存在差异的系统性倾向的偏差()|别称“-{偏差}-”的离差()|离差|心理認知上的偏差|認知偏差|社會學的偏差|偏差行為}}
在统计学中,偏差()是指会导致结果与事实之间存在差异的系统性倾向。数据分析的许多过程,包括数据的来源、选择的估计量和分析数据的方式,都可能存在偏差。偏差具有重要的现实影响,因为数据被用于社会各领域的决策制定——从法律制定、行业监管到企业营销和机构政策。例如,若一家制药公司仅以男性为样本测试感冒药的疗效,其结论将无法推广至一般人群。
偏差不同于其他统计错误,如仪器不准确(精密度问题)、数据缺失或转录错误。偏差意味着数据的选择过程本身存在系统性的倾斜。偏差并不排除其他错误同时存在:一个研究可能同时存在设计不佳的样本、不准确的测量设备和记录中的笔误。
估计量的偏差
设 T 为用于估计参数 \theta 的统计量,\operatorname{E}(T) 为 T 的期望值,则 T 的偏差定义为:
:\operatorname{bias}(T, \theta) = \operatorname{E}(T) - \theta
若 \operatorname{bias}(T, \theta) = 0,则称 T 为 \theta 的无偏估计量;否则称为有偏估计量。无偏估计量在理论上更受青睐,但有偏估计量在实践中也经常使用。有偏估计量可能更容易计算,或在均方误差意义上优于无偏估计量。
偏差的类型
数据选择阶段
- 抽样偏差(selection bias):某些个体被选入研究的概率高于其他个体,导致样本不能代表总体。
- 谱系偏差(spectrum bias):在偏倚的患者样本上评估诊断测试,导致对灵敏度和特异度的高估。
- 志愿者偏差(volunteer bias):志愿者具有与目标人群不同的内在特征。
- 回忆偏差(recall bias):参与者对过去事件的记忆在准确性或完整性上存在差异,导致高估或低估。
- 损耗偏差(attrition bias):研究过程中参与者的流失导致样本结构改变。
分析估计阶段
- 检测偏差(detection bias):某一现象在特定研究对象的检测中被更频繁地发现。例如,医生可能更倾向于在肥胖患者中筛查糖尿病,导致该群体中的糖尿病检出率被高估。
- 观察者偏差(observer bias):研究者的主观预期或认知偏差在不知不觉中影响实验的执行或结果记录。
偏差的应对
研究者可以在数据收集和分析的各个阶段采取措施以减少偏差。首先,应在研究设计阶段明确研究参数并考虑研究团队的构成。单盲或双盲实验可有效减少观察者偏差。避免p值操纵(p-hacking)——即反复分析数据直至获得显著性结果——是确保数据准确性的关键。此外,在报告结果时应谨慎使用语言,避免将「接近显著」的结果当作实质性发现来表述。
参见
- 系统性偏差
- 准确与精密
- 估计量的偏差
- 偏差样本
- 认知偏差
参考文献
评论 (0)