← 返回统计与数据判断力
学习进度6 / 6

辛普森悖论

Simpson's paradox · ST3 分类变量的描述(Describing Categorical Data)

一句话定义

辛普森悖论是分组内的趋势与合并后的总体趋势相反,通常由组大小和分组结构差异造成。

机制 / 原理

辛普森悖论提醒我们:合并数据不是中立动作。若两个群体在难度、风险、基线水平或样本构成上很不同,总体比例会被组大小加权牵着走。一个方案可能在每个子组都更好,但因为更多样本集中在困难子组,合并后看起来反而更差。

辛普森悖论分组内A 都更高合并后A 反而低总体比例会被组大小和难度结构加权改变。
总体比例会被组大小和难度结构加权改变。

经典实验 / 例子

经典教学例子会比较两种治疗在轻症和重症患者中的成功率:A 治疗在轻症、重症内都更高,但 A 接收了更多重症患者,合并成功率可能低于 B。悖论不在算术神秘,而在分组结构被总体数掩盖。

生活中的例子

两位销售分别负责不同难度客户。甲在大客户和小客户中的成交率都高于乙,但甲分到更多难搞的大客户,合并成交率可能看起来更低。此时直接看总成交率会冤枉甲。

常见误区

常见误区是认为总体比例一定比分组比例更客观。当分组变量同时影响机会和结果时,合并数据可能正是误导来源。

资料来源:OpenIntro Statistics; CMU OLI Statistical Reasoning; Online Statistics Education; OpenStax Introductory Statistics 2e,课程内容为原创改写 · 第 ST3
本讲解由 AI 依据该教材与主流学术观点撰写,非逐字引用,仅供学习参考。