合并方差公式推导详解:掌握核心步骤与计算技巧

合并方差公式推导:从直觉到严谨的数学证明

在统计学、机器学习以及数据分析领域,我们经常面临这样一个场景:手头有两组独立的数据样本,我们需要计算它们合并后的整体方差。虽然可以直接将两组数据拼接后重新计算,但在大数据处理或流式计算中,这种“重新遍历”的方式效率极低。 因此,掌握合并方差(Pooled Variance 或 Combined Variance)的公式及其推导过程,不仅是统计学的基础要求,更是提升算法效率的关键。本文将深入探讨这一公式的推导逻辑,并通过表格案例加以验证。

一、 问题定义与符号说明

假设我们有两个独立的样本数据集:
  • 样本 1:大小为 ,均值为 ,方差为 (通常指样本方差,分母为 ;若为总体方差,分母为 。下文推导以总体方差 为例,结论同样适用于样本方差的加权平均形式,需注意自由度修正)。
  • 样本 2:大小为 ,均值为 ,方差为 。
我们的目标是求出合并后的数据集(总大小 )的合并均值 和 合并方差 。 注意:在统计学中,“合并方差”有时特指假设两总体方差相等时的加权平均估计量(Pooled Variance for t-test),而此处我们讨论的是更通用的两个独立集合合并后的总体方差计算。

符号汇总表

符号 含义 备注
两个样本的样本量 正整数
两个样本的均值
两个样本的方差
合并后的总样本量
合并后的总均值 加权平均
合并后的总方差 待推导目标

二、 核心公式预览

在推导之前,我们先给出最终结论,以便在推导过程中对照理解。 1. 合并均值: 2. 合并方差(关键公式): 其中,,。 或者写作更直观的形式:

三、 逐步推导过程

第一步:推导合并均值

合并均值是所有数据之和除以总个数。 根据均值定义: 因此: 这一步非常直观,即加权平均。

第二步:展开合并方差的定义

合并方差的定义为: 我们将求和分为两部分(来自样本1和样本2):

第三步:引入“技巧性”加减项

为了利用已知的 和 ,我们需要在平方项中插入组均值 和 。 对于第一项中的 ,我们写成: 令 ,则: 展开平方项:

第四步:对样本1部分求和

现在对 到 求和: 逐项分析: 1. 第一项: (根据方差定义)。 2. 第二项:。因为 ,所以这一项为 0。 3. 第三项: 是常数,加 次,即 。 因此,样本1部分的总和为: 同理,样本2部分的总和为:

第五步:合并结果

将两部分代回 的公式: 整理得到最终公式: 公式解读: 合并方差由两部分组成: 1. 组内方差(Within-group variance):各组方差的加权平均。 2. 组间方差(Between-group variance):各组均值与总均值偏差的加权平均。这反映了数据分布中心分散程度对整体方差的贡献。

四、 数值验证案例

为了验证上述公式的正确性,我们构建一个简单的数据集进行计算。

数据集设定

样本 1: 样本 2: 合并数据集:

方法一:直接计算合并方差

1. 计算总均值: 2. 计算总方差:

方法二:使用合并方差公式

1. 计算总均值(验证): 2. 计算组内方差加权项: 3. 计算组间方差贡献项: 4. 合并结果:

验证结论表

计算方法 总均值 总方差 结果一致性
直接法(暴力计算) 8 18.67 ✅ 一致
合并公式法(分解计算) 8 18.67 ✅ 一致

五、 实际应用中的注意事项

1. 样本方差 vs 总体方差

上述推导基于总体方差(分母为 )。如果在统计推断中使用样本方差(分母为 ),公式会有所不同。 若 和 是样本方差,合并后的样本方差 通常用于双样本 t 检验,其公式为: 这被称为合并方差估计量(Pooled Variance Estimator),它假设两个总体方差相等。 若只是单纯想计算合并后数据集的样本方差(分母为 ),则不能简单加权,而应使用之前推导的平方和关系: 其中 为离差平方和。最后除以 即可。

2. 数值稳定性

在计算机编程中,直接使用 计算方差可能导致 catastrophic cancellation (灾难性抵消),特别是在数据值很大但方差很小时。 使用Welford算法或本文推导的增量更新公式(基于均值和平方和)通常具有更好的数值稳定性。

3. 多于两组数据

该公式可以递归推广到 组数据。只需依次合并,或者一次性计算所有组的加权平方和与均值偏差平方和。

六、 总结

合并方差公式的推导揭示了方差分解的核心思想:总变异 = 组内变异 + 组间变异。 组内变异反映了数据在各自群体内部的离散程度。 组间变异反映了不同群体中心位置差异带来的额外离散程度。 掌握这一推导过程,不仅有助于理解方差分析的底层逻辑,也为大数据环境下的高效统计计算提供了理论支持。在实际应用中,请务必区分“总体方差”与“样本方差”的定义,选择合适的公式变体。