标准差到底是怎么算出来的?五个步骤讲清楚

标准差计算工具在背后其实是按五个独立步骤依次处理的。自己动手按步骤算一遍之后,这个数字就不再只是一个结果,而是真正有意义的东西。

  1. 第一步:求平均值

    把所有数据加起来,除以数据的个数。后面所有步骤,本质上都是在衡量每个数据点与这个平均值之间的"距离"。

  2. 第二步:每个数据分别减去平均值(离均差)

    对每一个数据点计算"数值-平均值"。有的结果是正数(高于平均值),有的是负数(低于平均值),但把整组数据的离均差加起来,结果一定正好是零。

  3. 第三步:把每个离均差平方

    平方运算不仅去掉了负号,更重要的是,离平均值越远的数据点,平方后对结果的影响会被放大得越多——这也是为什么一个极端值就能明显拉高标准差的原因。

  4. 第四步:求平方后离均差的平均值(方差)——除以n还是n-1

    这一步算出来的就是方差。如果手头的数据就是你关心的整个总体,除以数据个数n,得到总体方差。如果手头数据只是从更大的总体中抽取的一部分样本,则要除以n-1(这种方法叫做"贝塞尔校正"),用来修正用样本估计总体时天然存在的轻微低估问题。

  5. 第五步:对方差开平方根,得到标准差

    方差的单位是原单位的平方(比如"元的平方"),不太直观。开平方根之后,数值重新回到原来的单位,变成一个更容易理解的数字——大致表示"典型数据点距离平均值有多远"。

为什么样本数据要除以n-1,而不是n

当手头的数据只是一个样本而不是完整总体时,样本均值本身就是从这批样本数据计算出来的,这会导致样本数据看起来比它们相对于真实总体均值的实际离散程度更"集中"一些。用n-1代替n作分母,会让计算结果略微放大一点,正好用来修正这种结构性的低估,这个做法被称为"贝塞尔校正"。

为什么"极差"这么容易失真,而标准差相对更稳定

极差(最大值减最小值)完全取决于数据中最极端的两个值,完全不考虑其他数据的分布情况,所以哪怕只出现一个异常值,极差看起来也可能比数据实际的离散程度大得多。标准差把每一个数据点都纳入了计算,是相对更稳定的离散程度指标,不过遇到严重偏态分布的数据时,标准差同样会变得不太好直接解读。

常见问题

方差和标准差在实际使用中有什么区别?

两者衡量的是同一种"离散程度",但方差的单位是原始单位的平方(数学上有用,但不直观),标准差是方差开平方根之后的结果,回到了原始单位。所以在实际描述数据的离散情况时,人们通常更习惯直接使用标准差这个数字。

什么时候该用总体标准差,什么时候该用样本标准差?

如果手头的数据就是你关心的整个群体本身(比如一家小公司的全部员工数据),用总体标准差(除以n)。如果手头数据只是从更大群体中抽取出来、用来代表整体情况的一部分(比如用来推断全国情况的一份问卷样本),用样本标准差(除以n-1)。