为什么样本数据要除以n-1,而不是n
当手头的数据只是一个样本而不是完整总体时,样本均值本身就是从这批样本数据计算出来的,这会导致样本数据看起来比它们相对于真实总体均值的实际离散程度更"集中"一些。用n-1代替n作分母,会让计算结果略微放大一点,正好用来修正这种结构性的低估,这个做法被称为"贝塞尔校正"。
为什么"极差"这么容易失真,而标准差相对更稳定
极差(最大值减最小值)完全取决于数据中最极端的两个值,完全不考虑其他数据的分布情况,所以哪怕只出现一个异常值,极差看起来也可能比数据实际的离散程度大得多。标准差把每一个数据点都纳入了计算,是相对更稳定的离散程度指标,不过遇到严重偏态分布的数据时,标准差同样会变得不太好直接解读。
常见问题
方差和标准差在实际使用中有什么区别?
两者衡量的是同一种"离散程度",但方差的单位是原始单位的平方(数学上有用,但不直观),标准差是方差开平方根之后的结果,回到了原始单位。所以在实际描述数据的离散情况时,人们通常更习惯直接使用标准差这个数字。
什么时候该用总体标准差,什么时候该用样本标准差?
如果手头的数据就是你关心的整个群体本身(比如一家小公司的全部员工数据),用总体标准差(除以n)。如果手头数据只是从更大群体中抽取出来、用来代表整体情况的一部分(比如用来推断全国情况的一份问卷样本),用样本标准差(除以n-1)。