標準偏差はどうやって計算されているのか、5つのステップで理解する

標準偏差を計算するツールは、内部で5つの異なるステップを順番に処理しています。一度手計算でたどってみると、ただの結果の数字ではなく、意味のある数字として見えてきます。

  1. ステップ1:平均値を求める

    データすべての値を合計し、データの個数で割ります。この後のすべてのステップは、この平均値からの「距離」を測ることが目的です。

  2. ステップ2:各データから平均値を引く(偏差)

    各データについて「値-平均」を計算します。プラスになるもの(平均より大きい)とマイナスになるもの(平均より小さい)が混在しますが、全データの偏差を合計すると必ずちょうどゼロになります。

  3. ステップ3:各偏差を2乗する

    2乗することでマイナスの符号が消えるだけでなく、平均から大きく離れた値ほど、その影響がより大きく反映されるようになります。これが、外れ値ひとつで標準偏差が大きく変わる理由です。

  4. ステップ4:2乗した偏差の平均を取る(分散)-nで割るかn-1で割るか

    ここで求まる値が分散です。データがそのまま知りたい対象全体(母集団)であればデータ数nで割ります。データが、より大きな集団を推測するための一部(標本)であれば、n-1で割ります(「不偏分散」と呼ばれる方法で、標本から母集団を推測する際に生じるわずかな過小評価を補正するためのものです)。

  5. ステップ5:分散の平方根を取ると標準偏差になる

    分散は単位が2乗されている(例えば「円の2乗」)ため直感的に解釈しづらい数値です。平方根を取ることで元の単位に戻り、「典型的な値が平均からどれくらい離れているか」を表す、より扱いやすい数字になります。

なぜ標本データではnではなくn-1で割るのか

データが母集団全体ではなく一部の標本にすぎない場合、その標本平均は同じ標本データから計算されているため、データが本来の母集団に対してよりも、標本平均に対してわずかに近く見えてしまう傾向があります。nの代わりにn-1で割ることで、この構造的な過小評価をわずかに補正しています。これは「不偏分散」と呼ばれる補正方法です。

「範囲」が崩れやすく、標準偏差の方が安定している理由

範囲(最大値-最小値)は、データの中で最も極端な2つの値だけに左右され、それ以外のデータをまったく考慮しません。そのため、たった一つの外れ値があるだけで、実際のデータの散らばり具合以上に範囲が大きく見えてしまうことがあります。標準偏差はすべてのデータを計算に反映するため、より安定した散らばりの指標になりますが、極端に偏った分布のデータではやはり解釈が難しくなる点は同じです。

よくある質問

分散と標準偏差は、実用上どう違うのですか?

両者は同じ「散らばり」を表していますが、分散は単位が2乗されている(数学的には便利だが直感的ではない)のに対し、標準偏差は分散の平方根を取って元の単位に戻した数値です。そのため、実際にデータの散らばりを説明するときには、標準偏差の方が使われることが多くなります。

母標準偏差と標本標準偏差、どちらを使えばいいか迷います

データそのものが調べたい対象の全体(たとえば、ある小さな会社の全社員)であれば母標準偏差(nで割る)を使います。データが、より大きな集団を代表する一部分(たとえば、国全体を代表するためのアンケート標本)であれば標本標準偏差(n-1で割る)を使います。