なぜ標本データではnではなくn-1で割るのか
データが母集団全体ではなく一部の標本にすぎない場合、その標本平均は同じ標本データから計算されているため、データが本来の母集団に対してよりも、標本平均に対してわずかに近く見えてしまう傾向があります。nの代わりにn-1で割ることで、この構造的な過小評価をわずかに補正しています。これは「不偏分散」と呼ばれる補正方法です。
「範囲」が崩れやすく、標準偏差の方が安定している理由
範囲(最大値-最小値)は、データの中で最も極端な2つの値だけに左右され、それ以外のデータをまったく考慮しません。そのため、たった一つの外れ値があるだけで、実際のデータの散らばり具合以上に範囲が大きく見えてしまうことがあります。標準偏差はすべてのデータを計算に反映するため、より安定した散らばりの指標になりますが、極端に偏った分布のデータではやはり解釈が難しくなる点は同じです。
よくある質問
分散と標準偏差は、実用上どう違うのですか?
両者は同じ「散らばり」を表していますが、分散は単位が2乗されている(数学的には便利だが直感的ではない)のに対し、標準偏差は分散の平方根を取って元の単位に戻した数値です。そのため、実際にデータの散らばりを説明するときには、標準偏差の方が使われることが多くなります。
母標準偏差と標本標準偏差、どちらを使えばいいか迷います
データそのものが調べたい対象の全体(たとえば、ある小さな会社の全社員)であれば母標準偏差(nで割る)を使います。データが、より大きな集団を代表する一部分(たとえば、国全体を代表するためのアンケート標本)であれば標本標準偏差(n-1で割る)を使います。