不偏分散の求め方を徹底解説!N-1で割る真の理由とエクセル活用法

不偏分散の求め方を徹底解説!N-1で割る真の理由とエクセル活用法

不偏分散の求め方を徹底解説!N-1で割る真の理由とエクセル活用法にまつわる最新トピックを分かりやすく発信ます。

Q1:なぜ高校の数学Ⅰでは「n」で割る分散しか教わらないのですか?
A1:高校の数学Ⅰにおける「データの分析」は、手元にある確定したデータを整理・要約して特徴を掴む「記述統計」を学ぶ単元だからです。記述統計では目の前のデータそのものが全数であるため、データの個数「n」で割るのが論理的に正しくなります。一方、一部のデータから全体を推測する「推測統計」は高校の「数学B(統計的な推測)」や大学の講義で扱われるため、そこで初めて母分散を推定するための「n-1」で割る不偏分散が登場するという教育課程上の住み分けが理由です。

Q2:エクセルで分散を計算するとき、「VAR」「VAR.P」「VAR.S」のどれを使うのが正解ですか?
A2:2026年現在のExcel環境では、用途に応じて「VAR.S」または「VAR.P」を使用するのが鉄則です。サンプリング調査など手元のデータから全体の分散を推定したい場合は不偏分散である「VAR.S」を、全数データの確定した分散を求めたい場合は「VAR.P」を選択します。古い関数である「VAR」は中身としてはVAR.Sと同じ計算を行いますが、後方互換用として残されているものであり、第三者が見たときに標本分散と混同しやすいため新規のシートでは使用を避けるべきです。

Q3:データ数が非常に多いビッグデータでも、わざわざ「n-1」で割る必要はありますか?
A3:実務上の計算結果という観点だけで言えば、たとえばデータ数が10万件(n=100,000)ある場合、10万で割るのと99,999で割るのとでは小数点第5位以下の極めて微小な差しか生じません。しかし、統計解析ソフトウェアや機械学習のライブラリ(PythonのscipyやRなど)では、推測統計の理論的整合性を保つためにデフォルトで「n-1(自由度 ddof=1)」が採用されています。数値の差異が小さいからといって安易にnで割る処理を行うと、後続の検定処理(t検定など)と前提が食い違う原因になるため、標本抽出である以上はデータ数に関わらず「n-1」で割るルールを徹底することが推奨されます。

鈴木 陽菜
著者

鈴木 陽菜

暮らしを豊かにする便利アイテムや時短アイデアを中心に、実用的な情報をお届けします。