インターネット上の解説記事や短尺の学習動画において、「試行回数$n$さえ十分に大きければ、どんな二項分布でも正規分布で近似して良い」という乱暴な説明が散見されますが、これは明確な誤りです。
最大の落とし穴は、「歪度(分布の歪み)」の軽視にあります。二項分布の歪度は次の式で表されます。
$\text{歪度} = \frac{1 - 2p}{\sqrt{np(1-p)}}$
正規分布の歪度は「0(完全な左右対称)」です。上式から明らかなように、$p = 0.5$ であれば分子がゼロになるため、試行回数$n$が小さくても分布は最初から左右対称で、正規近似が極めてスムーズに機能します。しかし、$p = 0.01$(1%の発生率)のような偏ったデータでは分子が $0.98$ と大きく残り、正規分布に十分近づけるためには分母の $n$ を数千〜数万規模まで引き上げなければ対称性が確保されません。
もうひとつの誤解は、「コンピュータが発達した現代、近似計算など時代遅れの遺物ではないか」という極論です。確かに手元のPCでプログラミング言語(PythonやR)を叩けば、数十万回の二項係数も瞬時に計算できます。しかし、数理統計における近似の真価は「単なる計算の効率化」にとどまりません。
未知の母比率を推定する信頼区間の導出や、Webマーケティングにおける比率の差の検定(A/Bテスト)の数式モデルは、すべて「二項分布が正規分布に近似できる」という前提(漸近正規性)の上に成り立っています。この構造理解を欠いたままブラックボックスとして分析ツールを使うと、サンプルサイズが足りない状況で無効な仮説検定を乱用し、誤った意思決定を下すリスクに直結します。