サンプルデータの生成

サンプルデータの生成

サンプルデータの生成の注目されている理由をコンパクトにまとめました。全体像を一目で把握できます。

統計学における統計 外れ値 定義とは、「測定されたデータ群の中で、他の大多数の観測値から極端に離れた値」を指します。平均値や標準偏差を用いた分析では、たった1つの極端な数値によって全体像が大きく歪んでしまう弱点がありますが、これを補うために重用されるのが順位に基づいた要約統計量です。

箱ひげ図は、データを小さい順に並べ替えたときの位置をもとに、以下の5数要約を可視化します。

まず基礎となるのが四分位数 求め方です。全データを昇順に整列させ、下から25%の位置にある数値を「第1四分位数(Q1)」、50%の中央値を「第2四分位数(Q2)」、75%の位置にある数値を「第3四分位数(Q3)」と呼びます。このQ3からQ1を差し引いた区間を四分位範囲 IQR(Interquartile Range)と呼び、データの中央50%が集まる「ばらつきの幅」を表します。

箱ひげ図において、箱の上下(または左右)に伸びる線の終端を決定するのが箱ひげ図 ひげの長さ 基準です。一般的には、Q1およびQ3から「IQRの1.5倍」伸ばした境界線(フェンス)の内側にある最も極端な実データまでひげを伸ばします。そして、この境界線を越えたデータはひげに含めず、独立した箱ひげ図 外れ値 点としてシンボル表示するルールが定着しています。

森 瞳
著者

森 瞳

暮らしを豊かにする便利アイテムや時短アイデアを中心に、実用的な情報をお届けします。