アキュラシーという指標には、初学者が必ず直面する致命的な落とし穴(Accuracy Paradox)が存在します。それは「データの偏り(不均衡データ)」がある環境では、アキュラシーの数値が全くあてにならなくなるという点です。
具体例として、1万個に1個の割合で発生する工場の不良品検知ラインを想定します。1万個の製品データのうち、正常品が9,990個、不良品が10個含まれているとします。
ここで、「入力されたすべての製品を無条件で『正常品』と答える」という、中身が完全に無能なAIモデルを作ったとします。このモデルを評価するとどうなるでしょうか。
1万個中9,990個の正常品をすべて「正常」と当てているため、アキュラシーの計算式に当てはめると `9,990 ÷ 10,000 = 0.999`、つまり正解率99.9%という驚異的なハイスコアを叩き出してしまいます。しかし、肝心の不良品10個は1つも検出できておらず、実務では一切役に立ちません。
このように、発生頻度が極めて低い事象(クレジットカードの不正利用検知、工場の異品検査、希少疾患の診断など)を扱う場合、アキュラシーの高さを根拠にモデルの優秀さを語ることは非常に危険です。