なぜ成り立つ?イェンゼンの不等式の直感理解から証明・Ai応用まで

なぜ成り立つ?イェンゼンの不等式の直感理解から証明・Ai応用まで

なぜ成り立つ?イェンゼンの不等式の直感理解から証明・Ai応用までについて重要なポイントを解説いたします。最新の情報をご覧ください。

現代の人工知能技術や統計的機械学習の数理基盤において、イェンゼンの不等式は中心的な役割を果たしています。特に欠かせないのが、カルバック・ライブラー情報量(KLダイバージェンス)の非負性証明と、潜在変数モデルの学習に用いられるEMアルゴリズム(Expectation-Maximization Algorithm)です。

2つの確率分布 $P(x)$ と $Q(x)$ の差異を測る尺度であるKL情報量は、次のように定義されます。

$$D_{\mathrm{KL}}(P \parallel Q) = \sum_{x} P(x) \log \frac{P(x)}{Q(x)} = \mathbb{E}_{P}\left[ -\log \frac{Q(X)}{P(X)} \right]$$

ここで $f(t) = -\log t$ が凸関数であることを利用し、イェンゼンの不等式を適用すると以下の関係が導かれます。

$$D_{\mathrm{KL}}(P \parallel Q) \ge -\log \mathbb{E}_{P}\left[ \frac{Q(X)}{P(X)} \right] = -\log \sum_{x} P(x) \frac{Q(x)}{P(x)} = -\log \sum_{x} Q(x) = -\log(1) = 0$$

これにより、「いかなる確率分布に対しても $D_{\mathrm{KL}}(P \parallel Q) \ge 0$ であり、$P = Q$ のときに限りゼロになる」という情報理論の基本定理(ギブスの不等式)が証明されます。

さらに、混合ガウスモデル(GMM)の推定や、深層生成モデルである変分オートエンコーダ(VAE)の訓練目的関数として知られる「証拠下界(ELBO: Evidence Lower Bound)」の導出においても、対数尤度 $\log P(X)$ の下界を構成するためにイェンゼンの不等式が直接利用されています。複雑な事後分布を直接計算できない場合でも、不等式によって扱いやすい下界関数を作り出し、それを最大化することで最適解へと近似していくアルゴリズム設計の要となっているのです。

斉藤 蓮
著者

斉藤 蓮

シンプルで洗練された住まいづくりとインテリアコーディネートのアイデアを提案しています。