情報量

情報理論における自己情報量(情報量)は次式で定義されます。

\[I(x) = -\log_2 p(x)\]
  • 意味:事象 $X = x$ が実際に起きたときの情報量(驚き度)を表す。$p(x)$ が小さいほど値は大きくなり、$p(x)=1$ なら $0$ になる。
  • 符号長との対応:シャノンの情報源符号化定理により、$-\log_2 p(x)$ は事象 $x$ に対する最適符号の理想的な符号長(ビット数)に一致する。

エントロピー(平均情報量)

情報理論におけるエントロピーは次式で定義されます。

\[H(p) = \sum_x p(x)\,(-\log_2 p(x))\]

エントロピーは、確率分布全体に対する値で情報量($I(x))の期待値です。 情報量 I(x) がある実現値 $X=x$ に事後的に定義されるのに対してエントロピーは確率分布全体に対して定義されます。

交差エントロピー

交差エントロピー $H(p,q)$ は基準の確率分布 p に対して確率分布 q がどの程度ずれているかを表します。 交差エントロピーは次の式で定義されます。

\[H(p, q) = \sum_x p(x)\,(-\log_2 q(x))\]

one-hot ベクトルの交差エントロピー

Deep Learning の $p$ が one-hot ベクトルの場合が交差エントロピーは次式で定義されます。 $k$ が正解ラベルとします。

\[\begin{aligned} i = k \Rightarrow p(x_i) = 1 \\ i \neq k \Rightarrow p(x_i) = 0 \\ H(p, q) = \sum_x p(x)\,(- \log_2 q(x)) \\ = p(x_k)\,(-\log_2 q(x_k)) \\ = -\log_2 q(x_k) \end{aligned}\]
  • $p$:正解データの確率分布(one-hot ベクトル)
  • $q$:モデル予想した確率分布

$p = q$ の交差エントロピー

$p = q$ のとき、$H(p, q) = H(p)$ になります。

\[p = q \Rightarrow H(p, q) = \sum_x p(x)\,(-\log_2 p(x)) = H(p)\]

KLダイバージェンス

確率分布 p と q の近さを表し次の式で定義されます。

\[D_{\mathrm{KL}}(p \parallel q) = \sum_{x} p(x) \log_2 \frac{p(x)}{q(x)}\]

KLダイバージェンスは後述する交差エントロピーを使った次の式でも定義できます。

\[\begin{aligned} H(p,q) = H(p) + D_{\mathrm{KL}}(p \parallel q) \\ D_{\mathrm{KL}}(p \parallel q) = H(p, q) - H(p) \end{aligned}\]

$p = q$ のとき $D_{\mathrm{KL}}(p \parallel q)$ は $0$ です。

\[\begin{aligned} p = q \Rightarrow H(p,q) = H(p) \\ D_{\mathrm{KL}}(p \parallel q) = H(p, q) - H(p) = H(p) - H(p) = 0 \end{aligned}\]