情報量、エントロピー、交差エントロピー
情報量
情報理論における自己情報量(情報量)は次式で定義されます。
\[I(x) = -\log_2 p(x)\]- 意味:事象 $X = x$ が実際に起きたときの情報量(驚き度)を表す。$p(x)$ が小さいほど値は大きくなり、$p(x)=1$ なら $0$ になる。
- 符号長との対応:シャノンの情報源符号化定理により、$-\log_2 p(x)$ は事象 $x$ に対する最適符号の理想的な符号長(ビット数)に一致する。
エントロピー(平均情報量)
情報理論におけるエントロピーは次式で定義されます。
\[H(p) = \sum_x p(x)\,(-\log_2 p(x))\]エントロピーは、確率分布全体に対する値で情報量($I(x))の期待値です。 情報量 I(x) がある実現値 $X=x$ に事後的に定義されるのに対してエントロピーは確率分布全体に対して定義されます。
交差エントロピー
交差エントロピー $H(p,q)$ は基準の確率分布 p に対して確率分布 q がどの程度ずれているかを表します。 交差エントロピーは次の式で定義されます。
\[H(p, q) = \sum_x p(x)\,(-\log_2 q(x))\]one-hot ベクトルの交差エントロピー
Deep Learning の $p$ が one-hot ベクトルの場合が交差エントロピーは次式で定義されます。 $k$ が正解ラベルとします。
\[\begin{aligned} i = k \Rightarrow p(x_i) = 1 \\ i \neq k \Rightarrow p(x_i) = 0 \\ H(p, q) = \sum_x p(x)\,(- \log_2 q(x)) \\ = p(x_k)\,(-\log_2 q(x_k)) \\ = -\log_2 q(x_k) \end{aligned}\]- $p$:正解データの確率分布(one-hot ベクトル)
- $q$:モデル予想した確率分布
$p = q$ の交差エントロピー
$p = q$ のとき、$H(p, q) = H(p)$ になります。
\[p = q \Rightarrow H(p, q) = \sum_x p(x)\,(-\log_2 p(x)) = H(p)\]KLダイバージェンス
確率分布 p と q の近さを表し次の式で定義されます。
\[D_{\mathrm{KL}}(p \parallel q) = \sum_{x} p(x) \log_2 \frac{p(x)}{q(x)}\]KLダイバージェンスは後述する交差エントロピーを使った次の式でも定義できます。
\[\begin{aligned} H(p,q) = H(p) + D_{\mathrm{KL}}(p \parallel q) \\ D_{\mathrm{KL}}(p \parallel q) = H(p, q) - H(p) \end{aligned}\]$p = q$ のとき $D_{\mathrm{KL}}(p \parallel q)$ は $0$ です。
\[\begin{aligned} p = q \Rightarrow H(p,q) = H(p) \\ D_{\mathrm{KL}}(p \parallel q) = H(p, q) - H(p) = H(p) - H(p) = 0 \end{aligned}\]