情報量

情報理論における情報量(自己情報量)は次式で定義されます。

\[I(x) = -\log_2 p(x)\]
  • 意味:事象 $X = x$ が実際に起きたときの情報量(驚き度)を表す。$p(x)$ が小さいほど値は大きくなり、$p(x)=1$ なら $0$ になる
  • 符号長との対応:シャノンの情報源符号化定理により、$-\log_2 p(x)$ は事象 $x$ に対する最適符号の理想的な符号長(ビット数)に一致する(ハフマン符号でビット列を作るときの理論的な下限に対応)

エントロピー

情報理論におけるエントロピー平均情報量)は次式で定義されます。

\[H(p) = -\sum_x p(x)\log_2 p(x)\]

エントロピーは、確率分布全体に対する値で情報量($I(x)$)の期待値です。 情報量 $I(x)$ が実現値 $X=x$ に対して事後的に定義されるのに対してエントロピー確率分布全体に対して定義されます。

交差エントロピー

交差エントロピー $H(p,q)$ は、基準の確率分布 $p$ に対する確率分布 $q$ のずれを表します。 交差エントロピーは次の式で定義されます。

\[H(p, q) = \sum_x p(x)\,(-\log_2 q(x))\]

損失と交差エントロピー

LLM の損失として使用する誤差関数交差エントロピーで定義されます。

  • $p$:正解データの確率分布one-hot ベクトル)
  • $q$:モデル予想した確率分布
  • $V$:$x$ の語彙サイズ(vocabulary size)の次元数
  • $k$ を正解ラベルとします。
\[\begin{aligned} i = k \Rightarrow p(x_i) = 1 \\ i \neq k \Rightarrow p(x_i) = 0 \\ H(p, q) = \sum_{i=1}^{V} p(x_i)\,(- \log_2 q(x_i)) \\ = p(x_k)\,(-\log_2 q(x_k)) \\ = -\log_2 q(x_k) \end{aligned}\]

ref. LLMの交差エントロピー誤差とカテゴリカル分布の尤度関数

$p = q$ の交差エントロピー

$p = q$ のとき、$H(p, q) = H(p)$ になります。

\[p = q \Rightarrow H(p, q) = \sum_x p(x)\,(-\log_2 p(x)) = H(p)\]

KLダイバージェンス

確率分布 $p$ と $q$ の近さを表し次の式で定義されます。

\[D_{\mathrm{KL}}(p \parallel q) = \sum_{x} p(x) \log_2 \frac{p(x)}{q(x)}\]

KLダイバージェンスは後述する交差エントロピーを使った次の式でも定義できます。

\[\begin{aligned} H(p,q) = H(p) + D_{\mathrm{KL}}(p \parallel q) \\ D_{\mathrm{KL}}(p \parallel q) = H(p, q) - H(p) \end{aligned}\]

$p = q$ のとき $D_{\mathrm{KL}}(p \parallel q)$ は $0$ です。

\[\begin{aligned} p = q \Rightarrow H(p,q) = H(p) \\ D_{\mathrm{KL}}(p \parallel q) = H(p, q) - H(p) = H(p) - H(p) = 0 \end{aligned}\]