ベルヌーイ分布 | 確率・統計
結果が 2 通りしか存在しない試行(ベルヌーイ試行)を 1 回だけ行ったときの確率分布1をベルヌーイ分布と呼びます。
確率変数が成功 = 1 、失敗 = 02 のベルヌーイ分布は以下とおりです。
ベルヌーイ分布の期待値
ベルヌーイ分布の期待値 $E[X]$ は p です。
\[\begin{aligned} E[X] = (0 \times P(X=0)) + (1 \times P(X=1)) \\ E[X] = (0 \times (1-p)) + (1 \times p) = p \end{aligned}\]ベルヌーイ分布の最尤度
ベルヌーイ試行の観測値を ${x_1, x_2, .. x_n}$ とします3。
ベルヌーイ分布の尤度関数は以下のとおりです。
\[\begin{aligned} L_D(p) &= \prod_{i=1}^{n} P(X = x_i) \\ &= \prod_{i=1}^{n} p^{x_i}(1-p)^{1-x_i} \end{aligned}\]$L_D$ の $D$ は観測データ Data の略です。確率モデルにおいて実際に観測されたデータ Data の集まり(サンプル)を $D = {x_1, x_2, \dots, x_n}$ と表記することが多く、そのデータ全体が得られる確率(尤度:ゆうど)を表すため、$L_D(p)$)という形で $D$ が添え字に使われます。
負の対数尤度関数
効率的に計算するために負の対数尤度を求めます。
\[\begin{aligned} -\log L_D(p) &= -\log \prod_{i=1}^{n} P(X = x_i) \\ &= -\sum_{i=1}^{n} \log P(X = x_i) \\ &= -\sum_{i=1}^{n} \log p^{x_i}(1-p)^{1-x_i} \\ &= -\sum_{i=1}^{n} \left( x_i \log p + (1-x_i)\log(1-p) \right) \end{aligned}\]上記は 2 クラス分類のニューラルネットワークの損失関数の形( 2 クラスの場合の交差エントロピー)です。
最尤推定量
最尤推定量は負の対数尤度の最小値で以下を満たします。
\[\frac{d}{dp}\left(-\log L_D(p)\right) = 0\] \[\begin{aligned} \frac{d}{dp}\left(-\log L_D(p)\right) &= -\sum_{i=1}^{n} \left( x_i \frac{d}{dp}\log p + (1-x_i)\frac{d}{dp}\log(1-p) \right) \\ &= -\sum_{i=1}^{n} \left( \frac{x_i}{p} - \frac{1-x_i}{1-p} \right) \\ &= -\sum_{i=1}^{n} \frac{x_i - p}{p(1-p)} \\ &= -\frac{1}{p(1-p)} \left( \sum_{i=1}^{n} x_i - p\sum_{i=1}^{n} 1 \right) \\ &= \frac{1}{p(1-p)} \left( np - \sum_{i=1}^{n} x_i \right) \end{aligned}\]となるため、
\[\frac{1}{p(1-p)} \left( np - \sum_{i=1}^{n} x_i \right) = 0\]を $p$ について解き、$p$ の最尤推定量として、
\[\hat{p} = \frac{1}{n} \sum_{i=1}^{n} x_i\]が得られます。
ベルヌーイ分布と二項分布の最尤推定量の関係
※ ベルヌーイ試行をベースにした確率分布(ベルヌーイ分布・二項分布など)において、最も尤もらしい確率 $p$ を最尤法で求めると、データの持ち方がどうあれ、最終的には必ずデータの平均値(標本平均)に一致します。
\[\frac{1}{n}\sum_{i=1}^{n} x_i \iff \frac{x}{N}\]