数学の文脈での 勾配

多変数関数 $f(x_1, x_2, \ldots, x_n)$ の各変数に対する偏微分をベクトルにまとめたものです。

\[\nabla f = \left( \frac{\partial f}{\partial x_1}, \frac{\partial f}{\partial x_2}, \ldots, \frac{\partial f}{\partial x_n} \right)\]

Deep Learning の文脈での 勾配

損失 $L$ に対する各パラメータの偏微分を指します。

\[\frac{\partial L}{\partial W}, \quad \frac{\partial L}{\partial b}, \quad \ldots\]

連鎖律を使って $L$ から逆向きに辿った結果が「勾配」です。


Deep Learning では $L$ が基準

目的がパラメータを更新して $L$ を小さくすることなので $L$ に対する偏微分だけが意味を持ちます。

\[W \leftarrow W - \eta \frac{\partial L}{\partial W}\]

単なる偏微分係数(例:$\frac{\partial c_t}{\partial f}$ )は途中計算に過ぎず「勾配」とは呼ばないのが一般的です。

まとめ

文脈 勾配 の意味
数学 多変数関数の偏微分をベクトルにまとめたもの( $\nabla f$ )
Deep Learning 損失 $L$ に対する連鎖律の結果( $\frac{\partial L}{\partial W}$ など)