深層学習モデル、特に深い層を持つニューラルネットワークは高い予測性能を発揮する一方で、「なぜその予測に至ったのか」を人間が理解しにくい、いわゆるブラックボックスであるという課題を抱えています。説明可能AI(XAI: eXplainable AI)は、この課題に取り組む分野です。

1. 用語の整理

用語 意味
Interpretability(解釈可能性) モデルの内部構造・パラメータ・挙動そのものが、どれだけ人間にとって直接的に理解しやすいか。線形回帰や決定木のように、モデル自体の構造から予測の根拠を読み取れる性質を指すことが多い
Explainability(説明可能性) モデルの予測結果に対して、事後的に「なぜその予測になったか」を人間に説明できるか。モデル自体がブラックボックスであっても、別の手法を使って予測理由を後付けで説明することを含む

深層学習モデルは一般に Interpretability(内部構造自体の理解しやすさ)が低いため、Explainability(事後的な説明手法)によってこの弱点を補おうとする、という位置づけで捉えると整理しやすくなります。

なぜブラックボックス性が問題になるのか

  • 信頼性:予測の根拠が分からないモデルを、医療診断や自動運転のような重要な判断に使ってよいか、という信頼の問題
  • 公平性:モデルが性別や人種といった不適切な特徴量に基づいて差別的な判断をしていないかを検証する必要がある
  • 説明責任(アカウンタビリティ):誤った予測が重大な結果を招いた場合に、なぜその判断がなされたかを説明できなければ、責任の所在や再発防止策を検討できない

2. 可視化系の手法(CNN中心)

画像分類を行う CNN が、画像のどの領域に注目して判断したかをヒートマップとして可視化する手法群です。

CAM(Class Activation Mapping)

CNN の最終畳み込み層の出力(複数チャンネルの特徴マップ)に対して Global Average Pooling(GAP) を適用し、それを全結合層でクラススコアに変換するという構造を持つネットワークに対して使える手法です。

各チャンネルの特徴マップに、そのチャンネルが対象クラスの判定にどれだけ寄与したか(GAP後の全結合層の重み)を重みとして掛け合わせ、足し合わせることで、「画像のどの領域がそのクラスの判定に寄与したか」を表すヒートマップを得ます。

制約:CAM は「GAP層のあとに1層の全結合層でクラス分類する」というモデル構造を前提としているため、この構造を持たない一般的な CNN にはそのまま適用できません。

Grad-CAM(Gradient-weighted Class Activation Mapping)

CAM の「GAP層が必須」という制約をなくし、任意の CNN 構造に適用できるように一般化した手法です。

特徴マップの重要度を、GAP後の重みではなく、対象クラスのスコアを特徴マップで微分した勾配から求めます。

\[\alpha_k^c = \frac{1}{Z}\sum_i \sum_j \frac{\partial y^c}{\partial A_{ij}^k}\] \[L^c_{\text{Grad-CAM}} = \text{ReLU}\left(\sum_k \alpha_k^c A^k\right)\]
  • $y^c$:対象クラス $c$ のスコア(Softmax前)
  • $A^k$:$k$ 番目のチャンネルの特徴マップ
  • $\alpha_k^c$:勾配を空間方向($i,j$)で平均した値、つまりチャンネル $k$ が対象クラス $c$ の判定にどれだけ重要かを表す重み

最後に ReLU をかけているのは、「対象クラスのスコアを正の方向に押し上げる寄与を持つ領域」だけに着目したいためです。負の寄与(そのクラスらしくないと判断させる要因)を除外し、正の寄与だけをヒートマップとして可視化します。

Attention の可視化

Transformer 系のモデルでは、Attention が計算する Attention マップ($Softmax(QK^\top/\sqrt{D})$)自体を、「モデルがどのトークンに注目しているか」を表す一種の説明として可視化に用いることがあります。

ただし、Attention の重みをそのまま「モデルの判断根拠の説明」とみなすことには、研究上の議論があります。Attention 重みが高いことと、その入力要素が実際に予測結果に対して因果的に重要であることは必ずしも一致しない、という指摘(Attention is not Explanation 等の議論)があり、Attention の可視化はあくまで「モデルの挙動を理解する手がかりの1つ」として、慎重に解釈する必要があります。

3. モデル非依存の説明手法(Model-Agnostic)

CNN のような特定のアーキテクチャに依存せず、どんなモデル(勾配が取れないモデルも含む)にも適用できる説明手法です。予測結果だけを利用し、モデルの内部構造は問いません。

LIME(Local Interpretable Model-agnostic Explanations)

対象とする1つの予測について、その入力データの周辺を少しずつ変化させた(摂動させた)サンプルを多数作り、それぞれに対する元のモデルの予測結果を観測します。その結果に対して、局所的に(対象データの近傍でのみ)解釈可能な単純なモデル(例:線形モデル)を当てはめることで、「どの特徴量がその予測にどれだけ寄与したか」を近似的に説明します。

  • 「Local(局所的)」である理由:元の複雑なモデル全体をひとつの単純なモデルで近似することはできませんが、1つのデータ点の近傍だけに限定すれば、複雑な決定境界も線形近似で十分説明できる、という考え方に基づいています
  • モデルの内部(勾配や構造)を一切使わず、入出力の観測だけで説明を構成するため、真にモデル非依存(ブラックボックスのままでも適用可能)です

SHAP(SHapley Additive exPlanations)

ゲーム理論におけるShapley値の考え方を機械学習の特徴量の寄与度配分に応用した手法です。Shapley値はもともと、複数のプレイヤーが協力して得た成果(報酬)を、それぞれの貢献度に応じて公平に配分する方法を与える理論的な枠組みです。

SHAP ではこれを「特徴量」をプレイヤーに見立てて適用し、各特徴量がモデルの予測値にどれだけ寄与したかを、理論的に公平性が保証された形で配分します。具体的には、ある特徴量の寄与度は、その特徴量をあらゆる順序・組み合わせでモデルに加えていったときの予測値の変化を平均することで計算されます。

LIME との違い:LIME は局所的な線形近似というヒューリスティックな手法であるのに対し、SHAP はゲーム理論に基づいた公平性の公理(対称性、効率性など)を満たすことが数学的に保証されている点が特徴です。この理論的な裏付けの強さが SHAP の大きな利点とされます。

4. 手法の比較

手法 対象モデル 説明の粒度 必要な情報
CAM CNN(GAP層構造が必須) 個別の予測(画像単位) GAP後の重みのみ(勾配不要)
Grad-CAM CNN全般(構造の制約なし) 個別の予測(画像単位) 対象クラススコアの勾配
LIME モデル非依存 個別の予測 予測結果のみ(内部構造不要)
SHAP モデル非依存 個別の予測(全体的な傾向の集計も可能) 予測結果のみ(内部構造不要)

まとめ

  • Interpretability(モデル自体の透明性)と Explainability(事後的な説明可能性)は似て非なる概念であり、深層学習は前者が低いぶん後者の手法群で補われる
  • CAM・Grad-CAM は CNN の予測に対し、画像のどの領域に着目したかを勾配や重みからヒートマップとして可視化する手法であり、Grad-CAM は CAM の構造上の制約(GAP層必須)を取り除いた一般化にあたる
  • LIME・SHAP はモデルの内部構造を問わない説明手法で、LIME は局所的な線形近似、SHAP はゲーム理論のShapley値に基づく理論的に公平な寄与度配分という異なるアプローチを取る
  • Attention の重みを説明性の根拠として使う場合は、それが本当に予測の因果的な重要性を反映しているとは限らない点に注意が必要