分類問題

混合行列

  予測: Positive 予測: Negative
実際: Positive TP (True Positive) FN (False Negative)
実際: Negative FP (False Positive) TN (True Negative)
  • 正解率:$accuracy = \frac{(TP + TN)}{(TP + TN + FP + FN)}$
  • 適合率:$precision = \frac{TP}{(TP + FP)}$
  • 再現率:$recall = \frac{TP}{(TP + FN)}$
  • $F1-score(measure) = \frac{2 \times (Precision × Recall)}{(Precision + Recall)}$

上記の数値例で計算すると:

  • Accuracy = $(50 + 100) / 165 ≈ 0.909$
  • Precision = $50 / 55 ≈ 0.909$
  • Recall = $50 / 60 ≈ 0.833$

回帰問題

  • 平均絶対誤差 Mean Absolute Error (MAE)
  • 平均二乗誤差 Mean Squared Error (MSE)
  • 平均二乗誤差平方根 Root Mean Squared Error (RMSE)

モデルの評価

データの種類

  • 訓練データ:モデルの学習
  • 検証データ:ハイパーパラメータの調整
  • テストデータ:汎化性能検定

データ分割法

  • ホールドアウト法
  • k-分割交差検証法

過剰適合・過小適合

過剰適合(過学習)は学習では高い性能にも関わらずテストデータでは性能が低い状態を指します。
過小適合(未学習)は学習が足りていない状態を指します。

決定木

学習アルゴリズムの一つです。