性能指標 | 基礎
分類問題
混合行列
| 予測: Positive | 予測: Negative | |
|---|---|---|
| 実際: Positive | TP (True Positive) | FN (False Negative) |
| 実際: Negative | FP (False Positive) | TN (True Negative) |
- 正解率:$accuracy = \frac{(TP + TN)}{(TP + TN + FP + FN)}$
- 適合率:$precision = \frac{TP}{(TP + FP)}$
- 再現率:$recall = \frac{TP}{(TP + FN)}$
- $F1-score(measure) = \frac{2 \times (Precision × Recall)}{(Precision + Recall)}$
上記の数値例で計算すると:
- Accuracy = $(50 + 100) / 165 ≈ 0.909$
- Precision = $50 / 55 ≈ 0.909$
- Recall = $50 / 60 ≈ 0.833$
回帰問題
- 平均絶対誤差 Mean Absolute Error (MAE)
- 平均二乗誤差 Mean Squared Error (MSE)
- 平均二乗誤差平方根 Root Mean Squared Error (RMSE)
モデルの評価
データの種類
- 訓練データ:モデルの学習
- 検証データ:ハイパーパラメータの調整
- テストデータ:汎化性能検定
データ分割法
- ホールドアウト法
- k-分割交差検証法
過剰適合・過小適合
過剰適合(過学習)は学習では高い性能にも関わらずテストデータでは性能が低い状態を指します。
過小適合(未学習)は学習が足りていない状態を指します。
決定木
学習アルゴリズムの一つです。