今回の更新を簡単に
前回、Baseline勝率モデルを実データで評価しました。
今回は、そのBaseline自体が後から変わらないように、データ分割・特徴量・モデル選択・確率校正・評価指標を再現可能な形でFreezeしました。
16特徴量の定義と順序も固定し、Canonical SHA-256 fingerprintが一致しない再実行はPASSにしません。
これで今後、特徴量を追加したときに「何を変えた結果、Baselineから何が変わったのか」を同じ物差しで比較できます。
なぜ必要なのか
Baselineを改善の基準にするなら、そのBaselineが毎回同じ条件で再現できなければ意味がありません。
データ分割、特徴量の並び、校正方法、評価指標のどれかが変われば、改善の原因を切り分けられなくなります。
そこで今回は、Baseline構成そのものをFreezeしました。
固定したもの
今回の正式成果では、以下を固定しています。
- データ分割
- 特徴量の定義と順序
- 16特徴量の入力契約
- モデル選択条件
- 確率校正
- 評価指標
- 前回のDEVELOPMENT_TEST Baseline評価との結び付け
- FINAL_HOLDOUT未使用状態
再現性の判定
Baseline構成はCanonicalな形からSHA-256 fingerprintを生成します。
再実行時は完全一致が必要で、一致しなければFAIL CLOSEDです。
「ほぼ同じ」ではなく、「同じ比較原点を再現できた」と確認できることを条件にしました。
現在の状態
Task Substance Evidenceでは対象項目をすべて確認し、未解決なしでPASSしています。
今回のFreezeによって、今後の特徴量追加やモデル変更を同じBaselineに対して比較できる状態になりました。
FINAL_HOLDOUTは引き続き使用していません。
次へ
次は、この固定済みBaselineとFair Oddsを正式な比較原点として認証します。
その後は、特徴量を追加したときに予測がどう変わったかを、今回固定したBaselineを基準に検証できます。