開発ログ

Baselineの再現可能な構成を凍結する

今回の更新を簡単に

前回、Baseline勝率モデルを実データで評価しました。

今回は、そのBaseline自体が後から変わらないように、データ分割・特徴量・モデル選択・確率校正・評価指標を再現可能な形でFreezeしました。

16特徴量の定義と順序も固定し、Canonical SHA-256 fingerprintが一致しない再実行はPASSにしません。

これで今後、特徴量を追加したときに「何を変えた結果、Baselineから何が変わったのか」を同じ物差しで比較できます。

なぜ必要なのか

Baselineを改善の基準にするなら、そのBaselineが毎回同じ条件で再現できなければ意味がありません。

データ分割、特徴量の並び、校正方法、評価指標のどれかが変われば、改善の原因を切り分けられなくなります。

そこで今回は、Baseline構成そのものをFreezeしました。

固定したもの

今回の正式成果では、以下を固定しています。

  • データ分割
  • 特徴量の定義と順序
  • 16特徴量の入力契約
  • モデル選択条件
  • 確率校正
  • 評価指標
  • 前回のDEVELOPMENT_TEST Baseline評価との結び付け
  • FINAL_HOLDOUT未使用状態

再現性の判定

Baseline構成はCanonicalな形からSHA-256 fingerprintを生成します。

再実行時は完全一致が必要で、一致しなければFAIL CLOSEDです。

「ほぼ同じ」ではなく、「同じ比較原点を再現できた」と確認できることを条件にしました。

現在の状態

Task Substance Evidenceでは対象項目をすべて確認し、未解決なしでPASSしています。

今回のFreezeによって、今後の特徴量追加やモデル変更を同じBaselineに対して比較できる状態になりました。

FINAL_HOLDOUTは引き続き使用していません。

次へ

次は、この固定済みBaselineとFair Oddsを正式な比較原点として認証します。

その後は、特徴量を追加したときに予測がどう変わったかを、今回固定したBaselineを基準に検証できます。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。