開発ログ

基準となる確率モデルを構築する

30秒でわかる概要

今回なにをした?

今回のテーマは「予測を市場価格と比べ、買う・見送る判断へつなげる」です。 読者向け説明とは別に、以下へ証拠を整理します。

なぜ必要?

モデル研究で使ってよいPRE15データとLeakage防止境界は定義済みだったが、後続モデルが改善したかを比較するための実データBaseline値がまだ存在しなかった。

何が変わった?

PRE15 market probabilityだけを入力とする最小Baselineを実データで評価し、後続モデルが超えるべき再現可能な比較基準をEvidenceとして固定した。

現在の状態

検証完了です。確認できていないことは、確認済みとして扱いません。

詳細

Evidence Record

今回確定したこと

定義した境界・成果

  • PRE15時点のmarket probabilityだけを使う最小Baseline Probability Modelを定義した
  • 323レース・4211行の実データをREAD_ONLYで評価し、4105行で予測可能、106行をABSTAINとして分離した
  • 後続モデル比較の基準としてBrier ScoreをEvidence化した
  • 結果ラベルを予測入力へ混入させず、旧44特徴量もBaseline入力へ持ち込まない境界を固定した

許可されること / できること

  • PRE15時点の市場確率を最小の確率予測基準として再現・評価できる(PRE15 Market Probability Baseline):DEFINED_AND_EVALUATED
  • 後続モデルがBaselineを改善したかを同一指標で比較できる(Promotion Reference):BRIER_SCORE_BASELINE_AVAILABLE

安全境界・防止策

禁止されること / 防止策

  • 結果確定後のplace flagを予測入力へ使わない(Post-Decision Leakage Prevention):PASS
  • 旧Baselineの44特徴量を現Authorityを越えて無断再利用しない(Legacy Feature Overreach Prevention):PASS
  • SQLiteをREAD_ONLY URI + query_onlyで読み、DBを書き換えない(Database Mutation Prevention):PASS

実装・契約根拠

  • Evidenceに記録された契約・実装を参照

検証結果

  • 確率範囲、ABSTAIN、Brier Score計算、結果ラベル分離を専用テストで確認(Baseline Model Targeted Tests):PASS
  • READ_ONLY実データでBaselineを評価し、Brier Score=0.15039813209287076 を記録(Real Data Evaluation):PASS
  • result_place_flagを評価専用とし、予測Feature利用を禁止(Leakage Boundary):PASS

未達・対象外

  • このTaskは高度な機械学習モデルを学習するTaskではない
  • 本格的なCalibration実装はRF_DEV_020のAuthorityに残す
  • BaselineはPRE15 market probabilityのみを使う最小比較基準である
  • ABSTAIN対象行はBaseline指標の計算対象から除外する

次工程

次はRF_DEV_018 Feature Set V1 and Ablation Frameworkへ進み、このBaselineを比較基準として追加Featureの寄与を安全に検証できる枠組みを作る。

Evidence Stage

IMPLEMENTATION_COMPLETE_VALIDATED

内部管理情報

Task ID: RF_DEV_017_BASELINE_PROBABILITY_MODEL_V1

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。