30秒でわかる概要
今回なにをした?
今回のテーマは「予測を市場価格と比べ、買う・見送る判断へつなげる」です。 読者向け説明とは別に、以下へ証拠を整理します。
なぜ必要?
モデル研究で使ってよいPRE15データとLeakage防止境界は定義済みだったが、後続モデルが改善したかを比較するための実データBaseline値がまだ存在しなかった。
何が変わった?
PRE15 market probabilityだけを入力とする最小Baselineを実データで評価し、後続モデルが超えるべき再現可能な比較基準をEvidenceとして固定した。
現在の状態
検証完了です。確認できていないことは、確認済みとして扱いません。
詳細
Evidence Record
今回確定したこと
定義した境界・成果
- PRE15時点のmarket probabilityだけを使う最小Baseline Probability Modelを定義した
- 323レース・4211行の実データをREAD_ONLYで評価し、4105行で予測可能、106行をABSTAINとして分離した
- 後続モデル比較の基準としてBrier ScoreをEvidence化した
- 結果ラベルを予測入力へ混入させず、旧44特徴量もBaseline入力へ持ち込まない境界を固定した
許可されること / できること
- PRE15時点の市場確率を最小の確率予測基準として再現・評価できる(
PRE15 Market Probability Baseline):DEFINED_AND_EVALUATED - 後続モデルがBaselineを改善したかを同一指標で比較できる(
Promotion Reference):BRIER_SCORE_BASELINE_AVAILABLE
安全境界・防止策
禁止されること / 防止策
- 結果確定後のplace flagを予測入力へ使わない(
Post-Decision Leakage Prevention):PASS - 旧Baselineの44特徴量を現Authorityを越えて無断再利用しない(
Legacy Feature Overreach Prevention):PASS - SQLiteをREAD_ONLY URI + query_onlyで読み、DBを書き換えない(
Database Mutation Prevention):PASS
実装・契約根拠
- Evidenceに記録された契約・実装を参照
検証結果
- 確率範囲、ABSTAIN、Brier Score計算、結果ラベル分離を専用テストで確認(
Baseline Model Targeted Tests):PASS - READ_ONLY実データでBaselineを評価し、Brier Score=0.15039813209287076 を記録(
Real Data Evaluation):PASS - result_place_flagを評価専用とし、予測Feature利用を禁止(
Leakage Boundary):PASS
未達・対象外
- このTaskは高度な機械学習モデルを学習するTaskではない
- 本格的なCalibration実装はRF_DEV_020のAuthorityに残す
- BaselineはPRE15 market probabilityのみを使う最小比較基準である
- ABSTAIN対象行はBaseline指標の計算対象から除外する
次工程
次はRF_DEV_018 Feature Set V1 and Ablation Frameworkへ進み、このBaselineを比較基準として追加Featureの寄与を安全に検証できる枠組みを作る。
Evidence Stage
IMPLEMENTATION_COMPLETE_VALIDATED
内部管理情報
Task ID: RF_DEV_017_BASELINE_PROBABILITY_MODEL_V1