まず分かる今回の変更
競馬AIの特徴量探索では、候補を何度も比較します。
問題は、その途中でFinal Holdoutまで見てしまうことです。
最後のテスト結果を見ながら候補を選べば、そのFinal Holdoutは独立した最終評価ではなく、選抜材料の一部になります。
今回は、探索と選抜をDevelopment側だけで完結させ、選抜候補を固定した後、正式Certificationを経て初めてFinal Holdoutを利用できる境界を実装・検証しました。
Task Evidence上では、6件を確認し、6件すべてを判定、未解決は0件でした。
なぜ必要なのか
たとえば特徴量Aと特徴量Bを比較するとします。
Development側の結果だけでAを選び、その選択を固定してからFinal Holdoutで確認するなら、Final Holdoutは最後の独立評価として機能します。
一方、Final HoldoutでAとBを見比べてから良い方を残せば、その時点でHoldoutを選抜に使っています。
今回の目的は、この境界を人の注意ではなく仕組みで守ることです。
今回確認したこと
Development内で特徴量探索と候補選抜のEvidenceを作れることを確認しました。
選抜候補はFinal Holdout利用前に固定され、その後の書き換えを拒否します。
正式Certificationがない状態ではFinal Holdout利用を拒否し、Certification後も評価できるのは事前に固定された選抜候補だけです。
また、Development側とFinal Holdout側の評価対象が重ならないこと、Final Holdout利用が明示的なCertificationに結びついて追跡できることも確認しました。
現在の状態
今回のTask Evidenceでは、検証対象6件をすべて確認し、未解決は0件です。
これにより、
Developmentで探索 → Development Evidenceで選抜 → 選抜結果を固定 → 正式Certification → Final Holdout
という順序を守る基盤ができました。
この仕組みの意味
特徴量探索では、試す回数が増えるほど「良く見える候補」を見つけやすくなります。
だからこそ、最後のテストまで探索材料にしてはいけません。
今回の仕組みは、Final Holdoutを本当に最後まで残し、
**選抜に使っていないデータでも判断が通用するか**
を確認できる状態を守るためのものです。
Evidenceと制約
今回確認したのは、Development探索・Selection Freeze・Certification前のFinal Holdout封印・固定候補だけのFinal Holdout評価・評価対象の分離・Certificationへの追跡です。
この工程だけで予測精度、回収率、収益性が改善したとは主張しません。
それらは今後、実際の特徴量比較とモデル検証のEvidenceで確認します。
次の工程
次はBaseline比較と特徴量の採用・棄却指標を定義します。
Final Holdoutを守ったうえで、次は「何が改善したら採用し、何が悪化したら棄却するのか」を固定します。