開発ログ

出馬表時点True Forward特徴量を実データで認証し、正本Registry基準でGapを再監査する

30秒で分かる今回の結論

競馬AIの過去検証に使うデータを、「そのレースの前日時点で本当に利用可能だったか」というStrict PIT基準で確認しました。

検証対象818件のうち、厳密に前日時点利用可能と証明できたものは0件。818件すべてが今回の基準ではlate-knowledgeと判定されました。

そのため、Strict True Forward認証は REJECTED_NOT_CERTIFIABLE としました。

これは特徴量が無価値という意味ではありません。現在のDBに「当時その値を取得済みだった」と証明できる履歴が残っていない、という意味です。

なぜ重要なのか

過去データが現在DBに存在していても、そのレース前に取得可能だったとは限りません。

この区別をしないと、過去検証では利用できるのに実戦では再現できない情報が混ざる可能性があります。

そこで今回は、精度や実戦成績の評価より先に、情報の利用可能時点を検証しました。

実測結果

  • 対象:818件
  • Strict PIT eligible:0件
  • late-knowledge:818件
  • authentic pre-cutoff source:確認できず
  • Strict PIT certification:REJECTED_NOT_CERTIFIABLE

さらに元データベース全体の時刻・取得履歴に関係する情報も調査しましたが、対象データについて前日締切以前の真正な取得元は確認できませんでした。

今回変えたこと

Historical Reconstructed ReplayとStrict True Forwardを正式に分離しました。

今後、過去データをルールに従って再構築した検証結果は、Strict Forwardの証拠として扱いません。

これにより、

「現在のDBから過去を再現できる」

ことと、

「当時、本当にその情報を持っていた」

ことを混同しないようにします。

現在の状態

Strict True Forward認証は通していません。

これは意図した判定です。

不確かな情報をTrue Forward扱いにせず、次工程ではHistorical Reconstructed Replay専用の検証へ進みます。

次

過去情報を再構築するルール、リーク除外、欠損、利用可能Feature Universeを明示した上で、再構築履歴による特徴量評価を行います。

良い検証結果を作るより先に、その検証結果を信じてよい条件を固定します。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。