30秒でわかる概要
前日予想用に整理したデータを、学習・検証へ戻してよいか全件監査しました。
対象は **418,869件**。
結果は、重複0件、結合欠損0件、モデル入力5項目の欠損行0件、情報取得時刻の欠損0件でした。
この範囲は、**再構成した過去データとして研究用の学習・時系列検証に利用可能**と認証しました。
ただし、「当時、本当に前日までに取得済みだった」と証明できる真正な前日時点情報は0件です。
そのため、実運用と完全に同じ条件とは認証していません。
何を確認したのか
前工程で認証した情報区分を維持したまま監査しました。
**真正な前日時点情報として認証できたものは0件のまま**です。
モデル入力として扱う5項目は次のとおりです。
- レース距離(race.distance_m)
- 馬場種別(race.surface)
- 競馬場コード(race.venue_code)
- 枠番(race_entry.frame_number)
- 馬番(race_entry.horse_number)
418,869件の整合性
全出馬データで確認した結果、
- レース×馬の重複:0
- レース情報との結合欠損:0
- モデル入力5項目の欠損行:0
- 情報取得時刻の欠損:0
でした。
データベースは読み取り専用で監査し、実行前後のハッシュも一致しています。
今回認証した範囲
認証したのは、
- 再構成した過去データを使ったモデル学習
- 再構成した過去データを使った時系列検証
です。
認証していないのは、
- 真正な前日時点データと同等であるという主張
- 明日の実運用と完全に同じ条件であるという主張
です。
なぜ線引きするのか
後から復元できた情報と、当時その時点で実際に取得済みだった情報は同じではありません。
ここを混ぜると、過去検証だけが強く見える可能性があります。
今回の成果は、性能を上げたことではなく、**どこまでなら正しく検証に使えるかを固定したこと**です。
次工程
次は認証済みの研究用データ範囲を使って、モデル検証へ戻ります。
モデル学習そのものは今回まだ実行していません。