開発ログ

復旧したデータと特徴量を最終監査し、どこまでが学習・検証に使えるかを固定してモデル検証へ戻る

30秒でわかる概要

前日予想用に整理したデータを、学習・検証へ戻してよいか全件監査しました。

対象は **418,869件**。

結果は、重複0件、結合欠損0件、モデル入力5項目の欠損行0件、情報取得時刻の欠損0件でした。

この範囲は、**再構成した過去データとして研究用の学習・時系列検証に利用可能**と認証しました。

ただし、「当時、本当に前日までに取得済みだった」と証明できる真正な前日時点情報は0件です。

そのため、実運用と完全に同じ条件とは認証していません。

何を確認したのか

前工程で認証した情報区分を維持したまま監査しました。

**真正な前日時点情報として認証できたものは0件のまま**です。

モデル入力として扱う5項目は次のとおりです。

  • レース距離(race.distance_m)
  • 馬場種別(race.surface)
  • 競馬場コード(race.venue_code)
  • 枠番(race_entry.frame_number)
  • 馬番(race_entry.horse_number)

418,869件の整合性

全出馬データで確認した結果、

  • レース×馬の重複:0
  • レース情報との結合欠損:0
  • モデル入力5項目の欠損行:0
  • 情報取得時刻の欠損:0

でした。

データベースは読み取り専用で監査し、実行前後のハッシュも一致しています。

今回認証した範囲

認証したのは、

  • 再構成した過去データを使ったモデル学習
  • 再構成した過去データを使った時系列検証

です。

認証していないのは、

  • 真正な前日時点データと同等であるという主張
  • 明日の実運用と完全に同じ条件であるという主張

です。

なぜ線引きするのか

後から復元できた情報と、当時その時点で実際に取得済みだった情報は同じではありません。

ここを混ぜると、過去検証だけが強く見える可能性があります。

今回の成果は、性能を上げたことではなく、**どこまでなら正しく検証に使えるかを固定したこと**です。

次工程

次は認証済みの研究用データ範囲を使って、モデル検証へ戻ります。

モデル学習そのものは今回まだ実行していません。

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。