30秒でわかる概要
今回なにをした?
前日予想の土台になる出馬情報について、実データを基礎から棚卸ししました。レース・馬の件数だけでなく、レースIDから日付へ正しくたどれるかまで確認しています。
結果
**420,611行、30,159レース、53,043頭を確認し、30,159レースすべての日付を解決しました。未解決レースは0件です。**
なぜ必要?
出馬情報が大量に存在していても、レースや日付との結び付きが曖昧なら、前日予想の再現検証にはそのまま使えないためです。
現在の状態
基礎カバレッジを確認できたため、次は正規化とID整合を行い、「存在するデータ」から「前日予想で使えるデータ」へ進めます。
実測したデータ
- 出馬情報:420,611行
- distinct race:30,159
- distinct horse:53,043
- 日付範囲:2014-01-05〜2026-09-20
- 日付解決済みレース:30,159
- 日付未解決レース:0
- 欠損レース候補:0
- 欠損日付候補:0
何が変わったのか
これまでは、出馬情報の存在だけでは「いつの、どのレースの情報なのか」を前日予想の検証基盤として十分に固定できませんでした。
今回、レースIDからレース日へたどる経路を実測し、対象30,159レースについて日付軸をすべて解決しました。
これによって、後続の正規化・Point-in-Time認証・特徴量再構築を、推測ではなく確認済みの基礎データから始められます。
なぜモデルより先にやるのか
モデル性能や予測結果を比較するとき、入力側に欠損や時点のズレがあると、改善理由そのものが分からなくなります。
特に前日予想では、「その時点で使えた情報だったか」が重要です。
そのため今回はモデルを変更せず、まず出馬情報の基礎カバレッジと日付軸を確認しました。
今回主張しないこと
この検証だけで予測精度やモデル性能が改善したとは主張しません。
今回確定したのは、後続検証へ進むための出馬情報の基礎カバレッジです。
次工程
次は出馬情報を正規化し、レース・馬・騎手などのID整合と欠損理由を確定します。
その後、前日時点で利用可能だった情報を認証し、特徴量を再構築してモデル検証へ戻ります。
Evidence
reports/revenue_first/task_substance_evidence/rf_dev_129_24a_race_entry_source_recovery_and_coverage_audit_v1_substance_evidence_v1.json
reports/revenue_first/rf_dev_129_24a_race_entry_source_recovery_and_coverage_audit_v1_objective_evidence_v1.json
reports/revenue_first/rf_dev_129_24a_race_entry_source_recovery_and_coverage_audit_v1_empirical_audit_v1.json
Safety
- Database access:READ_ONLY
- Database write:NO
- 完了済み取得の再実行:禁止