30秒でわかる概要
ここでいう「特徴量」は、AIが予測するときに判断材料として使うデータのことです。たとえば、斤量やレース条件、血統から作った情報などが候補になります。
前回保留になった特徴量候補18件を、「データベースに存在するか」ではなく「前日の意思決定時点で本当に使えたか」という基準で再点検しました。
結果は、既に前日利用可能として確認済みが1件、項目ごとの公開タイミングを示す正式な根拠が必要なものが4件、加工・保存済みデータが8件、加工前の元データからの変換が必要なものが5件でした。
データベースに項目があるだけでは前日予測へ昇格させず、利用可能な時点まで証明してから使うための設計判断です。
現在地は、18件を5分類し、前日利用可能と確認済みの1件と追加の正式な根拠が必要な候補を分離した段階です。
具体例として、18件のうち1件は既存記録で確認できましたが、4件は項目ごとの公開タイミングを示す正式な根拠待ちとして保留しました。
なぜ必要だったのか
前日予測では、保存されているデータを無条件に使うことはできません。
対象レースの前日の意思決定時点で、その値がすでに公開・取得可能だったと確認できる必要があります。
前回の検証で前日利用可否が未確定として残った18件について、今回の検証ではその正式な根拠の種類を切り分けました。
分類結果
対象18件を5分類しました。
- 既に前日利用可能として確認済み:1件
- 項目ごとの前日利用を示す正式な根拠が必要:4件
- 加工・保存済みデータであり元データとしての正式な根拠ではない:7件
- 旧方式で加工されたデータであり元データとしての正式な根拠ではない:1件
- 加工前の元データからの変換が必要:5件
前日利用済みと確認できた1件は、馬が背負う斤量(entry.carried_weight)です。
一方、レースの格・グレード、年齢条件、性別条件、斤量ルールの4項目は、レース情報のテーブルが加工前の元データでも、項目ごとの公開タイミングが明確に確認できていないため保留しました。
何が変わったのか
前回の検証では18件が「前日時点の利用可否レビュー待ち」という一つの箱に残っていました。
今回の検証では、その18件を同じ扱いにせず、既存の確認、列単位正式な根拠待ち、加工・保存済みデータ、旧方式で加工されたデータ、加工前の元データからの変換という5種類へ分離しました。
これにより、前日利用可能と確認済みのものと、追加の証明が必要なものを混ぜずに次工程へ送れます。
検証記録
- 18件を5分類:確認完了
- 既に前日利用可能として確認済み:1件
- 項目ごとの前日利用を示す正式な根拠が必要:4件
- 投稿価値の再判定:重要な設計判断として投稿対象
- 次は、4項目の公開時点を示す正式な根拠を確認するまで保留としました。
この監査ではモデルを実行していません。
利益率や着順などの結果も読んでいません。
2025年・2026年の結果も使っていません。
データベースへの書き込みもありません。
未達・対象外
今回の結果は、予測性能や利益率の改善を示すものではありません。
18件すべてが前日予測で利用可能になったことも示していません。
列単位正式な根拠待ちの4件は、この時点では前日利用可能と確定していません。
加工・保存済みデータ 8件と加工前の元データ変換が必要な5件も、そのまま直接特徴量として昇格していません。
したがって、この結果だけから利益率、市場価格に対する優位性、予測精度改善を主張することはできません。
次に確かめること
次の検証では、レースの格・グレード、年齢条件、性別条件、斤量ルールの4項目について、前日の予想時点で利用可能だったことを項目ごとの正式な根拠で確認します。
「データベースにある」ではなく、「その時点で使えた」を証明してから次へ進めます。