開発ログ

Canonical評価ランナー

30秒でわかる概要

今回なにをした?

決定時点より後の市場情報を除外しました。価格ずれなどを反映した実効オッズを評価へ渡しました。予測から資金指標までを同じ評価結果へ束ねました。

なぜ必要?

各工程が個別に正しくても、同じ判断時点の情報と同じ市場条件で一本につながっていなければ、最初から最後まで再現可能な評価にならないためです。

何が変わった?

判断時点の情報を固定し、登録済みの判断基準で判断、市場条件を反映し、公式結果の確定から後続の評価まで同じ実行経路で追跡できるようになりました。

現在の状態

予測から判断・市場条件・結果確定・評価指標までを同じ評価の枠組みで再現・検証できる状態です。

詳細

予測が当たるだけでは足りない

競馬AIでは、予測確率だけを切り出して見ても実運用の強さは分かりません。どの時点の情報で判断したのか、どんなオッズや購入条件を想定したのか、結果をどう確定したのかまで同じ条件でつながっている必要があります。

今回つないだ範囲

今回の評価ルートでは、判断時点より後の情報を混ぜない再現、登録済みの基準による判断、市場条件を反映した購入想定、公式結果の確定、そこからの成績評価までを一つの流れにしました。

具体例

同じ予測確率でも、レース後に有利なオッズへ差し替えたり、買う基準をあとから変えたりすれば、見かけの成績はよくできます。今回の仕組みは、そうした後出しを避け、判断した時点の条件をそのまま最終評価まで引き継ぐためのものです。

確認できたこと

判断時点の再現から市場条件、結果確定、評価指標までが実際に同じ経路で通ることと、既存の境界を壊していないことを確認しています。データベースへの書き込みは行っていません。

まだ言えないこと

  • 今回はモデル学習やデータベースからの予測生成を行っていません。
  • 実運用の判断基準は、事前に明示登録されたルールが必要です。
  • 統計的信頼区間、ブートストラップ法、多重検定は次の工程で扱います。

次に確かめること

次は、この評価結果を統計的に見ても同じ傾向が残るのかを確認します。単発の結果ではなく、比較に耐えられる結果なのかを検証していきます。

Evidence Record

今回確定したこと

定義した境界・成果

  • RF023 Decision-Time ReplayをCanonical Runnerから実際に実行した
  • 暗黙の閾値を禁止しPolicy未登録時はHOLDするValue Decision Adapterを実装した
  • RF024 Market Execution SimulationをCanonical Runnerから実際に実行した
  • 公式finish_positionからTarget outcomeへ変換するSettlement境界を実装した
  • RF025/RF026を同じCanonical Evaluation結果へ接続した

許可されること / できること

  • 決定時点より後の市場情報を除外します。
  • slippage等を反映したeffective oddsを評価へ渡します。
  • 予測から資金指標までを同じ評価結果へ束ねます。

安全境界・防止策

禁止されること / 防止策

  • 決定後情報の混入を防ぎます。
  • 未登録閾値の勝手な採用を防ぎます。
  • 実馬券購入へ進むことを防ぎます。

実装・契約根拠

  • Task Evidenceと正式成果物を公開面の根拠として参照します。

検証結果

  • RF072 targeted tests:RF023/RF024実接続を含むEnd-to-End経路を確認しました。(結果:PASS)
  • RF023〜RF026 regression:既存境界を壊していないことを確認しました。(結果:PASS)
  • database write:データベース書き込みは行いません。(結果:NO)

未達・対象外

  • RF072はモデル学習やDBからのPrediction生成を行わずCanonical Prediction入力を受け取ります。
  • 実運用のDecision thresholdは明示登録Policyが必要です。
  • 統計的信頼区間・bootstrap・多重検定は後続RF073の責務です。

次工程

RF072のCanonical Evaluation出力をRF073の統計評価入力として使用します。

Evidence Stage

IMPLEMENTATION_COMPLETE_VALIDATED

内部管理情報

Task ID: RF_DEV_072_CANONICAL_EVALUATION_RUNNER_V1

Canonical Outcome Trace

  • RF023 Decision-Time ReplayをCanonical Runnerから実際に実行した
  • 暗黙の閾値を禁止しPolicy未登録時はHOLDするValue Decision Adapterを実装した
  • RF024 Market Execution SimulationをCanonical Runnerから実際に実行した
  • 公式finish_positionからTarget outcomeへ変換するSettlement境界を実装した
  • RF025/RF026を同じCanonical Evaluation結果へ接続した

全体ロードマップを見る →

← 開発ログへ戻る

掲載内容は、その時点の開発・検証記録です。将来の利益や的中を保証するものではありません。