30秒でわかる概要
今回なにをした?
Phase 13以降の開発を、Baseline構築と継続改善に分ける正式ロードマップを確定しました。
Phase 13では、データから予測・判断・評価までを測定可能なEnd-to-End Baseline V1として完成させます。
Phase 14以降では、特徴量・モデル・学習方法・市場比較・購入判断を1実験ずつ比較し、予測指標だけでなく経済評価を含む経済的評価も行う方針です。
なぜ必要?
Baselineがないまま改善を続けると、数字が変わっても「何が効いたのか」「本当に改善したのか」を判定できません。
また、長期間の過去データと、まだ蓄積期間の短いPRE15データを同じ役割で扱うと、実運用に近いEvidenceへ過剰適合する危険があります。
何が変わった?
モデル開発では長期間の過去データを主力として活用し、時間順分割と独立Holdoutを維持します。
PRE15は継続蓄積し、繰り返しチューニングする開発データではなくForward Validation Evidenceとして扱います。
購入時点価格が確認できない評価を、実購入時の経済評価として主張しない境界も明示しました。
現在の状態
ロードマップ上の確認対象10件はすべて判定済みで、未解決は0件です。
Phase 13以降のBaseline・改善・評価・公開の基本ルールが確定しました。
Phase 13:End-to-End Baseline V1
Phase 13の目的は、最高性能のモデルを作ることではありません。
今後の改善を比較できる共通基準として、最低限の測定可能なPrediction Lifecycleを完成させることです。
Baseline完成後は、同じ評価基準で改善版と比較できるようにします。
長期間の過去データ活用
長期間の過去データはモデル開発の主要資産として活用します。
ただし、時間順を崩さずに分割し、独立Holdoutを残します。
これにより、過去データを最大限利用しながら、繰り返し評価による過剰適合を抑えます。
PRE15 Forward Validation
PRE15データは今後も蓄積します。
一方で、現時点では開発データと同じように何度も調整へ使用しません。
過去データで作ったモデルや判断ルールが、新しく積み上がるPRE15環境でも成立するかを確認するForward Validation Evidenceとして扱います。
経済的評価
Phase 14以降の比較では、予測指標だけでなく経済的評価も必須にします。
特に経済評価の変化を重要な比較対象とします。
ただし、過去の最終オッズなどを使った評価と、実際の購入時点価格で再現できる経済評価は同一視しません。
購入価格を確認できない場合、実購入時の経済評価としては主張しません。
改善方法
改善は原則としてOne Question / One Experiment / One Decisionで行います。
1つの問いに対して1つの実験を行い、数字を比較し、採用または不採用を決めます。
公開時も、可能な範囲で次の流れを示します。
- 何を試したか
- 数字がどう変わったか
- なぜそうなったと考えるか
- 採用したか
確定した10項目
- PHASE_13_END_TO_END_BASELINE:BASELINE_V1_REQUIRED
- ECONOMIC_EVALUATION:ECONOMIC_EVALUATION_REQUIRED
- FALSE_DISCOVERY_GUARD:FALSE_DISCOVERY_GUARD_DEFINED
- HISTORICAL_FOUR_YEAR_UTILIZATION:HISTORICAL_DATA_MAXIMIZED
- PRE15_FORWARD_VALIDATION:LIVE_PRE15_PRESERVED
- DATA_MATURITY_GATE:MATURITY_GATED
- EXPERIMENT_DISCIPLINE:ONE_QUESTION_ONE_EXPERIMENT_ONE_DECISION
- PUBLICATION_DEFAULT:PUBLICATION_DEFAULT_PRESERVED
- PURCHASE_PRICE_CLAIM:PURCHASE_PRICE_CLAIM_GUARDED
- VERSION_AUTHORITY:VERSION_AUTHORITIES_SEPARATED
確認対象10件、確認済み10件、未解決0件です。
Task SubstanceのStatus、Coverage、Unresolved、Evidence ReferencesもPASSしています。
公開方針
基本は1タスク1投稿を維持します。
Phase 13ではBaseline構築の各成果を公開し、Phase 14以降は特徴量やモデルなどの実験単位で、数字の変化と採否を追える投稿へ寄せます。
制限
この工程では、予測指標・経済評価の改善実績そのものは確定していません。
また、過去データ上の評価だけを実購入時の経済評価として扱いません。
今回確定したのは、今後それらを比較・改善するための開発ロードマップと評価境界です。
次工程
次はPhase 12の再基礎化監査全体を正式認証します。
その後、Phase 13のEnd-to-End Baseline V1構築へ進みます。
関連リンク
競馬AI計画 全体ロードマップ: https://keiba-ai-plan.pages.dev/roadmap/